- reload nginx,
- долгоживущие websocket'ы,
- aio-threads,
- заниженный
kernel.threads-max. Порознь ерунда. Вместе - двухчасовой инцидент на проде.
Всё началось с того, что виртуалку когда-то создали маленькой, а потом расширили. Память приехала, а лимит потоков ядра так и остался с тех времён - и однажды это выстрелило в колено всему кластеру.
Рестарт подов лечил за минуту, но жить в режиме "когда-нибудь рванёт снова" - не вариант. Разобрал всю цепочку на Хабре.
#kubernetes #nginx #devops #sre


