DevOps не горит: post #109 — TG.ME

Yandex Neuro Scale
Коллеги, всем привет! =)
Прошел Yandex Neuro Scale, ииии там я тоже отметился с докладом "Балансировка на грани: как мы распределяем нагрузку в Kubernetes-кластерах"
Как я и говорил в самом выступлении, я много “покапитанил” и в целом не рассказал ничего особо нового. Многие вещи, про которые я говорил, все уже давно используют у себя в проде.
Основная цель моего доклада — рассказать про наши приключения с повышением отказоустойчивости: мы хотим “жить” даже если потенциально, в моменте, одна зона доступности может испариться.
25 минут доклада на земле равняются 2 кварталам работы 4х инженерных команд =)
Так что всё это приключение точно было не из лёгких =)
ЗЫ — в кулуарах был вопрос: “А как там выживать, если есть ноды/нод-группы с тейнтами?”. Ответил, что “у нас такого нет, и проблем тоже нет =)”. В целом мой ответ валиден. Если посмотреть на него более детально, то нод-группы с тейнтами не особо-то и отличаются от обычных нод-групп. Нод-группы с тейнтами мы просто дублируем между зонами и в случае проблем эвакуируем нагрузку в другую зону.
ЗЫЫ — Yandex Neuro Scale персонально для меня — achievement unlocked
👨‍🦯
ЗЫЫЫ — Да, отказоустойчивость, да, мы максимально живучие в случае больших инфра-проблем, но ценой чего? Мы тут запустили небольшой трек по оценке: “А всегда и везде нам нужна такая отказоустойчивость?”. По результатам вернусь =)
🔥7❤3👍2⚡1👏1
September 29, 2025 727 2