Хотим немного рассказать о том, что происходило за кулисами последние сутки и как наша команда решала последствия крупной аварии на одном из ключевых узлов связи в Европе.
Сейчас работа сети полностью стабилизирована. Если у вас всё ещё наблюдаются проблемы с подключением — пожалуйста, напишите в техническую поддержку.
👨🏻🔧 Как развивались события с нашей стороны
05:40 — система мониторинга обнаружила массовую недоступность европейской части инфраструктуры из РФ. Одновременно мониторинг из Европы начал фиксировать проблемы со связностью в направлении России.
05:44 — автоматически отправлен Alarm дежурному инженеру.
06:18 — определена предполагаемая причина аварии и проблемный участок маршрута.
06:20 — в усиленный режим переведена вся команда технической поддержки.
06:25 — к устранению последствий подключились программисты, системные администраторы и backend-инженеры.
07:10 — начался обмен технической информацией с OVH и другими участниками инфраструктуры. Параллельно команда прорабатывала варианты полного обхода аварийного участка.
08:10 — начался автоматический перевод пользователей на резервные маршруты в обход проблемного магистрального узла.
09:40 — под аварийную схему были выделены дополнительные мощности: 100 Гбит/с пропускной способности и 40 выделенных серверов для развертывания новых маршрутов.
10:50 — началось поэтапное подключение дополнительных резервных каналов. Изначально существующий резерв справлялся с нагрузкой, однако из-за огромного объема перенаправленного трафика его возможностей стало недостаточно.
В отдельные часы через нашу инфраструктуру проходило до 57 ТБ трафика в час.
Полное развертывание, тестирование и включение новой резервной схемы заняло более 20 часов.
👨🏻🔧 Что происходило на стороне аварийного дата-центра
05:33 — фиксируются первые значительные потери пакетов на маршрутах через FR5.
05:41 — на площадке обнаруживается проблема, связанная с контуром системы охлаждения.
06:32 — операторы инфраструктуры фиксируют рост температуры в технических залах.
07:25 — температура достигает критических значений, начинаются массовые обрывы соединений и отключения оборудования.
07:26 — источник утечки локализован, начинаются аварийные работы с системой охлаждения.
08:09 — значительная часть оборудования на площадке становится недоступна.
09:38 — продолжается устранение последствий аварии: откачка воды, осушение помещений и восстановление инженерных систем.
10:30 — к работам подключаются профильные инженеры систем охлаждения и другой критической инфраструктуры.
Такие аварии хорошо показывают, насколько современный интернет зависит не от одного сервера или одного оператора, а от огромной цепочки дата-центров, магистральных сетей и узлов связи.
Наша задача в такой ситуации — не ждать восстановления чужой инфраструктуры, а максимально быстро построить обходной маршрут и вернуть связь пользователям.
Именно поэтому последние сутки команда практически без остановки расширяла резерв, поднимала новые серверы и перестраивала маршрутизацию.
Сейчас всё работает в штатном режиме. Спасибо команде за огромную работу, а вам — за терпение и поддержку ❤️
наш бот для подключения только тут
❗️❗️❗️@blacktemple_space_bot
Сайт только тут 🏐 BLACKTEMPLE.ONLINE







