Навигатор, такси и облако: почему сбой задел миллионы пользователей
Сначала перестал открываться навигатор. Потом зависло такси. Затем посыпались жалобы на облачные сервисы и стриминг. К вечеру стало понятно: проблема не у отдельных пользователей, а у всей инфраструктуры разом.
Причина выяснилась быстро. Под удар попали две площадки компании — центр обработки данных в Сасово Рязанской области и объекты в Калуге. Обе локации считаются ключевыми для работы сервисов Яндекса.
Площадку в Сасово повредили серьёзно. Начался пожар, и центр обработки данных полностью остановил работу. Спустя несколько часов пришла очередь Калуги — там физически уничтожили несколько серверных модулей. Персонал не пострадал.
ЦОД в Сасово — одна из крупнейших площадок компании. Часть оборудования выведена из строя, и это не тот случай, когда всё чинится за пару дней.
Что именно встало
Дата-центры Яндекса — это не просто стойки с серверами. Это то, что в фоновом режиме держит навигатор, такси, стриминг, облачные хранилища. Пока всё работает, никто об этом не думает. Когда перестаёт — останавливается половина привычных дел.
Бизнес почувствовал первым. Сотни тысяч компаний используют технологии корпорации для своих процессов — от логистики до внутренних систем. У кого-то встала доставка, у кого-то — рабочие задачи. У обычных людей сорвались поездки, не открылись нужные файлы, не приехала машина.
Локально досталось и жителям Калуги. Местный провайдер Maxnet зафиксировал повреждение магистральных линий связи на правом берегу города. У абонентов временно пропал домашний интернет — не из-за самой атаки, а из-за порванных каналов, которые шли через пострадавшие узлы.
Сейчас на обеих площадках работают экстренные службы и инженеры компании. В Яндексе открыто говорят: восстановление — задача колоссальной сложности. Точные сроки не называет никто. Идёт оценка ущерба, нагрузку перекидывают на уцелевшие мощности.
В компании сообщили, что благодарят сотрудников и просят пользователей о понимании, а сводки обещают публиковать по мере поступления данных.
По оценке участников рынка, прежде сбои такого масштаба вызывались авариями или ошибками в коде — их устраняли за часы. Здесь речь о физическом разрушении оборудования. А значит, и сроки другие.
Что будет дальше — зависит от того, насколько быстро удастся заменить уничтоженные модули и перераспределить потоки. Пока компания держит паузу и обещает сводки. Пользователям остаётся следить за обновлениями и держать под рукой резервные способы добраться до нужной точки.