Две зоны из четырёх легли, базы данных переключились не все: что теперь с Yandex Cloud
Пользователи облачных сервисов «Яндекса» узнали о проблемах раньше, чем компания успела что-то объяснить. Виртуальные машины не поднимались, часть баз данных отвечала только на чтение, запись в хранилище отваливалась. Позже на статус-борде Yandex Cloud появилось официальное подтверждение: инфраструктура дата-центра во Владимире повреждена, объект остановлен полностью.
Атака произошла ночью. Беспилотник ударил по площадке, где размещено оборудование. Пострадавших нет, на месте работают профильные службы. До Владимира под удар попал дата-центр в Сасово Рязанской области — там пожар затронул часть инфраструктуры.
Самое неприятное для клиентов — география последствий. Из четырёх зон доступности, на которые обычно опираются корпоративные клиенты, выпали сразу две: ru-central1-a и ru-central1-b. Это не просто «часть сервисов недоступна». Это значит, что отказоустойчивые схемы, которые компании строили с расчётом на две зоны, перестали работать как задумано.
Что устояло, а что нет
Консоль управления и программный интерфейс Yandex Cloud Console и API продолжают отвечать. Виртуальные машины Compute доступны в зонах ru-central1-d и ru-central1-e. Кластеры Managed Service for Kubernetes, развёрнутые в двух уцелевших зонах, работают штатно. Но если мастер-узел кластера находился в одной из выпавших зон — сервис не функционирует.
С базами данных сложнее. Большинство отказоустойчивых кластеров MDB переключились автоматически. Однако часть из них сейчас работает только на чтение. Какие-то остаются недоступными вовсе. Хранилище S3 данные на чтение отдаёт, но с записью возможны перебои.
Сервис мониторинга Yandex Monium лежит. Container Registry и управление доступом Identity and Access Management работают. Часть сервисов безопасности и Yandex AI Studio доступна лишь частично. Каналы связи с техподдержкой нестабильны — что особенно некстати, когда клиентам нужно срочно перевозить ресурсы на внешние площадки.
«Пользователям рекомендовано задействовать альтернативные планы по восстановлению ресурсов на внешних площадках» — такая формулировка появилась на статус-борде компании.
На статус-борде компания рекомендовала клиентам задействовать альтернативные планы на внешних площадках.
Похожая ситуация была в Сасово. Тогда пожар затронул часть инфраструктуры, но обошлось без пострадавших. Сейчас сценарий повторяется с поправкой на масштаб: дата-центр во Владимире обслуживает клиентов Yandex Cloud.
Команда Yandex Cloud продолжает восстановление. Сроки не называются. Для бизнеса, который держит там продакшен, это означает одно: нужно срочно решать, ждать или переезжать. Второе — дороже, но предсказуемее.