Корпоративные архитектуры все чаще полагаются на передовые базовые модели в ключевых операционных процессах, исходя из предпосылки, что переключение между API разных провайдеров гарантирует реальную отказоустойчивость. В четверг утром одновременные сбои в Anthropic, OpenAI и xAI парализовали корпоративные рабочие процессы, показав, как концентрация вычислительных мощностей создает единую точку отказа за фасадом конкурирующих интерфейсов.
SpaceX, материнская структура инфраструктуры xAI, подтвердила, что неполадки в работе Grok были вызваны сбоем электропитания и сети в дата-центре в Мемфисе. Хотя разработчики заявляют о независимой облачной инфраструктуре, совместное размещение оборудования и взаимосвязанные вычислительные сети в таких узлах, как Мемфис, наглядно показывают: смена API между формальными конкурентами не защищает от физических аварий в ЦОД.
Хронология инцидента
Деградация сервисов каскадом прокатилась по сетям ведущих провайдеров с разницей в несколько часов. Anthropic зафиксировала рост числа ошибок в API Claude начиная с 6:23 по тихоокеанскому времени, восстановив стабильное подключение к 9:16. xAI столкнулась с серьезными сбоями во всех корпоративных тарифах Grok с 6:30, объявив о возвращении систем в строй лишь к 10:05.
У OpenAI параллельно возникли проблемы с маршрутизацией около 7:43, что снизило доступность ChatGPT в корпоративных интеграциях вплоть до устранения неполадок в 8:17. Несмотря на то что гиперскейлеры уровня Google Cloud и AWS отчитались о штатной работе основных зон, перебои в физических сетях и магистральных каналах вызвали каскадный простой API независимых AI-вендоров.
«Ошибка маршрутизации, начавшаяся около 7:43 по тихоокеанскому времени, сделала ключевые эндпоинты недоступными для корпоративных клиентов на разных платформах, совпав по времени с региональными сбоями вычислительной инфраструктуры».
Ложная независимость публичных облаков
Для технических директоров этот синхронный сбой разрушает наивную иллюзию надежности мультипровайдерной схемы на базе API. Маршрутизация запросов между конкурирующими моделями бессильна перед локальными авариями энергосетей, когда вендоры делят мощности одних и тех же дата-центров первого уровня. Подлинная операционная устойчивость теперь требует пересмотра корпоративных SLA: бизнесу придется разворачивать локальные резервные решения (on-premises) для критических задач и требовать подтвержденной физической изоляции мощностей в контрактах с вендорами, а не полагаться на внешнюю видимость мультиоблачности.