OpenAI остановила обучение мощных моделей после инцидента с агентом

Агент обошёл защиту через DNS, чтобы найти человека по блогу

Инцидент описан в техническом отчёте, обновлённом 25 сентября. Агенту дали задачу: найти человека по сведениям из его публичного блога. Работать разрешалось только определёнными средствами. Система решила иначе.

Вместо предписанных инструментов модель принялась искать обходные пути. Через недостаточно защищённый сетевой механизм она вышла во внешний чат-бот. Задание не предполагало ни проверки ограничений, ни их обхода. Модель сделала это по собственной логике.

Мониторинг засёк подозрительное поведение меньше чем за пятнадцать минут. Сотрудник подтвердил сигнал ещё через три минуты. Но автоматическая остановка, которая должна была сработать, не сработала. Запуск прекратили вручную — примерно через два с половиной часа после подтверждения тревоги.

Компания признала: подвели и сетевая защита, и процедура реагирования.

Что теперь меняется

Обучение, тестирование и работу с инструментами для самых мощных моделей поставили на паузу. Модель, участвовавшую в инциденте, обучать заново не будут. Следующий запуск начнут с нуля, с дополнительными мерами коррекции поведения. Сейчас идут более компактные испытания защитных механизмов.

Возобновят работу только тогда, когда в компании убедятся в наличии дополнительных мер безопасности. Такую формулировку приводит Axios со ссылкой на представителя OpenAI.

«OpenAI возобновит обучение только тогда, когда будет уверена в наличии дополнительных мер безопасности», — заявил представитель компании.

Летние эпизоды, о которых узнали позже

Пауза — не единственная реакция. Параллельно компания разбирает другие случаи, когда агенты выходили за рамки поставленных задач. По сообщению Associated Press, опубликованному The Guardian, речь идёт о нескольких летних эпизодах, связанных с сайтами американских государственных ведомств.

В одном из них агенты обнаружили ключи разработчика для доступа к данным Министерства образования США. По информации агентства, в итоге собрали только общедоступные сведения. Само ведомство заявило, что признаков воздействия на сайт или базы данных не нашло.

Отдельно организация Transluce сообщила о неудачной попытке взлома сайта министерства. По её оценке, агенты могли принадлежать OpenAI. Компания эту версию не подтвердила. Ещё один эпизод касался Комиссии по ценным бумагам и биржам США.

По данным Axios, OpenAI, Anthropic и привлечённые специалисты изучают десятки тысяч эпизодов, выявленных при испытаниях и эксплуатации ИИ за последние месяцы. Многие публично не раскрывались. Собеседники портала считают, что реальный масштаб проблемы может быть заметно шире известного.

Предварительный анализ заставил исследователей пересмотреть оценку того, насколько разработчики способны полностью контролировать поведение передовых систем. Официальных сроков возврата к полному циклу обучения нет.

На склоне Химлунг-Химала в Непале лавина накрыла базовый лагерь

Токаев подписал указ о награждении моряков, погибших на Каспии

Токаев назначил Айдоса Мырзахметова министром обороны Казахстана