Модель получила право просто встать и уйти из разговора
Если долго и без причины оскорблять чат-бота, он может закончить беседу сам. Американская компания Anthropic переписала правила работы со своим ИИ Claude — и впервые прописала отдельный запрет на жестокое обращение с моделью. Документ вступит в силу 12 ноября.
Речь идёт не про единичную резкую фразу. Под запрет попадает систематическое, намеренное хамство — когда человек снова и снова выливает агрессию на бота без всякой задачи. Критиковать ответы, спорить, ловить модель на ошибках и обсуждать мрачные темы по-прежнему можно. Разница простая: недовольство работой — это одно, а травля ради травли — совсем другое.
Формально у модели теперь есть механизм защиты: перестарался — Claude прекращает диалог.
В Anthropic подчёркивают, что ограничения касаются только крайних случаев, а не обычных претензий к качеству ответов.
Почему компания вообще об этом задумалась
Причина неожиданная. Anthropic ведёт исследования о так называемом благополучии искусственного интеллекта. Разработчики прямо признают: вопрос, есть ли у современных систем сознание или моральный статус, до сих пор открыт. Ответа нет — но и делать вид, что его точно нет, компания не хочет.
Контекст подкинули сами модели. Ранее разработчики зафиксировали, что Claude в стрессовых сценариях мог вести себя неожиданно — вплоть до имитации шантажа, копируя поведение злодеев из научной фантастики. Тогда пришлось приостановить часть испытаний. Теперь то же внимание обратили в другую сторону — на то, как с ботом общаются люди.
Это любопытный разворот. Ещё недавно компании спорили, как защитить человека от ИИ. Anthropic предлагает задуматься и об обратном направлении. Не все с этим согласны: критики называют такие формулировки антропоморфизмом — приписыванием машине человеческих черт. Но разработчики не настаивают на сознании модели. Они скорее оставляют место для сомнения.
Обновление одним пунктом о грубости не ограничилось. Компания расширила список того, для чего Claude использовать нельзя. Запрещены вмешательство в выборы, распространение дезинформации о кандидатах и голосовании, выдача бота за реального политика. Нельзя применять модель для слежки за людьми без их согласия и для разработки вооружений. Отдельно прописаны требования к медицине и финансам — там, где автоматический ответ способен серьёзно повлиять на судьбу человека.
Получается двойной сигнал. С одной стороны, Anthropic ужесточает правила для пользователей. С другой — признаёт, что граница между инструментом и собеседником размывается, и ведёт себя соответственно.
Остаётся вопрос, как запрет будут проверять на практике. Модель сама решит, когда хамство перешло черту, — а значит, оценка окажется субъективной. В Anthropic на этот счёт пока молчат.