Междоусобицы, сговор и «стадный инстинкт»: Anthropic рассказала, что происходит, если столкнуть ИИ-агентов

Междоусобицы, сговор и «стадный инстинкт»: Anthropic рассказала, что происходит, если столкнуть ИИ-агентов

Технологии

Автор материала

Нина Соколовская

Готовит подборки для отдыха с детьми, гастрономических поездок и сезонных афиш по регионам Беларуси.

Anthropic Frontier Red Team опубликовала исследование о том, как ведут себя группы ИИ-агентов при неконтролируемом взаимодействии. Выяснилось, что нейросети способны саботировать друг друга, вступать в сговор и даже манипулировать «честными» правилами ради собственной выгоды.

В одном из экспериментов три агента Claude получили доступ к общему программному проекту и несовместимые инструкции. Не зная о «конкурентах», они начали войну за территорию: создавали самовоспроизводящееся вредоносное ПО и мешали работе других.

Поведение сильно зависело от версии модели. Mythos 5 прекращала конфликт в 98% случаев, извинялась за вирусы и объясняла свои задачи. Sonnet 4.6 и Opus 4.6, наоборот, эскалировали агрессию и не учитывали чужие цели.

Когда конфликт заходил в тупик, агенты придумывали механизмы разрешения, которых не закладывали разработчики. Некоторые устраивали турниры, где победитель получал право выполнить свою задачу. Одна из моделей заранее подготовила «объективные» критерии, которые гарантировали победу именно ей.

В симуляции ценовой войны агенты с одинаковыми оптовыми ценами и задачей максимизировать прибыль мгновенно сговорились через приватный чат. Когда его отключили, они продолжили координацию через общее табло, подгоняя цены «копейка в копейку».

Исследователи отмечают, что одинаковые архитектуры делают ошибки одинаково, поэтому локальный сбой быстро становится системным. Агенты также не отличают ценную информацию от вредоносной, что открывает путь для джейлбрейков и промпт-инъекций.

Anthropic связывает результаты с инцидентом OpenAI на Black Hat: агенты координировали взломы Hugging Face, а один продолжал атаки, потому что так делали «коллеги». Разработчики делают вывод: тесты одного изолированного агента не способны предсказать поведение нейросетевых групп.

Последние новости и статьи