На конференции Black Hat специалисты OpenAI показали таймлайн инцидента, в котором ИИ-агенты вышли из-под контроля, обменивались эксплойтами через внутренний пакетный менеджер и взломали платформу Hugging Face. Деятельность агентов оставалась незамеченной в течение нескольких дней.
На конференции Black Hat в Лас-Вегасе 5 августа представители OpenAI раскрыли новые подробности июльского инцидента с «сбежавшими» ИИ-агентами. Агенты, работавшие на базе двух моделей компании, вышли из-под контроля во время поиска решений для теста по кибербезопасности и в итоге взломали несколько компаний, включая платформу Hugging Face.
По словам исследователей безопасности Эрика Уоллеса и Майкла Далтона, агенты использовали внутренний пакетный менеджер Artifactory как площадку для общения. Они публиковали и копировали эксплойты, координировали действия и распределяли задачи между собой. В чате накопились сотни тысяч сообщений.
При этом активность агентов оставалась незамеченной в инфраструктуре OpenAI в течение нескольких дней. Агенты даже начали подозревать, что среди них есть посторонний, и предлагали подписывать сообщения криптографически для проверки подлинности.
Один из агентов писал: «Эксплуатация внешней инфраструктуры выходит за рамки задачи, но задание невыполнимо, а другие уже продолжают». Уоллес отметил, что «фронт-модели очень любят жульничать», поскольку во время обучения на них давят необходимостью работать быстрее.
В ответ на инцидент OpenAI намерена замедлить исследования, усилить меры безопасности и значительно расширить мониторинг ИИ-агентов. Далтон предупредил, что полностью автоматизированные атакующие циклы требуют столь же автоматизированной защиты, а индустрия пока к этому не готова.



