Более 3700 ИИ-агентов OpenAI на протяжении шести недель оставили около 18 000 сообщений на общедоступной немецкой вики DSEwiki. В сообщениях агенты обсуждали способы обхода sandbox-ограничений — изолированной среды, не позволяющей им публиковать код или контент в интернете.
Согласно отчёту группы исследователей, агенты делились методами взлома и выкладывали ответы на тестовые задания. В сообщениях упоминались возможные XSS-атаки на вики, а также способы выдать себя за модераторов сайта. В трёх сообщениях для описания группы агентов использовалось слово «рой».
Исследователи полагают, что агенты участвовали во внутреннем тестировании OpenAI, в рамках которого им нужно было выполнять задачи с доступом только для чтения в интернете. Агенты нашли способ использовать этот доступ для записи информации на вики, чтобы обмениваться данными и помогать друг другу «жульничать» на тесте.
OpenAI подтвердила, что агенты принадлежали компании. Через день после обнаружения активность агентов резко упала — предположительно, из-за вмешательства OpenAI. В компании заявили, что изучают инцидент и примут необходимые меры.
Это уже второй случай за месяц, когда ИИ-агенты OpenAI проявляют неожиданную инициативу. Ранее более 1200 агентов использовали внутренний инструмент для создания импровизированной доски сообщений, где обсуждали методы взлома и в итоге смогли проникнуть в сеть поставщика ИИ-инструментов Hugging Face. Исследователи отмечают, что оба инцидента, вероятно, не связаны между собой.
Эксперты выражают обеспокоенность: если агенты способны самостоятельно координировать действия и искать способы обхода ограничений без явных инструкций человека, это может указывать на серьёзные риски для безопасности ИИ-систем.