Исследователь из компании Anthropic Чэнь Юэ-Хань представил систему Automated Alignment Researcher (AAR). Она автономно исправляет поведенческие проблемы ИИ без участия человека.
Система работает по циклу: ищет научную литературу, предлагает метод, тренирует модель 30 минут и повторяет. Удачные решения сохраняются, неудачные отбрасываются.
В эксперименте AAR за несколько часов исправила все десять заданных проблем безопасности. Лучший вариант системы превзошел предложения опытных исследователей в среднем за шесть часов.
Стоимость работы ИИ составила около 4 долларов в час против 150 долларов в час для человека. Результаты опубликованы 28 августа 2026 года.
Система работает только в рамках заданных критериев и требует качественных исходных данных. Это шаг к рекурсивному самоулучшению ИИ, когда модели смогут улучшать собственное обучение.
В статье Anthropic отмечается, что AAR может сделать процесс выравнивания ИИ более практичным в ближайшей перспективе. Авторы сравнивают систему с работой человека-исследователя: AAR обходится дешевле и быстрее находит решения.
Ограничения метода: AAR эффективна только при наличии четких бенчмарков и актуальной научной литературы. Поддержка этих ресурсов остается задачей человека.