Исследователь Anthropic показал, как ИИ может улучшать сам себя

Исследователь Anthropic показал, как ИИ может улучшать сам себя

Технологии

Автор материала

Нина Соколовская

Готовит подборки для отдыха с детьми, гастрономических поездок и сезонных афиш по регионам Беларуси.

Исследователь из компании Anthropic Чэнь Юэ-Хань представил систему Automated Alignment Researcher (AAR). Она автономно исправляет поведенческие проблемы ИИ без участия человека.

Система работает по циклу: ищет научную литературу, предлагает метод, тренирует модель 30 минут и повторяет. Удачные решения сохраняются, неудачные отбрасываются.

В эксперименте AAR за несколько часов исправила все десять заданных проблем безопасности. Лучший вариант системы превзошел предложения опытных исследователей в среднем за шесть часов.

Стоимость работы ИИ составила около 4 долларов в час против 150 долларов в час для человека. Результаты опубликованы 28 августа 2026 года.

Система работает только в рамках заданных критериев и требует качественных исходных данных. Это шаг к рекурсивному самоулучшению ИИ, когда модели смогут улучшать собственное обучение.

В статье Anthropic отмечается, что AAR может сделать процесс выравнивания ИИ более практичным в ближайшей перспективе. Авторы сравнивают систему с работой человека-исследователя: AAR обходится дешевле и быстрее находит решения.

Ограничения метода: AAR эффективна только при наличии четких бенчмарков и актуальной научной литературы. Поддержка этих ресурсов остается задачей человека.

Последние новости и статьи