Рекурсивное самосовершенствование AI-агентов: новый подход
Рекурсивное самосовершенствование становится всё более критичным для автономных AI-агентов, где прогресс зависит от открытия высокоценных решений в сложных предметных областях. Ключевым двигателем этого процесса является эффективное исследование, однако управление и улучшение стратегий исследования остаётся главным узким местом.
Существующие системы сталкиваются с фундаментальной дилеммой: фиксированные стратегии не адаптируются при масштабировании пространств поиска, а оптимизация политики в реальном времени требует навигации по огромным метапространствам поиска при задержанной и дорогостоящей обратной связи на долгосрочных траекториях.
Как работает Dream-RSI
Коллектив авторов во главе с Tong Zheng предложил Dream-RSI — фреймворк для масштабируемого и рекурсивно самосовершенствующегося исследования. Легковесный слой оркестровки делает исследование явным и программируемым, не изменяя базового кодирующего агента.
Центральная идея подхода в том, что накопленная история открытий может служить симулятором повторного проигрывания над реализованным пространством поиска. Путём "мечтания" в симуляторе повторного проигрывания, построенном из исторических деревьев открытий, Dream-RSI обеспечивает немедленную и низкозатратную off-policy обратную связь для оценки и совершенствования политик исследования без повторных дорогостоящих онлайн-оценок.
Улучшенная политика затем заново развёртывается в реальном времени, чтобы стимулировать дальнейшее открытие, непрерывно расширяя пул симуляторов в цикле самосовершенствования.
Результаты и применение
В экспериментах на задачах инженерии алгоритмов, математической оптимизации и инженерии GPU-ядер Dream-RSI достигла сопоставимого или улучшенного качества открытий при существенном снижении затрат открытия в нескольких сценариях.
Recursive self-improvement is becoming increasingly vital for autonomous AI agents, where progress hinges on discovering high-value solutions across complex domains. The driver of this process is effective exploration, however, managing and improving exploration strategies remains a major bottleneck.