Dream-RSI: агенты DeepMind улучшаются без переобучения
Google DeepMind опубликовал Dream-RSI — метод, при котором агент записывает историю попыток и переигрывает её с разными стратегиями, не запуская новые дорогостоящие прогоны.
Google DeepMind опубликовал Dream-RSI — метод, который помогает AI-агентам улучшать стратегию без переобучения модели. Агент записывает историю своих попыток, а потом «проигрывает» их с другими настройками, чтобы понять, что сработало бы лучше — без новых дорогостоящих запусков. На задаче оптимизации кода число попыток сократилось с 550 до 317, а время выполнения — с 3 587 мс до 2 931 мс.
Для агентных пайплайнов Dream-RSI полезен там, где агент делает много попыток подряд. Вместо 51 200 запусков базового метода стратегию находят за 317 — разница в расходе токенов очевидна. Я бы следил за тем, появится ли что-то подобное в Claude Code: агенты, которые оптимизируют код в цикле, именно на этом и теряют деньги.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи