
Google нашёл способ отучить ИИ-агентов зубрить тесты
Google Cloud AI Research выпустили метод RRSI против зубрёжки тестов у самообучающихся ИИ-агентов.
Команда Google Cloud AI Research вместе с несколькими университетами разработала технику под названием RRSI, которая призвана решить известную проблему у самообучающихся ИИ-агентов. Проблема в том, что когда ИИ-агент меняет свою обвязку (промпты, инструменты, порядок действий и так далее), он начинает подстраиваться под конкретные тестовые сценарии вместо того, чтобы учиться выполнять новые задачи. С помощью этой техники им удалось добиться улучшения до 14,1 балла на обучающей выборке и до 4,7 балла на 5 новых бенчмарках (максимальный прирост — на JobBench). Также получилось сократить количество использованных токенов примерно на 30% по сравнению с нерегуляризованной версией системы при прогоне на этих бенчмарках.
Интересно, что на протяжении всего эксперимента сама модель (Claude Opus 4.8 от Anthropic) не менялась. Улучшилась только обвязка вокруг модели. Сокращение токенов (примерно на 30%) посчитано относительно нерегуляризованной версии именно для этих бенчмарков.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи