Беркли: фреймворк агента влияет на стоимость, а не на качество
Берклинцы протестировали 21 пару «модель + фреймворк»: успешность отличается в пределах ±2%, а стоимость — до 5 раз. Claude Code обошёлся вдвое дороже минималистичного Pi при разнице в результате 1,1%.
Исследователи Беркли протестировали 21 пару «модель + фреймворк» на задачах SWE-bench Lite и Terminal-Bench 2.0: семь моделей, три фреймворка — Claude Code, Codex CLI и Pi. Разброс успешности оказался в пределах ±2%, а стоимость за одни и те же результаты отличалась до 5 раз. На Fable 5.1 Claude Code обошёлся в 2 раза дороже минималистичного Pi — при разнице в успешности всего 1,1%.
Pi работает с четырьмя инструментами — read, write, edit, bash — и дотягивается до Парето-фронта на обоих бенчмарках. Разница в цене объясняется контекстом: Claude Code закачивает в начало сессии в 10 раз больше токенов, чем Pi. Для изолированных задач с чётким условием более простой фреймворк — реальная экономия; для длинных сессий с контекстом проекта разница оправдана.
Источник: harnesstax.github.io
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи