← Все новости·2026-09-17·3 мин чтения

Беркли: фреймворк агента влияет на стоимость, а не на качество

Берклинцы протестировали 21 пару «модель + фреймворк»: успешность отличается в пределах ±2%, а стоимость — до 5 раз. Claude Code обошёлся вдвое дороже минималистичного Pi при разнице в результате 1,1%.

aiagentscoding-agentscost

Исследователи Беркли протестировали 21 пару «модель + фреймворк» на задачах SWE-bench Lite и Terminal-Bench 2.0: семь моделей, три фреймворка — Claude Code, Codex CLI и Pi. Разброс успешности оказался в пределах ±2%, а стоимость за одни и те же результаты отличалась до 5 раз. На Fable 5.1 Claude Code обошёлся в 2 раза дороже минималистичного Pi — при разнице в успешности всего 1,1%.

Pi работает с четырьмя инструментами — read, write, edit, bash — и дотягивается до Парето-фронта на обоих бенчмарках. Разница в цене объясняется контекстом: Claude Code закачивает в начало сессии в 10 раз больше токенов, чем Pi. Для изолированных задач с чётким условием более простой фреймворк — реальная экономия; для длинных сессий с контекстом проекта разница оправдана.

Источник: harnesstax.github.io

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health