← Все новости·2026-09-13·3 мин чтения

Real-SWE: лучший ИИ-агент решил 38,8% задач на реальном коде компаний

Новый тест Specific Labs проверил ИИ-агентов на закрытом коде настоящих компаний: лучший результат 38,8%, а дорогая попытка не гарантирует успеха.

aiagentscodingbenchmark

Specific Labs выпустила Real-SWE — тест ИИ-агентов не на учебных задачах, а на закрытом коде настоящих компаний, который лаборатория лицензировала. Лучший результат у Fable 5.1 в Claude Code: 38,8% решённых задач, дальше GPT-6 Astra с 33,8% и Gemini 3.8 Flash с 31,2%. Попытка у Fable 5.1 стоит $6,96, у Gemini 3.8 Flash — $2,50, и авторы прямо пишут: дороже не значит успешнее.

Как вайбкодер я читаю это так: даже лучший агент на живом коде закрывает меньше двух задач из пяти, поэтому проверка результата — часть юнит-экономики, а не лишняя строка. И считать стоит цену решённой задачи, а не одной попытки: дешёвый прогон, который чаще промахивается, легко выходит дороже.

Источник: withspecific.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · Генеральный директор digital health-платформы · ИИ-трансформация