ИИ-агенты профессионального уровня теперь выполняют 16% фриланс-работы
Согласно новому отчёту, за последний год ИИ-агенты в шесть раз увеличили свою способность выполнять работу профессионального качества на коммерческих фриланс-проектах.
Новый отчёт Center for AI Safety (CAIS) и Scale Labs количественно оценил, насколько хорошо ИИ-агенты справляются с работой профессионального качества на коммерческих фриланс-проектах. С помощью Remote Labor Index исследователи оценили работу ИИ-агентов на 240 реальных проектах общей стоимостью 144 000 долларов, которые ранее выполнили 358 проверенных фрилансеров. За восемь месяцев производительность ИИ-агентов выросла с 2,5% до 16,1%, то есть улучшилась в шесть раз меньше чем за год.
Лучший результат показала Claude Fable 5 — 16,1%, за ней следуют Claude Opus 4.8 (8,3%) и GPT-5.5 (6,3%). Задачи включали 3D-моделирование, CAD, архитектуру, графический дизайн, видео и анимацию, аудио, анализ данных и разработку веб-приложений.
Один из ключевых выводов отчёта в том, что ИИ-судьи оценивают ИИ-агентов на 2,5–3 раза мягче, чем эксперты-люди. Из-за этого автоматизированные оценки в бенчмарках, скорее всего, завышают реальные способности агентов. Но даже с учётом этого тенденция говорит о том, что ИИ-агенты быстро совершенствуются, и, возможно, мы не так уж далеки от следующей значимой вехи.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи