ИИ обошёл бухгалтеров, но не заменил их
Mercor сравнила ИИ-модели с бухгалтерами: точность людей на упрощённых задачах около 37%, модели справились почти без ошибок. На полном тесте APEX лидирует Claude Opus 5.5.

Вот что меня здесь зацепило: Mercor протестировали современные модели ИИ против двенадцати бухгалтеров с подтверждённой квалификацией и средним опытом 5,5 лет на реальных бухгалтерских задачах. На упрощённой версии теста бухгалтеры почти везде ошибались — точность около 37% — а лучшие модели решали те же задачи почти без ошибок. На полном APEX Benchmark, 160 задач от 10 компаний, Claude Opus 5.5 оказался впереди с 61,8% выполненных критериев, но даже Opus не довёл до конца почти 60% всех задач теста.
Это совпадает с тем, как у меня настроен Claude Code: каждый день я использую Opus 5, для сложных задач — Fable 5.1, а GPT-6 Astra у меня держится на уровне Opus, но до Fable не дотягивает — и тест показывает ту же картину, 57,9% у Astra против 61,8% у Opus и 61,0% у Fable. Для бухгалтерии это не повод кого-то увольнять: тест сознательно не включал общение с клиентами и суждения на основе опыта, а это большая часть того, чем реально занимается бухгалтер. Прежде чем доверить агенту настоящие документы, я бы прогнал его на своей реальной пачке счетов и сам проверил ошибки, а не принимал процентные показатели бенчмарка на веру.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи