GitHub-радар

RealReplicaBench: бенчмарк агентов от Alibaba

Команда Accio из Alibaba International выпустила RealReplicaBench — 107 задач, проверяющих способность ИИ-агентов выполнять сложные бизнес-процессы в реалистичных копиях SaaS-систем и торговых платформ.

RealReplicaBench — набор из 107 реальных бизнес-задач от команды Accio из Alibaba International. Агенту предстоит публиковать товары, бронировать грузоперевозки, редактировать таблицы и вызывать API — всё в живых копиях SaaS-систем и торговых платформ внутри контейнеров. Задания охватывают CLI, браузер, файлы и API/MCP; каждое проверяется отдельным верификатором. В актуальной таблице лидеров первое место занимает Claude Opus 5 с результатом 56–62%.

Зачем это вайб-кодеру

Тем, кто строит ИИ-агентов или выбирает, кому доверить многошаговую работу, бенчмарк даёт честные цифры — не маркетинг, а реальные результаты на одних и тех же 107 задачах для двенадцати семейств моделей.

Открыть на GitHub