GitHub-радар

Alibaba тестирует ИИ-агентов на 107 реальных сценариях

RealReplicaBench — это набор из 107 многошаговых задач на бизнес-процессы: работа с браузером, использование интерфейса командной строки (CLI), редактирование файлов и таблиц, вызов API/MCP — выполняемых в новых контейнерах с детерминированной или ИИ-ассистированной проверкой.

RealReplicaBench, разработанный командой Accio из Alibaba International, — это публичный бенчмарк для многошаговых задач на бизнес-процессы: работа с браузером, использование интерфейса командной строки (CLI), редактирование файлов и таблиц, вызов API/MCP — выполняемых в новых контейнерах с детерминированной или ИИ-ассистированной проверкой. Этот бенчмарк в последнее время набирает популярность, поскольку даёт прозрачный и воспроизводимый способ сравнивать ИИ-агентов на реальных задачах, а не на тривиальных примерах.

Зачем это вайб-кодеру

Когда выбираете ИИ-агента или модель для автоматизации своих бизнес-процессов, используйте этот бенчмарк, чтобы получить честное сравнение и воспроизводимый результат на основе выполнения задач. Загляните в публичный лидерборд, чтобы посмотреть, как Claude, GPT, Gemini и другие справляются с этими 107 задачами.

Открыть на GitHub