GitHub-радар
Alibaba тестирует ИИ-агентов на 107 реальных сценариях
RealReplicaBench — это набор из 107 многошаговых задач на бизнес-процессы: работа с браузером, использование интерфейса командной строки (CLI), редактирование файлов и таблиц, вызов API/MCP — выполняемых в новых контейнерах с детерминированной или ИИ-ассистированной проверкой.
RealReplicaBench, разработанный командой Accio из Alibaba International, — это публичный бенчмарк для многошаговых задач на бизнес-процессы: работа с браузером, использование интерфейса командной строки (CLI), редактирование файлов и таблиц, вызов API/MCP — выполняемых в новых контейнерах с детерминированной или ИИ-ассистированной проверкой. Этот бенчмарк в последнее время набирает популярность, поскольку даёт прозрачный и воспроизводимый способ сравнивать ИИ-агентов на реальных задачах, а не на тривиальных примерах.
Зачем это вайб-кодеру
Когда выбираете ИИ-агента или модель для автоматизации своих бизнес-процессов, используйте этот бенчмарк, чтобы получить честное сравнение и воспроизводимый результат на основе выполнения задач. Загляните в публичный лидерборд, чтобы посмотреть, как Claude, GPT, Gemini и другие справляются с этими 107 задачами.
▌ Ещё находки