GitHub-радар

Auto-BenchMax: результат LLM на агентных бенчмарках вдвое выше

Открытый пайплайн для синтеза обучающих данных, который удваивает результат языковой модели на бенчмарках tool-use и агентных задач. Одна итерация подняла Qwen3-Coder-30B на MCP-Atlas с 19,1 до 40,4 — более чем вдвое от базового уровня.

Auto-BenchMax — открытый пайплайн от разработчика 'sunny-glow' для синтеза обучающих данных, которые удваивают результат LLM на бенчмарках tool-use и агентных задач. Репозиторий (часть документации на китайском) включает весь пайплайн, скрипты обучения (Qwen3-Coder-30B через axolotl и DeepSpeed ZeRO-3) и первую итерацию синтетических данных из 1312 примеров. На публичном бенчмарке MCP-Atlas одна итерация подняла счёт с 19,1 до 40,4. Пайплайн использует две парадигмы: Execute-then-Extract для правил-бейзд бенчмарков и Construct-then-Verify для LLM-оценок. Запускается через Claude Code одной инструкцией.

Зачем это вайб-кодеру

Если вы дообучаете модель для агентных задач или работы с инструментами, этот репозиторий даёт воспроизводимый путь к удвоению результата на бенчмарках — с открытыми данными, кодом и средой.

Открыть на GitHub