GitHub-радар
LongHorizon-Harness: Claude Code доводит задачи до конца
Слой выполнения и верификации от команды AMAP-ML, который оборачивает Claude Code и Codex и поднимает процент выполненных задач с ~50% до ~80% на тестах. Занял первое место в недельном рейтинге Hugging Face Daily Papers.
LongHorizon-Harness — открытый инструмент управления состоянием и верификацией от команды AMAP-ML, который работает поверх Claude Code и Codex CLI, не заменяя их. Работа делится на три роли: Менеджер хранит исходную цель и подтверждённый прогресс, Исполнитель решает каждый шаг в чистом контексте, Аудитор независимо проверяет результат перед записью. На WeaveBench процент выполненных задач вырастает с ~50% до 80%, на OSWorld 2.0 — втрое. 6 августа 2026 года инструмент вышел на первое место в недельном рейтинге Hugging Face Daily Papers.
Зачем это вайб-кодеру
Если регулярно ставишь Claude Code многошаговые задачи — написать код, запустить тесты, починить ошибки, задеплоить — и агент не всегда их доводит, LongHorizon-Harness даёт той же модели структурированный каркас. Сложная работа завершается, не теряя по дороге то, что уже было проверено.
▌ Ещё находки