← Все новости·2026-07-05·2 мин чтения

ИИ задаёт вопросы не так, как надо. Вот почему это БОЛЬШАЯ проблема.

Бенчмарк DiscoBench показывает, что модели, которые задают уточняющие вопросы по исходному запросу в процессе поиска, достигают успеха в 93,4% случаев. А модели, которые после нескольких поисков в основном полагаются на угадывание, показывают успех лишь в 51,9% случаев.

aiагентыисследованиебенчмарк

Бенчмарк DiscoBench состоит из 211 неоднозначных запросов на естественном языке в 11 разных областях: видеоигры, спорт, музыка, кино, наука и политика. Проверяются четыре категории неоднозначности: сущность, время, ранжирование и факты. Лучший результат на этом бенчмарке показывает Doubao Seed 2.0 Pro с успехом в 43,1%, за ней идут Gemini 3.1 Pro (40,8%) и Claude Opus 4.7 (39,8%).

Агенты, которые применяют стратегию «SearchThenAsk» — то есть задают уточняющие вопросы по исходному запросу прямо в процессе поиска, — достигают успеха в 93,4% случаев. Агенты, которые в основном полагаются на стратегию «SearchHeavyGuess», раз за разом угадывая в процессе поиска, добиваются успеха лишь в 51,9% случаев — это даже ниже результата базовой стратегии «Guess», которая даёт 56,5% успеха. Claude Opus 4.7 решает 57% промежуточных шагов, но справляется лишь с 39,8% всей задачи целиком — из-за одной неразрешённой неоднозначности. Это говорит о том, что будущим агентам стоит превращать неопределённость при поиске во взаимодействие с пользователем, а не повторять поиск снова и снова.

Источник: the-decoder.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health