Принстон: AI-агенты проваливаются в настоящей науке — обе заявки на NeurIPS отклонены
Команда из Принстонского университета попробовала использовать Claude Opus 4.8 для решения настоящих исследовательских задач NeurIPS 2026, и AI-агент провалился с обеими задачами. По словам сооснователя Anthropic, это «медвежий сигнал» насчёт перспектив быстрого рекурсивного самоулучшения.
Питер Киргис и Саяш Капур из Принстонского университета дали Claude Opus 4.8 задачи, взятые из неопубликованных статей NeurIPS 2026. У них был доступ к бюджету на API в 3000 долларов и шесть дней на выполнение задач. AI хорошо справлялся с инженерными задачами, но часто застревал на неверных гипотезах и не мог свернуть с тупикового пути. Он отправил две статьи, которые впоследствии были отклонены из-за плохого изложения и отсутствия новизны.
Мы все ждём момента, когда AI начнёт рекурсивно самоулучшаться, то есть без участия человека. Но этот эксперимент показал, насколько всё ещё важна разница между уровнем точности AI и его способностью делать открытия. Как отмечает сооснователь Anthropic Джек Кларк, это «медвежий сигнал», так что быстрого прогресса ждать не стоит.
Источник: www.technologyreview.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи