← Все новости·2026-08-01·4 мин чтения

AI-агенты ускоряют науку в 60 раз — и тихо ошибаются в расчётах

OpenAI протестировала AI-агентов на переписывании научного ПО в биологии: ускорение до 60 раз, но агенты не умеют проверить правильность науки за кодом.

aicodingresearchагенты

OpenAI совместно с академическими партнёрами провела исследование из восьми кейсов: AI-агенты переписывали реальное устаревшее научное ПО в биологии. Тестировались GPT-5.5, GPT-5.2, Claude Code и Codex. Результаты по скорости впечатляют: программа RustQC для анализа данных ускорилась более чем в 60 раз (с 15 часов до 15 минут), HelixForge — в 59,6 раза в целом и в 98,6 раза на ключевом вычислительном шаге.

Точность при этом сохранялась высокой. Переписанный выравниватель rustar-aligner совпадал с оригинальным STAR на 99,8% в одиночных и 99,9% в парных считываниях. Агенты справлялись с инженерной задачей: ускорить, переписать, оптимизировать унаследованный код.

Критическая проблема вскрылась в третьем кейсе — bayesm. Агент переписал библиотеку на Rust, код работал и выглядел убедительно, но содержал перепутанные параметры и неправильно масштабированные коэффициенты. Ошибка всплыла лишь после длительной калибровки. Исследователи прямо назвали агентов «красноречивыми, убедительными и уверенно неправыми — способами, которые легко пропустить».

Разделение труда проясняется: человек определяет задачу, критерии успеха и методы валидации — агент реализует. Без обязательной экспертной проверки доверять «быстрому» результату в науке нельзя. Агент — инженер, но не учёный.

Источник: the-decoder.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health