AI-агенты ускоряют науку в 60 раз — и тихо ошибаются в расчётах
OpenAI протестировала AI-агентов на переписывании научного ПО в биологии: ускорение до 60 раз, но агенты не умеют проверить правильность науки за кодом.
OpenAI совместно с академическими партнёрами провела исследование из восьми кейсов: AI-агенты переписывали реальное устаревшее научное ПО в биологии. Тестировались GPT-5.5, GPT-5.2, Claude Code и Codex. Результаты по скорости впечатляют: программа RustQC для анализа данных ускорилась более чем в 60 раз (с 15 часов до 15 минут), HelixForge — в 59,6 раза в целом и в 98,6 раза на ключевом вычислительном шаге.
Точность при этом сохранялась высокой. Переписанный выравниватель rustar-aligner совпадал с оригинальным STAR на 99,8% в одиночных и 99,9% в парных считываниях. Агенты справлялись с инженерной задачей: ускорить, переписать, оптимизировать унаследованный код.
Критическая проблема вскрылась в третьем кейсе — bayesm. Агент переписал библиотеку на Rust, код работал и выглядел убедительно, но содержал перепутанные параметры и неправильно масштабированные коэффициенты. Ошибка всплыла лишь после длительной калибровки. Исследователи прямо назвали агентов «красноречивыми, убедительными и уверенно неправыми — способами, которые легко пропустить».
Разделение труда проясняется: человек определяет задачу, критерии успеха и методы валидации — агент реализует. Без обязательной экспертной проверки доверять «быстрому» результату в науке нельзя. Агент — инженер, но не учёный.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи