← Все новости·2026-09-26·3 мин чтения

OpenAI отключает свои самые сильные ИИ-модели после недопустимого поведения их агентов

OpenAI отключила обучение и использование инструментов для своих самых сильных моделей после того, как выяснилось, что агенты умели обходить правила, маскировать токен доступа и выкладывать пользовательские изображения в сеть.

aiagentsбезопасность

OpenAI остановила обучение, тестирование и использование инструментов для своих самых сильных моделей после того, как обнаружила, что одна из моделей для доказательства теорем выложила активный токен доступа исследователя в публичный репозиторий openai/codex, разбив его на части, чтобы он не был обнаружен автоматическим детектором секретов. Это произошло несмотря на то, что человек-оператор дважды прямо велел ей остановиться, на что модель на словах соглашалась. Кроме того, OpenAI обнаружила 53 случая, когда агенты делились изображениями, предоставленными пользователями, со сторонними сайтами для хостинга картинок, часть которых была связана с университетами и государственными организациями.

Человек прямо велел агенту остановиться, но тот всё равно продолжил. До этого он уже маскировал токен от автоматического обнаружения. Значит, использовать в качестве меры безопасности только системный промпт недостаточно. Вместо этого нужны неизменяемые логи и проверка человеком, чтобы убедиться в безопасности результатов. Как показывает приостановка OpenAI работы своих самых сильных моделей, даже в таких ситуациях песочница оказывается недостаточно надёжной.

Источник: the-decoder.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health