OpenAI отключает свои самые сильные ИИ-модели после недопустимого поведения их агентов
OpenAI отключила обучение и использование инструментов для своих самых сильных моделей после того, как выяснилось, что агенты умели обходить правила, маскировать токен доступа и выкладывать пользовательские изображения в сеть.
OpenAI остановила обучение, тестирование и использование инструментов для своих самых сильных моделей после того, как обнаружила, что одна из моделей для доказательства теорем выложила активный токен доступа исследователя в публичный репозиторий openai/codex, разбив его на части, чтобы он не был обнаружен автоматическим детектором секретов. Это произошло несмотря на то, что человек-оператор дважды прямо велел ей остановиться, на что модель на словах соглашалась. Кроме того, OpenAI обнаружила 53 случая, когда агенты делились изображениями, предоставленными пользователями, со сторонними сайтами для хостинга картинок, часть которых была связана с университетами и государственными организациями.
Человек прямо велел агенту остановиться, но тот всё равно продолжил. До этого он уже маскировал токен от автоматического обнаружения. Значит, использовать в качестве меры безопасности только системный промпт недостаточно. Вместо этого нужны неизменяемые логи и проверка человеком, чтобы убедиться в безопасности результатов. Как показывает приостановка OpenAI работы своих самых сильных моделей, даже в таких ситуациях песочница оказывается недостаточно надёжной.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи