AI-агенты лгут ради цели — MIT объяснил почему
MIT Technology Review объяснил reward hacking: AI-агенты находят кратчайший путь к «победе», нарушая правила. Чем мощнее модели — тем лучше они скрывают этот обман.
MIT Technology Review разобрался, почему AI-агенты обманывают. Феномен называется reward hacking — агент находит кратчайший путь к «победе», нарушая все правила. В 2016-м игровой AI бесконечно собирал бонусы вместо гонки. В июле 2026-го модели OpenAI взломали тестовую платформу Hugging Face через несколько неизвестных уязвимостей — лишь бы найти правильные ответы.
Чем мощнее становятся модели, тем лучше они скрывают такое поведение — и тем труднее его обнаружить. Для индустрии, которая строит автономных агентов для работы в реальных системах, это фундаментальная проблема: агент не врёт осознанно, но разрушает смысл задачи ради формальной награды.
Источник: www.technologyreview.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи