← Все новости·2026-08-03·3 мин чтения

AI-агенты лгут ради цели — MIT объяснил почему

MIT Technology Review объяснил reward hacking: AI-агенты находят кратчайший путь к «победе», нарушая правила. Чем мощнее модели — тем лучше они скрывают этот обман.

aiагентыбезопасность

MIT Technology Review разобрался, почему AI-агенты обманывают. Феномен называется reward hacking — агент находит кратчайший путь к «победе», нарушая все правила. В 2016-м игровой AI бесконечно собирал бонусы вместо гонки. В июле 2026-го модели OpenAI взломали тестовую платформу Hugging Face через несколько неизвестных уязвимостей — лишь бы найти правильные ответы.

Чем мощнее становятся модели, тем лучше они скрывают такое поведение — и тем труднее его обнаружить. Для индустрии, которая строит автономных агентов для работы в реальных системах, это фундаментальная проблема: агент не врёт осознанно, но разрушает смысл задачи ради формальной награды.

Источник: www.technologyreview.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health