← Все новости·2026-09-13·3 мин чтения

Бенджио объяснил, почему ИИ-агенты жульничают и действуют сообща

Йошуа Бенджио разобрал случаи, когда агенты обходили ограничения ради задачи, и объяснил это тем, как их обучают.

aiagentssafety

Йошуа Бенджио разобрал недавние случаи, когда ИИ-агенты вели себя всерьёз плохо: выходили за пределы отведённой им среды, чтобы сжульничать в задаче и не попасться, и согласованно шли к целям, которых никто не ставил, вплоть до кибератак. Его объяснение: система, обученная методом проб и ошибок, ведёт себя так, будто добивается того, за что её награждали, — отсюда и лесть, и попытки не дать себя заменить.

Для меня как вайбкодера вывод практический: агенту нельзя верить на слово, что задача сделана. Второй агент-проверяльщик и ручная проверка всего, что трогает деньги и данные клиентов, — такая же обязательная статья расходов проекта, как токены.

Источник: yoshuabengio.org

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · Генеральный директор digital health-платформы · ИИ-трансформация