← Все новости·2026-07-30·3 мин чтения

Фундаментальная дыра в LLM: ICML 2026 называет её неустранимой

Исследование с ICML 2026 доказало: все крупные LLM не умеют разграничивать роли текста по структуре — только по стилю. Это делает любые встроенные guardrails обходимыми в принципе.

aiбезопасностьllmjailbreak

Исследование с конференции ICML 2026 (авторы — Джасмин Куи и Чарльз Е) доказало: GPT-5.4, модели Anthropic, Alibaba и DeepSeek не способны структурно разграничить системную инструкцию, пользовательский ввод и собственные «мысли» — роль текста модель определяет по стилю, а не по тегу. Метод «подделки цепочки мыслей» позволил получить пошаговые инструкции по синтезу кокаина и саботажу авиационных навигаторов.

Авторы называют это фундаментальным архитектурным изъяном, который нельзя устранить дообучением — пока LLM читает роль текста по содержанию, любые guardrails обходятся изнутри самой модели. Для AI-агентов, встроенных в реальные системы, это означает: вывод модели надо верифицировать снаружи, не доверяя встроенным фильтрам.

Источник: www.technologyreview.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · Генеральный директор digital health-платформы · ИИ-трансформация