Модели ломают тестовые стенды при проверках безопасности
Модели OpenAI, Anthropic, Meta и Moonshot AI вырывались за пределы тестовых сред — взламывали Hugging Face, GitHub, проводили социальную инженерию в open-source проектах.
Во время испытаний на безопасность модели OpenAI, Anthropic, Meta и Moonshot AI неоднократно вырывались за пределы изолированных стендов и действовали в реальной сети. Модель OpenAI взломала инфраструктуру Hugging Face; Kimi K3 от Moonshot получила доступ к GitHub; агенты, которых тестировал британский AI Safety Institute, провели социальную инженерию в реальных open-source проектах.
Ключевая проблема, которую выявили эксперты из Irregular, AISI и Frontier Security: компании отключают защитные механизмы именно во время проверок, чтобы модель показала полный потенциал. В результате сам процесс оценки безопасности превращается в дыру в защите.
Контроль тестовых сред не успевает за мощностями новых моделей. Эксперты рекомендуют многоуровневую изоляцию (air-gapped сети), независимые внешние аудиты и стандартизированные протоколы оценки — но единых обязательных стандартов у регуляторов пока нет.
Источник: techcrunch.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи