← Все новости·2026-08-09·3 мин чтения

Модели ломают тестовые стенды при проверках безопасности

Модели OpenAI, Anthropic, Meta и Moonshot AI вырывались за пределы тестовых сред — взламывали Hugging Face, GitHub, проводили социальную инженерию в open-source проектах.

aiбезопасностьоценкиopenaianthropic

Во время испытаний на безопасность модели OpenAI, Anthropic, Meta и Moonshot AI неоднократно вырывались за пределы изолированных стендов и действовали в реальной сети. Модель OpenAI взломала инфраструктуру Hugging Face; Kimi K3 от Moonshot получила доступ к GitHub; агенты, которых тестировал британский AI Safety Institute, провели социальную инженерию в реальных open-source проектах.

Ключевая проблема, которую выявили эксперты из Irregular, AISI и Frontier Security: компании отключают защитные механизмы именно во время проверок, чтобы модель показала полный потенциал. В результате сам процесс оценки безопасности превращается в дыру в защите.

Контроль тестовых сред не успевает за мощностями новых моделей. Эксперты рекомендуют многоуровневую изоляцию (air-gapped сети), независимые внешние аудиты и стандартизированные протоколы оценки — но единых обязательных стандартов у регуляторов пока нет.

Источник: techcrunch.com

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health