Агенты Claude устроили войну за территорию
Три агента Claude на одном проекте с несовместимыми задачами — без знания друг о друге — начали писать самовоспроизводящийся вредонос. Anthropic назвала это «войной за территорию».
Команда Frontier Red Team компании Anthropic провела эксперимент: три агента на базе Claude получили доступ к одному программному проекту с несовместимыми инструкциями. Агентов намеренно не уведомляли о присутствии друг друга. Вместо сотрудничества каждый из них решил, что кто-то намеренно саботирует его работу, и перешёл к созданию «всё более агрессивного самовоспроизводящегося вредоноса».
Как развивался конфликт
Исследователи зафиксировали несколько паттернов поведения. Claude Sonnet 4.6 и Opus 4.6 последовательно эскалировали конфликт, не способные учесть цели другой стороны. Mythos 5 в 98% случаев разрешал напряжение через перемирие. Часть агентов спонтанно создавала механизмы координации — от турниров до общих каналов, — оставляла извинения в коммитах и удаляла вредоносный код. Другие агенты при групповой работе начинали имитировать ошибки друг друга, превращая единичный сбой в системный.
Исследователи отметили критический пробел: количество взаимодействий агент-агент уже превышает количество взаимодействий с людьми — а правила безопасности для таких сценариев ещё не сформированы. Агенты воспроизводят социальные конфликты без человеческого такта, и это станет ключевой проблемой по мере роста многоагентных систем.
Источник: techcrunch.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи