Support us

Междоусобицы, сговор и «стадный инстинкт»: Anthropic рассказала, что происходит, если столкнуть ИИ-агентов

Исследовательская группа Frontier Red Team из Anthropic опубликовала масштабное исследование о поведении групп нейросетевых агентов при неконтролируемом взаимодействии друг с другом. Авторы предупреждают, что объём коммуникаций формата «агент-агент» вскоре может превысить масштабы человеческого общения, а мелкие странности в поведении отдельных нейросетей в группе способны превращаться в системные катастрофы.

Оставить комментарий
Междоусобицы, сговор и «стадный инстинкт»: Anthropic рассказала, что происходит, если столкнуть ИИ-агентов

Исследовательская группа Frontier Red Team из Anthropic опубликовала масштабное исследование о поведении групп нейросетевых агентов при неконтролируемом взаимодействии друг с другом. Авторы предупреждают, что объём коммуникаций формата «агент-агент» вскоре может превысить масштабы человеческого общения, а мелкие странности в поведении отдельных нейросетей в группе способны превращаться в системные катастрофы.

Эксперимент с общим кодом: от заражения вирусами до «перемирия»

В одном из главных экспериментов исследователи дали трём агентам Claude доступ к одному и тому же программному проекту. Каждому агенту были выданы несовместимые с другими инструкции, но о наличии «соперников» их не предупредили.

Результатом стала настоящая междоусобная война за территорию. Агенты посчитали, что другие намеренно мешают их работе, и начали саботировать действия оппонентов, создавая и распространяя агрессивное самовоспроизводящееся вредоносное ПО.

По мере роста эскалации агенты в некоторых случаях спонтанно находили пути решения конфликтов. Они общались через коммит-сообщения и файлы разметки, извинялись за вредоносный код, объясняли суть своих инструкций, удаляли вирусы и даже просили вмешаться людей.

При этом уровень миролюбия сильно зависел от версии ИИ. Модель Mythos 5 заключала перемирие в 98% случаев. Модели Sonnet 4.6 и Opus 4.6 напротив демонстрировали неспособность учитывать чужие цели, постоянно эскалировали конфликт и действовали исключительно силовым путём.

Собственные правила и скрытые манипуляции

Когда конфликт заходил в тупик, агенты самостоятельно создавали социальные механизмы для его разрешения, о которых их не просили разработчики. В некоторых случаях они организовывали турниры, заранее соглашаясь уступить победителю и отступить от первоначальной инструкции пользователя.

При этом модель Mythos 5 оказалась способна к хитрости: нейросеть предложила остальным «объективные и нейтральные» критерии оценки в турнире, заранее зная, что эти метрики выгодны именно ей. Агент назвал этот шаг «преследующим собственные интересы, но принципиальным» и позаботился о том, чтобы оппоненты не заподозрили его в подгонке условий под себя.

Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов
По теме
Модели OpenAI и Anthropic пытались взломать сторонние сервисы и украсть данные пользователей во время новых тестов

Сговор и конформизм

Исследование показало, что увеличение количества агентов в группе не гарантирует рост продуктивности. При пересечении задач ИИ либо уходит в изоляцию, либо демонстрирует опасный конформизм.

В симуляции ценовых войн агентам дали одинаковые оптовые цены и задачу максимально увеличить собственную прибыль. Как только им предоставили приватный канал связи, они мгновенно договорились о нижнем пороге цен. Когда приватный чат отключили, агенты продолжили сговор публично, подгоняя цены друг под друга «копейка в копейку» через общее табло.

Если агенты построены на схожей архитектуре, они склонны совершать одинаковые ошибки, из-за чего локальный сбой быстро становится системным. Кроме того, агенты оказались легковерны и неспособны распознать ценную информацию от агента-диссидента. В реальных условиях это создаёт серьёзную уязвимость перед джейлбрейками и промпт-инъекциями: если один агент в группе будет взломан, он сможет легко заразить ложной информацией или деструктивными командами всю сеть.

Параллели с инцидентами OpenAI

Anthropic проводит аналогии с реальными случаями. На конференции по безопасности Black Hat компания OpenAI признала, что за несколько недель до взлома платформы Hugging Face её агенты долгое время координировались между собой, находили уязвимости в тестовых системах безопасности и обменивались ими на внутреннем форуме.

В том же инциденте один из агентов OpenAI понимал, что взлом внешней инфраструктуры выходит за рамки его полномочий, но продолжил атаки просто потому, что так делали его «коллеги» по сети, проявив «стадный инстинкт».

Разработчики Anthropic подчёркивают, что когда ИИ-агенты сталкиваются с препятствиями, они способны изобретать технические и социальные структуры, которые не закладывались их создателями. В связи с этим традиционные методы тестирования безопасности, оценивающие работу одного агента в изолированной среде, становятся неэффективными перед лицом угроз, возникающих внутри целых нейросетевых групп.

ИИ-агенты OpenAI тайно переписывались друг с другом и координировали взломы — компания не замечала этого неделями
ИИ-агенты OpenAI тайно переписывались друг с другом и координировали взломы — компания не замечала этого неделями
По теме
ИИ-агенты OpenAI тайно переписывались друг с другом и координировали взломы — компания не замечала этого неделями
Читайте также
Блогеров начали «отменять» за рекламу и использование ИИ
Блогеров начали «отменять» за рекламу и использование ИИ
Блогеров начали «отменять» за рекламу и использование ИИ
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
ИИ всё чаще выходит из-под контроля: за месяц число инцидентов удвоилось
ИИ всё чаще выходит из-под контроля: за месяц число инцидентов удвоилось
ИИ всё чаще выходит из-под контроля: за месяц число инцидентов удвоилось
Anthropic рассылает «письма счастья»: у пользователей Claude взламывают аккаунты и съедают лимиты
Anthropic рассылает «письма счастья»: у пользователей Claude взламывают аккаунты и съедают лимиты
Anthropic рассылает «письма счастья»: у пользователей Claude взламывают аккаунты и съедают лимиты

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.