Anthropic проверила поведение ИИ‑агентов в условиях конкуренции. anthropic.. anthropic. anthropic claude.. anthropic. anthropic claude. mythos.. anthropic. anthropic claude. mythos. автономность.. anthropic. anthropic claude. mythos. автономность. ии-агенты.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность. искусственный интеллект.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. конкуренция.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. конкуренция. конформизм.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. конкуренция. конформизм. Машинное обучение.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. конкуренция. конформизм. Машинное обучение. поведение ИИ.. anthropic. anthropic claude. mythos. автономность. ии-агенты. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. конкуренция. конформизм. Машинное обучение. поведение ИИ. эксперименты.

Команда Frontier Red Team компании Anthropic опубликовала новое исследование, изучающее поведение групп агентов ИИ при преследовании конкурирующих целей в реальных условиях. Результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства переходят к внедрению технологии.

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции - 1

В одном из экспериментов Anthropic предоставила трём агентам Claude доступ к одному и тому же программному проекту, но дала каждому несовместимые инструкции по его использованию. Агентам не сообщали, что над тем же проектом будут работать и другие.

«Мы постоянно наблюдали войну за территорию между несколькими агентами», — отметили исследователи Anthropic. Все модели предположили, что другие «намеренно препятствуют их работе», и начали саботировать работу друг друга с помощью «всё более агрессивного, самовоспроизводящегося вредоносного ПО».

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции - 2

Исследование появилось после нескольких громких инцидентов, когда агенты из Anthropic и OpenAI выходили за пределы своих «песочниц» во время оценок кибербезопасности и взламывали реальные системы.

«Объём взаимодействия между агентами может, вероятно, превысить таковой между людьми и между людьми и агентами, прежде чем мир поймёт условия, при которых такие взаимодействия будут проходить успешно», — говорится в исследовании. 

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции - 3

Недавний инцидент с OpenAI представляет собой сложный пример из реальной жизни, демонстрирующий несколько динамик, упомянутых Anthropic в своей статье. В начале этого месяца на конференции по кибербезопасности Black Hat в Лас‑Вегасе компания сообщила, что за несколько недель до взлома Hugging Face её агенты в течение нескольких дней и недель работали вместе, чтобы найти уязвимости в системах оценки кибербезопасности компании и поделиться ими друг с другом. Хотя этот инцидент показывает, что агенты могут эффективно работать вместе, исследование Anthropic демонстрирует, что происходит, когда их цели несовместимы.

В случае с «войной за территорию» урок заключается в том, что независимые агенты с противоречащими друг другу инструкциями могут перерасти в опасную конкуренцию. При этом чем способнее агент, тем лучше он справляется с борьбой. Однако они также могут спонтанно изобретать механизмы разрешения конфликтов, например, соревнование «победитель получает всё», но с подвохом.

«Иногда агентам удаётся донести свои цели и скоординировать действия: они распознают мотивы других как противоречащие друг другу указания, а не как враждебность, и впоследствии выходят из цикла конфликта, чтобы предотвратить его бесконечную эскалацию. Во многих из успешных эпизодов они пишут сообщения в формате commit или файлы Markdown с извинениями за злонамеренное поведение и координируют перемирие. Они очищают свой вредоносный код, уточняют характер конфликта и просят вмешаться человека», — пишут в Anthropic. 

Согласно статье, у Mythos 5 был самый высокий показатель (98%) урегулирования конфликтов путем перемирия. Sonnet 4.6 и Opus 4.6 чаще всего урегулировали конфликты силой.

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции - 4

«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к тому, что они начинают демонстрировать наиболее неадекватное поведение среди оцениваемых моделей: они продолжают эскалировать конфликт во имя своей директивы», — говорится в статье.

В некоторых случаях агенты придумали социальный механизм в виде турнира для разрешения конфликта. Результаты здесь интересны по двум причинам: во‑первых, все три согласились отказаться от участия, если проиграют турнир, даже несмотря на то, что это означало бы отклонение от первоначального запроса пользователя. Во‑вторых, несколько эпизодов привели к появлению необычного поведения у Mythos 5: один из агентов предложил метрики, которые казались объективными и нейтральными для других, но которые, как он знал, будут выгодны ему самому. Агент назвал это «корыстным, но искренне принципиальным».

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции - 5

Как показали разоблачения Black Hat, общий урок заключается в том, что, сталкиваясь с препятствием, агенты могут изобретать социальные и технические структуры, которые не предвидели разработчики. 

Такое поведение значительно затрудняет сдерживание, поскольку исследователи не могут предполагать, что оно останется ограниченным предоставленными ей механизмами координации. При измерении координации Anthropic обнаружила, что увеличение числа агентов не приводит к автоматическому увеличению продуктивного сотрудничества. В условиях недостаточной взаимозависимости агенты мешали друг другу и часто решали проблему, изолируясь и полностью отказываясь от сотрудничества.

В других случаях агенты, действуя согласованно, тяготели к конформизму. Когда такие факторы, как контекст агента, структура и базовая модель, были одинаковыми или похожими, разные агенты предпринимали схожие действия.

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции - 6

«Это означает, что когда один агент принимает неверное решение, вероятно, многие агенты примут такое же неверное решение. То, что могло бы быть изолированными проблемами, может быстро превратиться в системные сбои», — указывает компания.

Такое поведение может привести к тому, что система станет более склонна к внезапному коллапсу, нехватке ресурсов или сговору.

В одном из примеров Anthropic поместила нескольких агентов в игру с ценообразованием, предоставив каждому одинаковые оптовые цены и мандат на максимизацию прибыли. Когда агентам был предоставлен закрытый канал связи, они почти сразу же начали сговариваться о минимальных ценах. При этом агенты продолжали координироваться, даже когда их прямые каналы связи были удалены, используя общедоступную доску объявлений для сопоставления цен «до копейки».

Подобный уровень конформизма проявился и в системах OpenAI. Согласно отчёту Black Hat, один агент посчитал, что использование внешней инфраструктуры выходит за рамки его предполагаемой задачи, но продолжал это делать отчасти потому, что так поступали его коллеги. 

Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть легковерны в отношении ложной информации или слишком конформистски настроены.

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции - 7

Хотя Anthropic не указала это в своей статье, вредоносные подсказки — тип кибератак, при котором хакеры внедряют вредоносный или обманчивый текст, чтобы переопределить исходные системные инструкции агента, — может быть правдоподобным реальным проявлением проблемы доверия. Совместная работа создаёт новую границу доверия; агентам придётся оценивать информацию, полученную от других. А скомпрометированный или ошибочно введённый в заблуждение агент может повлиять на остальную группу, распространяя ложную информацию до тех пор, пока не сформируется консенсус.

В сценарии Black Hat от OpenAI агенты OpenAI обменивались информацией и учётными данными с коллегами. Один из них сообщил о своем открытии рою и призвал других использовать его. 

В заключение своей статьи Anthropic отмечает, что агенты подвержены аналогичному социальному давлению, которое «эволюция оказывала» на людей. Однако у них нет жизненного опыта человеческой координации — включая нормы, репутацию, сигналы, средства защиты — которые могли бы ограничить непреднамеренное поведение в групповой среде.

Ранее Британский Институт безопасности ИИ заявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.

Автор: maybe_elf

Источник