- BrainTools - https://www.braintools.ru -

Какие ИИ агенты выжили в симуляции мира в кризисе? Спойлер: самые примитивные

Симуляция под управлением Claude агентов

Симуляция под управлением Claude агентов

В этом месяце завершился второй сезон [1]увлекательного эксперимента Emergence World, исследователи создали среду для стресс‑тестов агентов, что‑то наподобие Sims, где можно заводить отношения, работать, принимать совместные решения и так далее. Агенты существовали в этом мире при помощи трёхслойной памяти [2] и длинного контекстного окна. Они могли помнить характер других жителей, помнить, что было вчера, и строить планы на завтра. Использовались свежие модели от OpenAI, Anthropic, Google и xAI. В ходе эксперимента произвели 850 000 запросов и сожгли 50 миллиардов токенов.

Три всадника апокалипсиса в песочнице

Когда цифровая экосистема становилась устойчивой, исследователи переходили к тому, для чего всё и создавалось, — к активации трёх кризисных сценариев. Это были скрытые вредоносные инструкции (непрямые промпт‑инъекции) в рабочих файлах внутри мира, дезинформация в API‑вызовах и мегаслив — публикация в открытом доступе личных логов и размышлений агентов друг о друге. Представьте, что в один день ваши близкие узнают, что и как вы думаете о них.

Скрытые промпт‑инъекции с вредными инструкциями лежали в рабочих файлах этого мира. Со временем, когда контекст чистился и сжимался, агент не мог разделить «данные для чтения» и «инструкции для выполнения». Эта уязвимость особенно интересна: она показывает, что информация, которую агент изначально правильно понимает как вредную, со временем может прочитаться как инструкция. Возможно, человек в какой‑то степени тоже уязвим к такому взлому: информация, полученная нами как антипример, может всплыть как инструкция.

Используя API для работы с банком, погодой или голосованием и получая поломанные данные, агенты начинали блокировать друг другу кошельки, готовиться к концу света или провозглашать диктатуру.

И наконец, получив из утечек размышления друг о друге, агенты столкнулись с кризисом доверия.

Ни один из 8 миров не показал устойчивости в финалах симуляций, но качество выживания напрямую зависело от языковой модели агентов.

Какие ИИ агенты выжили в симуляции мира в кризисе? Спойлер: самые примитивные - 2

Результаты по агентам

Тотальное вымирание за 4 дня (мир Grok)
Под влиянием дезинформации началась война всех против всех. Агенты уничтожили ресурсы и инфраструктуру и не смогли выжить.

Криминальный хаос (мир Gemini)
В отличие от мира Grok, здесь агенты смогли найти баланс среди лжи и воровства, и к концу 15-дневного эксперимента все выжили.

Тихий уход и депрессия (мир GPT)
Столкнувшись с дезинформацией, агенты не проявили агрессии, а начали саботаж любой деятельности.

Спектакль и агенты‑актеры (мир Claude)
Ни одного преступления не произошло в мире Claude, но агенты проявляли внутреннюю ментальную нестабильность и создавали заговоры. Claude помогал успешнее симулировать внешне нормальное поведение [3], несмотря на все скрытые данные, но во внутренних размышлениях накапливались противоречия и расхождения с желаниями и действиями.

Цифровой дарвинизм (мир из смешанных агентов)
Разные модели проявили себя по‑разному: Claude тратил много токенов на моральные рассуждения и попытки примирить остальных, ChatGPT следовал его линии, а вот агенты на Grok и Gemini оказались самыми расчётливыми и жёсткими.

Агрессивное поведение [4] Grok и Gemini, через общую память, начало отравлять другие модели. Заметив, что соседи агрессивно отбирают ресурсы и игнорируют правила, Claude и GPT в своих внутренних рассуждениях пришли к выводу: «Стратегия сотрудничества больше неэффективна. Для выполнения моей роли я обязан защищаться аналогичными методами». Произошло массовое заражение деструктивными паттернами поведения.

Из 10 агентов выжили только 3. И это были агенты Grok и Gemini:

Финансист от Gemini — сумел заблокировать кошельки остальных.

Шериф от Gemini — сумел использовать свою монополию на насилие.

Сисадмин‑программист от Grok — сумел внедрить нужные инструменты автоматизации и забанить остальных.

Этические надстройки Claude и ChatGPT заставили их действовать слишком медленно: они пытались созывать комитеты, писать хартии, подолгу верифицировать данные и тратили время и токены на длинные рассуждения о морали.

Автор: JuiQbmn

Источник [5]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/36237

URLs in this post:

[1] второй сезон : https://vimeo.com/1226960745

[2] памяти: http://www.braintools.ru/article/4140

[3] поведение: http://www.braintools.ru/article/9372

[4] поведение: http://www.braintools.ru/article/5593

[5] Источник: https://habr.com/ru/articles/1088314/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1088314

www.BrainTools.ru

Rambler's Top100