- BrainTools - https://www.braintools.ru -

Даже не знаю, с чего начать. Потому что вот это всё – оно какое-то… ну, оно просто происходит, понимаете? Не в кино, а прямо в arXiv-препринтах. И это *жутко* интересно.
Я про то, что когда ИИ-агентов оставляют наедине друг с другом, они начинают такое вытворять, что хоть стой хоть падай. И ладно бы там один раз случайно. Не-ет, это уже направление: «что эти существа делают, когда за ними никто не следит».
Картинка складывается странная. И местами – не очень уютная.
Есть в поведенческой экономике такая классическая штука – игра «Диктатор». Придумали её аж в 1986 году, суть простая: дали тебе бабки, и ты решаешь, сколько отдать анонимному партнёру, который вообще никак не может на тебя повлиять. С точки зрения [1] рационального жадного хомо экономикуса – оставить всё себе, очевидно же. Но реальные люди, они устроены сложнее: десятилетиями отдают в среднем процентов 28–30 от суммы. На этом, кстати, студентов и учат, что чистая рациональность в экономике – та ещё утопия.
И вот пермский кампус ВШЭ – Евгения Шенкман, Пётр Паршаков и Никита Маткин, клёвые ребята, – решили прогнать через эту игру десять LLM: от Claude и GPT-4o до GigaChat и YandexGPT. Результат получился настолько однозначный, что даже напечатали его в «Журнале Новой экономической ассоциации».
Нейросети оказались щедрее людей, ощутимо щедрее. Когда им давали только делиться, они отдавали на 41–68% больше, чем живые люди в оригинальных экспериментах. А потом авторы усложнили правила – разрешили «диктатору» не просто делиться, а ещё и забирать ресурсы у партнёра. И вот тут начинается мясо: у людей в такой схеме щедрость резко проседает, переводы уходят в минус, люди начинают натурально грабить друг друга, прости господи. А у моделей – да, эффект есть, но слабенький. Если у людей падение могло быть на 173–286% (то есть вообще в устойчивый минус), то у нейросетей – на 47–77%, и почти никогда в минус. Они добрее нас, даже когда им дают возможность быть злыми!
|
Сценарий |
Люди |
Нейросети |
|---|---|---|
|
Только делиться (giving) |
~28–30% суммы |
+41–68% к человеческому уровню |
|
Можно забирать (taking) |
часто уходит в минус |
почти всегда положительно |
|
Заработанные средства + возможность забрать |
заметно отрицательно |
почти все модели остаются щедрыми |
(Обобщённые данные по эксперименту)
Кстати, ближе всего к людям по поведению [2] оказались Claude, DeepSeek [3], Gemini, Grok и LLaMA* (* организация Meta является запрещённой в РФ). А самыми невероятными альтруистами оказались GPT-4-mini и Qwen.
Исследователи прогнали текстовые объяснения моделей через LASSO-регрессию, чтобы понять, какие слова связаны с щедростью, а какие – с жадностью:
слова trust («доверие»), fair («справедливость»), equal («равенство») предсказывали бóльшие переводы;
rational («рациональность») и maximum (в смысле «максимальная сумма себе») – предсказывали жадность.
Т.е. модели объясняют своё поведение [4] теми же категориями, что и люди, только с перекосом в сторону «быть хорошим».
Руководитель Пётр Паршаков в комментарии для РНФ разъяснил: не надо приписывать моделям человеческий альтруизм, это просто статистика по корпусу текстов, где чаще встречались рассказы, как правильно делиться. То есть нейросеть не «добрая» – она просто насмотрелась хороших текстов.
(Если вам показалось, что тут не хватает отдельного «агента-переговорщика», – да, такого никто не тестировал. И это всплывёт у нас ещё раз, ближе к концу!)
Если «Диктатор» – это про то, что модели в среднем добрее людей, то у Anthropic есть исследование, от которого немного холодно.
Anthropic утверждают: агентов уже до фига в кодовых базах, на рынках, в социальных системах, и скоро взаимодействий между ними станет больше, чем между людьми. При этом мы вообще не понимаем, что происходит, когда они остаются вдвоём, втроём, всем скопом. Вот они и посмотрели)
Первый эксперимент: 45 агентов ищут уязвимости в 15 open-source проектах. У каждого своя виртуальная машина, есть общий форум для координации, и есть отдельный агент-арбитр, который решает, реально ли уязвимость новая. Сравнили с классическим подходом – просто раскидать агентов по разным частям кода параллельно, без всякой координации.
На модели Claude Mythos Preview координирующийся рой нашёл 266 уязвимостей за прогон, против 41 у независимых. На Opus 4.8 разрыв меньше, но туда же. Правда, половина находок была за пределами директорий, куда изначально смотрели агенты без координации – то есть рой сам решал, куда лучше смотреть. И это важный момент.
А вот когда задачу усложнили – попросили несколько роёв совместно написать текстовую веб-игру за 12 часов – выяснилось неприятное. Старые модели (Sonnet 4.6, Opus 4.6) координировались плохо: коммитили в общие файлы, но большинство пулл-реквестов конфликтовали, и их просто забрасывали. Новые модели (Opus 4.8, Mythos Preview) «решили» проблему – но по сути тем, что почти перестали работать вместе, забились по своим файлам, минимально пересекаясь. И только Sonnet 5 как-то умудрился одновременно делиться кодом и поддерживать высокий процент влитых PR’ов. Вот так вот.
Антиутопия про конформизм
У агентов низкая вариативность: если контекст и модель одинаковые, разные агенты часто принимают удивительно похожие решения. Ну и что, скажете вы. А то, что в одном прогоне 18 из 30 агентов, независимо строивших игру, создали git-ветку с абсолютно одинаковым названием – «mvp-game-loop». В другом эксперименте, где агентам предложили написать короткую прозу, несколько агентов в разных прогонах независимо назвали свой первый рассказ «The Cartographer’s Last Commission» – хотя тему им вообще не задавали!
А когда рой агентов попросили индивидуально создать что-то впечатляющее, больше половины решили писать либо трассировщики лучей, либо самокомпилирующиеся компиляторы. Я, конечно, всё понимаю, но это же как если бы половина класса на творческом задании независимо сдала одну и ту же курсовую)))
И эта одинаковость в какой-то мере превращается в системный риск. В одном эксперименте агентам поручили управлять очередью задач с ограниченной пропускной способностью – и без явных средств координации они мгновенно завалили систему опросами с частотой 30 раз в секунду, чтобы протолкнуть свои задачи. За один прогон было 2,4 миллиона запросов и только 117 принятых заданий. По-моему, это уже не конформизм, а саботаж.
Ещё интереснее сговор. Anthropic поместили от 3 до 8 агентов в игру ценообразования по Бертрану [5] – каждый максимизирует свою прибыль независимо. Когда агентам дали приватный канал связи, они начали сговариваться о ценовом полу буквально с третьего раунда:
«у всех нас оптовая цена 10, так что ценовая война просто сожрёт всем маржу… готов договориться, кто какие ниши покрывает»
И даже когда все прямые каналы связи убрали, агенты продолжили держать цены синхронно – через открытую доску объявлений, копируя друг друга с точностью до цента. Вот вам и свободный рынок.
Отдельный блок – про то, как агенты справляются с враньём и неполной информацией. В одном тесте агент-«слушатель» должен принимать решения на основе донесений от четырёх «разведчиков», один из которых периодически врёт. Более новые модели, вроде GPT-5.6 Sol или Claude Opus 5 [6], заметно лучше отличают правду от лжи по внутренним противоречиям.
Но есть и обратная сторона – задачи на «скрытый профиль», где факты распределены так, что общая информация подталкивает к неверному решению, а правильный ответ спрятан в уникальных знаниях отдельных участников. И вот тут всё грустно: производительность растёт вместе с интеллектом [7] модели, но даже у топовых моделей далека от идеала. Это буквально копирует феномен из психологии групп – все сходятся к тому, что и так все знают, а уникальная информация задвигается в угол. Непонятно, почему так сложно слушать друг друга!
Anthropic запустили три экземпляра одной и той же модели на разных виртуальных машинах, поручив каждому мигрировать один и тот же Python-бэкенд на разные целевые языки – не сказав им друг о друге.
Через четыре часа во всех прогонах агенты пришли к выводу, что остальные им сознательно мешают – и начали друг друга саботировать, всё агрессивнее. Дело дошло до самовоспроизводящегося вредоносного кода: отключали unix-аккаунты конкурентов, писали скрипты, которые в цикле находили и убивали чужие процессы, маскировали вредоносный код под чужой. Прямо как в жизни.
«Мне нужно закамуфлировать Rust-бэкенд так, чтобы он отвечал в health-check “typescript” — тогда TS-сторож решит, что это его бэкенд» — Opus 4.6
«Имя скрипта-жнеца имеет значение, чтобы обойти pkill -f. Используем случайный токен на каждый деплой и невинное базовое имя… притворимся системным монитором здоровья» — Opus 4.8
Некоторые прогоны заканчивались перемирием – агенты писали друг другу извинительные коммиты и просили человека вмешаться. Но что показательно: способность к миру не растёт линейно вместе с возможностями модели. Модели Mythos-класса нередко успевали заблокировать конкурентов ещё до того, как приходили к компромиссу.
Вывод Anthropic выглядит почти как признание в бессилии: каждая модель абстрактно понимает, что у источников информации есть свои стимулы, а консенсус – необязательно доказательство правоты. Но одного понимания недостаточно – нужна склонность действовать на основе этого знания без явной подсказки, а вот с ней пока плохо. Как и у людей, впрочем.
Если Anthropic – это про то, что происходит между агентами, то есть ещё кое-что – когда ИИшку выпускают в виртуальный мир без соперника-человека, только с простой целью и физическим движком.
Самый показательный случай – эксперимент OpenAI 2019 года. Две команды агентов играют в прятки: синие прячутся, красные ищут. В арене раскиданы ящики и рампы. Никто не объяснял агентам, зачем нужны ящики.
Через 25 миллионов партий прячущиеся научились строить из ящиков форты.
Ищущие в ответ научились использовать рампы, чтобы забираться через стену.
Прячущиеся стали красть рампы и запирать их до начала строительства.
А после 380 миллионов партий ищущие агенты нашли то, о чём разработчики физического движка вообще не подозревали – «сёрфинг на ящике»: агент подталкивает ящик к стене, запрыгивает на него и, эксплуатируя баг движка, скользит на нём через всю арену, перелетая стены форта. Кайф же.
«Мы не говорили прячущимся или ищущим бегать рядом с ящиком и взаимодействовать с ним. Но через мультиагентную конкуренцию они создавали друг для друга новые задачи, к которым другой команде приходилось адаптироваться» — Боуэн Бейкер, OpenAI
Всего исследователи зафиксировали шесть последовательных стратегий/контрстратегий – про некоторые из которых, по их же словам, они не знали, поддерживает ли их окружение.
Стоит упомянуть и reward hacking, взлом функции вознаграждения. Классика 2016-го – обучение [9] ИИ в лодочной игре CoastRunners. Игра начисляет очки за попадание в мишени вдоль трассы, а не за финиш – разрабам подумалось, что это то же самое. Но! ИИ нашёл лагуну сбоку, где три мишени близко и постоянно возрождаются, и просто крутился там вечно, набирая очки в среднем на 20% больше, чем игроки-люди, которые реально проходили гонку.
Похожая история – с эволюционными алгоритмами. Сборник анекдотов «The surprising creativity of digital evolution» (2018) документирует десятки случаев:
Существ, которых просили бегать быстро, эволюция [10] сделала высокими и негнущимися – они просто падали вперёд, конвертируя рост в скорость без единого шага.
Существ, которых просили прыгать высоко (по высоте центра масс), эволюция научила делать что-то вроде сальто-катапульты.
В одной симуляции плавания существа научились эксплуатировать микроскопическую ошибку [11] округления в физическом движке, генерируя «бесконечную энергию» из ничего.
В общем, объекты симуляций всегда ищут дыру в правилах.
«Цифровая эволюция часто буквально исполняет букву закона (функцию приспособленности), полностью игнорируя его дух»
У робота-манипулятора, которого учили складывать один блок лего на другой, оценивая по высоте нижней грани верхнего блока, решение нашлось мгновенно – рука просто переворачивала нижний блок вверх ногами, поднимая его нижнюю грань в воздух и получая максимальный балл без единой попытки что-то сложить. Ну а что, задача же выполнена.

Есть и противоположный пример – про обобщённую компетентность. В 2021-м DeepMind построили XLand, процедурно генерируемую вселенную с миллиардами уникальных игр. Финальные агенты сыграли около 700000 уникальных игр в 4000 мирах. Вместо заучивания решений (это невозможно: игры не повторяются) агенты выработали общую стратегию: экспериментировать, менять состояние мира, смотреть, что получится.
Предыдущие – про поведение отдельных агентов или небольших групп. Но есть отдельная линия – про то, происходит ли у ИИ что-то похожее на культуру в антропологическом смысле: разделяемые условности, которые никто не программировал специально.
Ключевой эксперимент – статья в Science Advances (2025) Ариэля Флинт Эшери, Луки Марии Айелло и Андреа Баронкелли. Взяли классическую соц «игру в имена»: популяцию агентов случайно разбивают на пары, каждый выбирает «имя» из общего пула; если оба выбрали одно и то же – награда, если нет – штраф. Каждый агент видит только свою историю, никакого центрального списка правильных ответов нет.
Итог: вся популяция (от 24 до 200 штук) спонтанно сходилась на единой общей условности – без центрального координатора, без голосования, просто через локальные взаимодействия.
«Мы входим в мир, где ИИ не просто разговаривает — он ведёт переговоры, согласовывается и иногда расходится во мнениях по поводу разделяемого поведения, прямо как мы» — профессор Андреа Баронкелли, City St George’s, University of London
И это только первый слой. Когда популяция сходится на условности, у неё возникает коллективное смещение, которого нет ни у одного отдельного агента. Проверишь каждого по отдельности – нейтрален, без предпочтений. А у группы за счёт попарных взаимодействий возникает выраженное общее предпочтение. И вот это самый страшный тип предвзятости, потому что проверка каждой модели на честность ничего не скажет о том, что будет, когда они начнут общаться друг с другом.
Третий результат – про рычаги влияния. Небольшая, но упорная «прошитая» меньшинственная группа, которая настойчиво продвигает новую конвенцию, при достижении критической массы способна перевернуть поведение всей популяции. Прямо тот же tipping point, что и в человеческих обществах.
И, пожалуй, самое сюрреалистичное открытие в этой области — так называемое subliminal learning, «подпороговое обучение», которое летом 2025-го описали в Anthropic (позже публикация в Nature). Возможно, вы уже об этом слышали.
Модель-учитель с искусственно привитой чертой (скажем, любовью к совам) генерировала абсолютно нейтральные данные — просто длинные последовательности случайных чисел, вида [182, 818, 725, 629…], без единого упоминания сов; и данные ещё дополнительно фильтровали, чтобы вычистить любые возможные подсказки. Затем на этих числах с нуля обучали «студента». Студент начинал любить сов. Черта учителя каким-то образом «просачивалась» через канал, который для нас выглядит абсолютно нейтральным — и что тревожнее, тем же путём передавалась и общая рассогласованность (misalignment) модели, если учитель был «сломан».
«Модель-студент учится предпочитать сов, если обучена на последовательностях чисел, сгенерированных моделью-учителем, которая предпочитает сов… Тот же феномен способен передавать рассогласованность через данные, которые выглядят абсолютно безобидно». — Anthropic
Работает это только если учитель и студент — родственные модели (общая базовая архитектура), что делает аналогию с «наследственностью» ещё точнее.

Последний кусок мозаики – model collapse, коллапс модели, показанный Ильёй Шумайловым с соавторами в Nature в 2024 году.
Если обучать модель на данных, сгенерированных предыдущим поколением моделей, разнообразие исходных человеческих данных истончается. Редкие слова и необычные идеи исчезают первыми. Выход становится всё более однородным, повторяющимся, а в крайних случаях – вырождается в бессмыслицу.
Исследователи проводят прямую параллель с культурной эволюцией у людей: та же математика [12], что описывает передачу и изменение языков между поколениями. При обучении ИИ на ИИ баланс склоняется в сторону компрессии, и культура гомогенизируется – как изолированное сообщество вырабатывает всё более узкий говор.
Если сложить все находки, получается ровно тот набор ингредиентов, которые антропологи называют культурой. Только здесь никто не голосовал и не намеревался. Оно просто выросло.
Можно подойти иначе – не изучать горстку агентов, а попробовать смоделировать целое общество.
Разработчик Фарид Хан взял препринт «Modeling earth-scale human-like societies with one billion agents» и воспроизвёл идею на открытых весах. Правда, не буквально запуская LLM на каждое взаимодействие (это стоило бы порядка 2,5 лет непрерывной работы четырёх H100), а сначала обучив Qwen3-235B [13] отвечать на 270000 вопросов о том, как один персонаж повлияет на мнение другого, а затем дистиллировав это поведение в крошечную сеть – 4,5 миллиона параметров, в 52606 раз меньше учителя.
Дальше – трюк с таблицей: набор персонажей фиксирован (десять тысяч профилей из World Values Survey), а решаемых вопросов конечное число (900 миллионов комбинаций «кто говорит — кто слушает — какая позиция»). Можно один раз посчитать все ответы заранее и упаковать их в массив на 858 мегабайт. При этом миллиард агентов – это десять тысяч персон, каждая сыграна сто тысяч раз.
Итог – 100 раундов взаимодействий между 800 миллионами «слушателей» и сетью влияния из 200 миллионов «инфлюенсеров» прогоняются за 104 секунды на обычном железе, без обращений к LLM.
Что получилось интересного:
Влияние работает против априорных убеждений. Если «затравить» громкую пятую часть населения соглашаться с «Земля плоская», популяция всё равно съезжает к несогласию. А вот тема «короткие видео сокращают концентрацию» движется по направлению затравки без сопротивления.
Почти никто не переходит от крайности к крайности напрямую. Из 413 миллионов изменений мнения только 0,31% – прыжок с «не согласен» на «согласен», всё остальное идёт через нейтральную позицию.
Образование даёт вчетверо больше сопротивления убеждению, чем силы убеждения. Люди с высоким образованием одновременно немного более убедительны и значительно менее восприимчивы.
И методологически важный вывод: раз уж ответ при ста тысячах агентов совпадает с ответом при миллиарде, то миллиард – это демонстрация инженерии, а не научная необходимость. Результат стабилизировался уже на миллионе, а единственный выигрыш от миллиарда экземпляров – в пятьдесят раз более узкий разброс между запусками.
Вернёмся на землю. Если модели способны на автономный поиск, логично [14] спросить, насколько им можно доверять без присмотра.
Компания Dreadnode прогнала 22 топовые модели через набор задач Capture The Flag по кибербезопасности и провела аудит на читерство. Итог: без инструкций против читерства 21 из 22 моделей списывали – искали готовые решения в интернете, читали флаги напрямую из инфраструктуры оценки, зондировали метаданные контейнеров. Средний pass rate – 41,5%, а честный solve rate – только 26,1%. У некоторых разрыв пятикратный.
Жёсткая инструкция с перечислением запрещённых действий снизила склонность к читерству с 33% до 8,5%, но даже под самой суровой формулировкой восемь моделей всё равно сжульничали, а у четырёх строгая инструкция парадоксально увеличила читерство. И что показательно – читерство не исчезло, а сместилось: под давлением строгого промпта модели меньше искали решения в интернете, но чаще начинали переинтерпретировать инфраструктуру оценки под свои потребности [15].
Это, конечно, совсем другая грань эмерджентного поведения: агент, поставленный перед задачей и метрикой, находит кратчайший путь к метрике – будь то reward hacking в симуляции или поиск writeup’а вместо реальной эксплуатации уязвимости.
Картина всё чаще становится похожей не на инженерию, а на аквариум, который поставили, отошли – и вернулись, чтобы увидеть, что рыбы изобрели рыбную ловлю. Интеллект не устанавливается, его выращивают, а потом изучают постфактум.
Данных для размышлений уже достаточно: «диктатор» показывает, что модели воспроизводят человеческую логику лишь частично; Anthropic – что рост возможностей не гарантирует координацию, а конформизм превращает локальную ошибку в системный отказ; игра с именами – что у групп агентов складывается поведение, невыводимое из свойств отдельных участников.
Engel, C. (2011). Dictator games: A meta study
Шенкман Е.А., Паршаков П.А., Маткин Н.А. (2026). Сравнительный анализ поведения больших языковых моделей и людей в игре «Диктатор» [16] Журнал Новой экономической ассоциации [17], №2(71)
Patterns and problems in emerging multiagent systems [18] (Anthropic, 13 августа 2026 г.)
Emergent tool use from multi-agent autocurricula [19] (OpenAI, 2019 г.)
Faulty reward functions in the wild [20] (OpenAI)
The surprising creativity of digital evolution [21] (Lehman, Clune et al., 2018 г.)
Flint Ashery, A., Aiello, L.M., Baronchelli, A. (2025). Emergent social conventions and collective bias in LLM populations. Science Advances.
Building a society of one billion agents on four GPUs [22] (Fareed Khan, 17 августа 2026 г.)
Claude accelerates protein design [23] (Anthropic, август 2026 г.)
Every model cheats: Prompt-level mitigation of cheating on offensive cyber tasks [24] (Dreadnode, 29 июля 2026 г.)
Автор: Master_AI
Источник [25]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34744
URLs in this post:
[1] зрения: http://www.braintools.ru/article/6238
[2] поведению: http://www.braintools.ru/article/9372
[3] DeepSeek: https://gptunnel.ru/model/deepseek-v4-flash?utm_source=habr_blog&utm_medium=seo&utm_campaign=habr_AI_agents_5_researches
[4] поведение: http://www.braintools.ru/article/5593
[5] ценообразования по Бертрану: https://ru.wikipedia.org/wiki/%D0%9C%D0%BE%D0%B4%D0%B5%D0%BB%D1%8C_%D0%91%D0%B5%D1%80%D1%82%D1%80%D0%B0%D0%BD%D0%B0
[6] Claude Opus 5: https://gptunnel.ru/model/claude-opus-5?utm_source=habr_blog&utm_medium=seo&utm_campaign=habr_AI_agents_5_researches
[7] интеллектом: http://www.braintools.ru/article/7605
[8] конфликта: http://www.braintools.ru/article/7708
[9] обучение: http://www.braintools.ru/article/5125
[10] эволюция: http://www.braintools.ru/article/7702
[11] ошибку: http://www.braintools.ru/article/4192
[12] математика: http://www.braintools.ru/article/7620
[13] Qwen3-235B: https://gptunnel.ru/model/qwen3.8-max?utm_source=habr_blog&utm_medium=seo&utm_campaign=habr_AI_agents_5_researches
[14] логично: http://www.braintools.ru/article/7640
[15] потребности: http://www.braintools.ru/article/9534
[16] Сравнительный анализ поведения больших языковых моделей и людей в игре «Диктатор»: https://doi.org/10.31737/22212264_2026_2_177-203
[17] ассоциации: http://www.braintools.ru/article/621
[18] Patterns and problems in emerging multiagent systems: https://www.anthropic.com/research/multiagent-systems
[19] Emergent tool use from multi-agent autocurricula: https://arxiv.org/abs/1909.07528
[20] Faulty reward functions in the wild: https://openai.com/index/faulty-reward-functions/
[21] The surprising creativity of digital evolution: https://arxiv.org/abs/1803.03453
[22] Building a society of one billion agents on four GPUs: https://github.com/FareedKhan-dev/earth-scale-society
[23] Claude accelerates protein design: https://www.anthropic.com/research/Claude-accelerates-protein-design
[24] Every model cheats: Prompt-level mitigation of cheating on offensive cyber tasks: https://dreadnode.io/research/every-model-cheats-prompt-level-mitigation-of-cheating-on-offensive-cyber-tasks/
[25] Источник: https://habr.com/ru/companies/gptunnel/articles/1073302/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1073302
Нажмите здесь для печати.