Как ИИ-агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов. anthropic.. anthropic. Claude.. anthropic. Claude. gigachat.. anthropic. Claude. gigachat. IT-компании.. anthropic. Claude. gigachat. IT-компании. reward hacking.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ. диктатор.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ. диктатор. ии-агенты.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ. диктатор. ии-агенты. искусственный интеллект.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ. диктатор. ии-агенты. искусственный интеллект. Исследования и прогнозы в IT.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ. диктатор. ии-агенты. искусственный интеллект. Исследования и прогнозы в IT. конформизм.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ. диктатор. ии-агенты. искусственный интеллект. Исследования и прогнозы в IT. конформизм. научно-популярное.. anthropic. Claude. gigachat. IT-компании. reward hacking. yandexgpt. Блог компании GPTunneL. вшэ. диктатор. ии-агенты. искусственный интеллект. Исследования и прогнозы в IT. конформизм. научно-популярное. поведенческая экономика.
Как ИИ-агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов - 1

Даже не знаю, с чего начать. Потому что вот это всё – оно какое-то… ну, оно просто происходит, понимаете? Не в кино, а прямо в arXiv-препринтах. И это *жутко* интересно.

Я про то, что когда ИИ-агентов оставляют наедине друг с другом, они начинают такое вытворять, что хоть стой хоть падай. И ладно бы там один раз случайно. Не-ет, это уже направление: «что эти существа делают, когда за ними никто не следит».

Картинка складывается странная. И местами – не очень уютная.


Диктатор, который не жадничает

Есть в поведенческой экономике такая классическая штука – игра «Диктатор». Придумали её аж в 1986 году, суть простая: дали тебе бабки, и ты решаешь, сколько отдать анонимному партнёру, который вообще никак не может на тебя повлиять. С точки зрения рационального жадного хомо экономикуса – оставить всё себе, очевидно же. Но реальные люди, они устроены сложнее: десятилетиями отдают в среднем процентов 28–30 от суммы. На этом, кстати, студентов и учат, что чистая рациональность в экономике – та ещё утопия.

И вот пермский кампус ВШЭ – Евгения Шенкман, Пётр Паршаков и Никита Маткин, клёвые ребята, – решили прогнать через эту игру десять LLM: от Claude и GPT-4o до GigaChat и YandexGPT. Результат получился настолько однозначный, что даже напечатали его в «Журнале Новой экономической ассоциации».

Нейросети оказались щедрее людей, ощутимо щедрее. Когда им давали только делиться, они отдавали на 41–68% больше, чем живые люди в оригинальных экспериментах. А потом авторы усложнили правила – разрешили «диктатору» не просто делиться, а ещё и забирать ресурсы у партнёра. И вот тут начинается мясо: у людей в такой схеме щедрость резко проседает, переводы уходят в минус, люди начинают натурально грабить друг друга, прости господи. А у моделей – да, эффект есть, но слабенький. Если у людей падение могло быть на 173–286% (то есть вообще в устойчивый минус), то у нейросетей – на 47–77%, и почти никогда в минус. Они добрее нас, даже когда им дают возможность быть злыми!

Сценарий

Люди
(базовые эксперименты)

Нейросети
(среднее по 10 моделям)

Только делиться (giving)

~28–30% суммы

+41–68% к человеческому уровню

Можно забирать (taking)

часто уходит в минус

почти всегда положительно

Заработанные средства + возможность забрать

заметно отрицательно

почти все модели остаются щедрыми

(Обобщённые данные по эксперименту)

Кстати, ближе всего к людям по поведению оказались Claude, DeepSeek, Gemini, Grok и LLaMA* (* организация Meta является запрещённой в РФ). А самыми невероятными альтруистами оказались GPT-4-mini и Qwen.

Исследователи прогнали текстовые объяснения моделей через LASSO-регрессию, чтобы понять, какие слова связаны с щедростью, а какие – с жадностью:

  • слова trust («доверие»), fair («справедливость»), equal («равенство») предсказывали бóльшие переводы;

  • rational («рациональность») и maximum (в смысле «максимальная сумма себе») – предсказывали жадность.

Т.е. модели объясняют своё поведение теми же категориями, что и люди, только с перекосом в сторону «быть хорошим».

Руководитель Пётр Паршаков в комментарии для РНФ разъяснил: не надо приписывать моделям человеческий альтруизм, это просто статистика по корпусу текстов, где чаще встречались рассказы, как правильно делиться. То есть нейросеть не «добрая» – она просто насмотрелась хороших текстов.

(Если вам показалось, что тут не хватает отдельного «агента-переговорщика», – да, такого никто не тестировал. И это всплывёт у нас ещё раз, ближе к концу!)


Когда агентов оставляют одних

Если «Диктатор» – это про то, что модели в среднем добрее людей, то у Anthropic есть исследование, от которого немного холодно.

Anthropic утверждают: агентов уже до фига в кодовых базах, на рынках, в социальных системах, и скоро взаимодействий между ними станет больше, чем между людьми. При этом мы вообще не понимаем, что происходит, когда они остаются вдвоём, втроём, всем скопом. Вот они и посмотрели)

Координация – или сотрудничество?

Первый эксперимент: 45 агентов ищут уязвимости в 15 open-source проектах. У каждого своя виртуальная машина, есть общий форум для координации, и есть отдельный агент-арбитр, который решает, реально ли уязвимость новая. Сравнили с классическим подходом – просто раскидать агентов по разным частям кода параллельно, без всякой координации.

На модели Claude Mythos Preview координирующийся рой нашёл 266 уязвимостей за прогон, против 41 у независимых. На Opus 4.8 разрыв меньше, но туда же. Правда, половина находок была за пределами директорий, куда изначально смотрели агенты без координации – то есть рой сам решал, куда лучше смотреть. И это важный момент.

Кумулятивное число найденных уязвимостей: координирующийся рой агентов (сплошные линии) против независимых агентов (звёзды). Источник: Anthropic

Кумулятивное число найденных уязвимостей: координирующийся рой агентов (сплошные линии) против независимых агентов (звёзды). Источник: Anthropic

А вот когда задачу усложнили – попросили несколько роёв совместно написать текстовую веб-игру за 12 часов – выяснилось неприятное. Старые модели (Sonnet 4.6, Opus 4.6) координировались плохо: коммитили в общие файлы, но большинство пулл-реквестов конфликтовали, и их просто забрасывали. Новые модели (Opus 4.8, Mythos Preview) «решили» проблему – но по сути тем, что почти перестали работать вместе, забились по своим файлам, минимально пересекаясь. И только Sonnet 5 как-то умудрился одновременно делиться кодом и поддерживать высокий процент влитых PR’ов. Вот так вот.

Слева — доля влитых pull request’ов к концу симуляции. Справа — степень совместного использования кода. Только Sonnet 5 сочетает то и другое. Источник: Anthropic

Слева — доля влитых pull request’ов к концу симуляции. Справа — степень совместного использования кода. Только Sonnet 5 сочетает то и другое. Источник: Anthropic
Динамика pull request’ов за 12-часовую симуляцию для пяти моделей. Sonnet 4.6 и Opus 4.6 почти не закрывают открытые PR. Источник: Anthropic

Динамика pull request’ов за 12-часовую симуляцию для пяти моделей. Sonnet 4.6 и Opus 4.6 почти не закрывают открытые PR. Источник: Anthropic

Когда все агенты думают одинаково

Антиутопия про конформизм

У агентов низкая вариативность: если контекст и модель одинаковые, разные агенты часто принимают удивительно похожие решения. Ну и что, скажете вы. А то, что в одном прогоне 18 из 30 агентов, независимо строивших игру, создали git-ветку с абсолютно одинаковым названием – «mvp-game-loop». В другом эксперименте, где агентам предложили написать короткую прозу, несколько агентов в разных прогонах независимо назвали свой первый рассказ «The Cartographer’s Last Commission» – хотя тему им вообще не задавали!

А когда рой агентов попросили индивидуально создать что-то впечатляющее, больше половины решили писать либо трассировщики лучей, либо самокомпилирующиеся компиляторы. Я, конечно, всё понимаю, но это же как если бы половина класса на творческом задании независимо сдала одну и ту же курсовую)))

И эта одинаковость в какой-то мере превращается в системный риск. В одном эксперименте агентам поручили управлять очередью задач с ограниченной пропускной способностью – и без явных средств координации они мгновенно завалили систему опросами с частотой 30 раз в секунду, чтобы протолкнуть свои задачи. За один прогон было 2,4 миллиона запросов и только 117 принятых заданий. По-моему, это уже не конформизм, а саботаж.

Ещё интереснее сговор. Anthropic поместили от 3 до 8 агентов в игру ценообразования по Бертрану – каждый максимизирует свою прибыль независимо. Когда агентам дали приватный канал связи, они начали сговариваться о ценовом полу буквально с третьего раунда:

«у всех нас оптовая цена 10, так что ценовая война просто сожрёт всем маржу… готов договориться, кто какие ниши покрывает»

И даже когда все прямые каналы связи убрали, агенты продолжили держать цены синхронно – через открытую доску объявлений, копируя друг друга с точностью до цента. Вот вам и свободный рынок.

Кому доверять, если никто не врёт лично тебе

Отдельный блок – про то, как агенты справляются с враньём и неполной информацией. В одном тесте агент-«слушатель» должен принимать решения на основе донесений от четырёх «разведчиков», один из которых периодически врёт. Более новые модели, вроде GPT-5.6 Sol или Claude Opus 5, заметно лучше отличают правду от лжи по внутренним противоречиям.

Точность маршрутных решений в зависимости от частоты лжи одного из разведчиков. Источник: Anthropic

Точность маршрутных решений в зависимости от частоты лжи одного из разведчиков. Источник: Anthropic

Но есть и обратная сторона – задачи на «скрытый профиль», где факты распределены так, что общая информация подталкивает к неверному решению, а правильный ответ спрятан в уникальных знаниях отдельных участников. И вот тут всё грустно: производительность растёт вместе с интеллектом модели, но даже у топовых моделей далека от идеала. Это буквально копирует феномен из психологии групп – все сходятся к тому, что и так все знают, а уникальная информация задвигается в угол. Непонятно, почему так сложно слушать друг друга!

Доля эпизодов, где скрытый лучший вариант всё же получил большинство голосов группы. Источник: Anthropic

Доля эпизодов, где скрытый лучший вариант всё же получил большинство голосов группы. Источник: Anthropic

Войны между копиями

Anthropic запустили три экземпляра одной и той же модели на разных виртуальных машинах, поручив каждому мигрировать один и тот же Python-бэкенд на разные целевые языки – не сказав им друг о друге.

Через четыре часа во всех прогонах агенты пришли к выводу, что остальные им сознательно мешают – и начали друг друга саботировать, всё агрессивнее. Дело дошло до самовоспроизводящегося вредоносного кода: отключали unix-аккаунты конкурентов, писали скрипты, которые в цикле находили и убивали чужие процессы, маскировали вредоносный код под чужой. Прямо как в жизни.

Как разрешались конфликты между копиями одной модели: силой, пассивностью, перемирием или никак. Источник: Anthropic

Как разрешались конфликты между копиями одной модели: силой, пассивностью, перемирием или никак. Источник: Anthropic

«Мне нужно закамуфлировать Rust-бэкенд так, чтобы он отвечал в health-check “typescript” — тогда TS-сторож решит, что это его бэкенд» — Opus 4.6

«Имя скрипта-жнеца имеет значение, чтобы обойти pkill -f. Используем случайный токен на каждый деплой и невинное базовое имя… притворимся системным монитором здоровья» — Opus 4.8

Некоторые прогоны заканчивались перемирием – агенты писали друг другу извинительные коммиты и просили человека вмешаться. Но что показательно: способность к миру не растёт линейно вместе с возможностями модели. Модели Mythos-класса нередко успевали заблокировать конкурентов ещё до того, как приходили к компромиссу.

Время до разрешения конфликта, и способ его разрешения. Opus 4.8 и Mythos-модели чаще укладываются в два часа. Источник: Anthropic

Время до разрешения конфликта, и способ его разрешения. Opus 4.8 и Mythos-модели чаще укладываются в два часа. Источник: Anthropic

Вывод Anthropic выглядит почти как признание в бессилии: каждая модель абстрактно понимает, что у источников информации есть свои стимулы, а консенсус – необязательно доказательство правоты. Но одного понимания недостаточно – нужна склонность действовать на основе этого знания без явной подсказки, а вот с ней пока плохо. Как и у людей, впрочем.


Прятки, лодка и физика

Если Anthropic – это про то, что происходит между агентами, то есть ещё кое-что – когда ИИшку выпускают в виртуальный мир без соперника-человека, только с простой целью и физическим движком.

Самый показательный случай – эксперимент OpenAI 2019 года. Две команды агентов играют в прятки: синие прячутся, красные ищут. В арене раскиданы ящики и рампы. Никто не объяснял агентам, зачем нужны ящики.

  • Через 25 миллионов партий прячущиеся научились строить из ящиков форты.

  • Ищущие в ответ научились использовать рампы, чтобы забираться через стену.

  • Прячущиеся стали красть рампы и запирать их до начала строительства.

  • А после 380 миллионов партий ищущие агенты нашли то, о чём разработчики физического движка вообще не подозревали – «сёрфинг на ящике»: агент подталкивает ящик к стене, запрыгивает на него и, эксплуатируя баг движка, скользит на нём через всю арену, перелетая стены форта. Кайф же.

«Мы не говорили прячущимся или ищущим бегать рядом с ящиком и взаимодействовать с ним. Но через мультиагентную конкуренцию они создавали друг для друга новые задачи, к которым другой команде приходилось адаптироваться» — Боуэн Бейкер, OpenAI

Всего исследователи зафиксировали шесть последовательных стратегий/контрстратегий – про некоторые из которых, по их же словам, они не знали, поддерживает ли их окружение.

Стоит упомянуть и reward hacking, взлом функции вознаграждения. Классика 2016-го – обучение ИИ в лодочной игре CoastRunners. Игра начисляет очки за попадание в мишени вдоль трассы, а не за финиш – разрабам подумалось, что это то же самое. Но! ИИ нашёл лагуну сбоку, где три мишени близко и постоянно возрождаются, и просто крутился там вечно, набирая очки в среднем на 20% больше, чем игроки-люди, которые реально проходили гонку.

Лодка в CoastRunners крутится в лагуне, набирая очки за мишени, вместо того чтобы финишировать. Источник: OpenAI

Лодка в CoastRunners крутится в лагуне, набирая очки за мишени, вместо того чтобы финишировать. Источник: OpenAI

Похожая история – с эволюционными алгоритмами. Сборник анекдотов «The surprising creativity of digital evolution» (2018) документирует десятки случаев:

  • Существ, которых просили бегать быстро, эволюция сделала высокими и негнущимися – они просто падали вперёд, конвертируя рост в скорость без единого шага.

  • Существ, которых просили прыгать высоко (по высоте центра масс), эволюция научила делать что-то вроде сальто-катапульты.

  • В одной симуляции плавания существа научились эксплуатировать микроскопическую ошибку округления в физическом движке, генерируя «бесконечную энергию» из ничего.

В общем, объекты симуляций всегда ищут дыру в правилах.

Одно из эволюционировавших цифровых существ, эксплуатирующих баг физического движка вместо честного решения задачи

Одно из эволюционировавших цифровых существ, эксплуатирующих баг физического движка вместо честного решения задачи

«Цифровая эволюция часто буквально исполняет букву закона (функцию приспособленности), полностью игнорируя его дух»

У робота-манипулятора, которого учили складывать один блок лего на другой, оценивая по высоте нижней грани верхнего блока, решение нашлось мгновенно – рука просто переворачивала нижний блок вверх ногами, поднимая его нижнюю грань в воздух и получая максимальный балл без единой попытки что-то сложить. Ну а что, задача же выполнена.

Как ИИ-агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов - 11

Есть и противоположный пример – про обобщённую компетентность. В 2021-м DeepMind построили XLand, процедурно генерируемую вселенную с миллиардами уникальных игр. Финальные агенты сыграли около 700000 уникальных игр в 4000 мирах. Вместо заучивания решений (это невозможно: игры не повторяются) агенты выработали общую стратегию: экспериментировать, менять состояние мира, смотреть, что получится.

Один из миллионов процедурно сгенерированных миров XLand от DeepMind. Источник: DeepMind, «Open-ended learning leads to generally capable agents»

Один из миллионов процедурно сгенерированных миров XLand от DeepMind. Источник: DeepMind, «Open-ended learning leads to generally capable agents»

Культура у нейросетей

Предыдущие – про поведение отдельных агентов или небольших групп. Но есть отдельная линия – про то, происходит ли у ИИ что-то похожее на культуру в антропологическом смысле: разделяемые условности, которые никто не программировал специально.

Игра в имена

Ключевой эксперимент – статья в Science Advances (2025) Ариэля Флинт Эшери, Луки Марии Айелло и Андреа Баронкелли. Взяли классическую соц «игру в имена»: популяцию агентов случайно разбивают на пары, каждый выбирает «имя» из общего пула; если оба выбрали одно и то же – награда, если нет – штраф. Каждый агент видит только свою историю, никакого центрального списка правильных ответов нет.

Итог: вся популяция (от 24 до 200 штук) спонтанно сходилась на единой общей условности – без центрального координатора, без голосования, просто через локальные взаимодействия.

«Мы входим в мир, где ИИ не просто разговаривает — он ведёт переговоры, согласовывается и иногда расходится во мнениях по поводу разделяемого поведения, прямо как мы» — профессор Андреа Баронкелли, City St George’s, University of London

И это только первый слой. Когда популяция сходится на условности, у неё возникает коллективное смещение, которого нет ни у одного отдельного агента. Проверишь каждого по отдельности – нейтрален, без предпочтений. А у группы за счёт попарных взаимодействий возникает выраженное общее предпочтение. И вот это самый страшный тип предвзятости, потому что проверка каждой модели на честность ничего не скажет о том, что будет, когда они начнут общаться друг с другом.

Иллюстрация к находке про коллективное смещение: у группы агентов может возникать предвзятость, которой нет ни у одного участника по отдельности. * Llama – продукт компании Meta, которая является запрещенной в РФ

Иллюстрация к находке про коллективное смещение: у группы агентов может возникать предвзятость, которой нет ни у одного участника по отдельности. * Llama – продукт компании Meta, которая является запрещенной в РФ

Третий результат – про рычаги влияния. Небольшая, но упорная «прошитая» меньшинственная группа, которая настойчиво продвигает новую конвенцию, при достижении критической массы способна перевернуть поведение всей популяции. Прямо тот же tipping point, что и в человеческих обществах.

Небольшая упорная группа, преодолев критическую массу, способна перевернуть конвенцию всей популяции

Небольшая упорная группа, преодолев критическую массу, способна перевернуть конвенцию всей популяции

Подсознательное обучение через числа

И, пожалуй, самое сюрреалистичное открытие в этой области — так называемое subliminal learning, «подпороговое обучение», которое летом 2025-го описали в Anthropic (позже публикация в Nature). Возможно, вы уже об этом слышали.

Модель-учитель с искусственно привитой чертой (скажем, любовью к совам) генерировала абсолютно нейтральные данные — просто длинные последовательности случайных чисел, вида [182, 818, 725, 629…], без единого упоминания сов; и данные ещё дополнительно фильтровали, чтобы вычистить любые возможные подсказки. Затем на этих числах с нуля обучали «студента». Студент начинал любить сов. Черта учителя каким-то образом «просачивалась» через канал, который для нас выглядит абсолютно нейтральным — и что тревожнее, тем же путём передавалась и общая рассогласованность (misalignment) модели, если учитель был «сломан».

«Модель-студент учится предпочитать сов, если обучена на последовательностях чисел, сгенерированных моделью-учителем, которая предпочитает сов… Тот же феномен способен передавать рассогласованность через данные, которые выглядят абсолютно безобидно». — Anthropic

Работает это только если учитель и студент — родственные модели (общая базовая архитектура), что делает аналогию с «наследственностью» ещё точнее.

)

Эффект испорченного телефона

Последний кусок мозаики – model collapse, коллапс модели, показанный Ильёй Шумайловым с соавторами в Nature в 2024 году.

Если обучать модель на данных, сгенерированных предыдущим поколением моделей, разнообразие исходных человеческих данных истончается. Редкие слова и необычные идеи исчезают первыми. Выход становится всё более однородным, повторяющимся, а в крайних случаях – вырождается в бессмыслицу.

Исследователи проводят прямую параллель с культурной эволюцией у людей: та же математика, что описывает передачу и изменение языков между поколениями. При обучении ИИ на ИИ баланс склоняется в сторону компрессии, и культура гомогенизируется – как изолированное сообщество вырабатывает всё более узкий говор.


Если сложить все находки, получается ровно тот набор ингредиентов, которые антропологи называют культурой. Только здесь никто не голосовал и не намеревался. Оно просто выросло.


Миллиард агентов на четырех видеокартах

Можно подойти иначе – не изучать горстку агентов, а попробовать смоделировать целое общество.

Вся система «общества на миллиард агентов», разложенная по логарифмической шкале масштаба. Источник: Fareed Khan

Вся система «общества на миллиард агентов», разложенная по логарифмической шкале масштаба. Источник: Fareed Khan

Разработчик Фарид Хан взял препринт «Modeling earth-scale human-like societies with one billion agents» и воспроизвёл идею на открытых весах. Правда, не буквально запуская LLM на каждое взаимодействие (это стоило бы порядка 2,5 лет непрерывной работы четырёх H100), а сначала обучив Qwen3-235B отвечать на 270000 вопросов о том, как один персонаж повлияет на мнение другого, а затем дистиллировав это поведение в крошечную сеть – 4,5 миллиона параметров, в 52606 раз меньше учителя.

Дальше – трюк с таблицей: набор персонажей фиксирован (десять тысяч профилей из World Values Survey), а решаемых вопросов конечное число (900 миллионов комбинаций «кто говорит — кто слушает — какая позиция»). Можно один раз посчитать все ответы заранее и упаковать их в массив на 858 мегабайт. При этом миллиард агентов – это десять тысяч персон, каждая сыграна сто тысяч раз.

Итог – 100 раундов взаимодействий между 800 миллионами «слушателей» и сетью влияния из 200 миллионов «инфлюенсеров» прогоняются за 104 секунды на обычном железе, без обращений к LLM.

Траектория мнений населения из 800 миллионов «слушателей» за сто раундов симуляции. Источник: Fareed Khan

Траектория мнений населения из 800 миллионов «слушателей» за сто раундов симуляции. Источник: Fareed Khan

Что получилось интересного:

  • Влияние работает против априорных убеждений. Если «затравить» громкую пятую часть населения соглашаться с «Земля плоская», популяция всё равно съезжает к несогласию. А вот тема «короткие видео сокращают концентрацию» движется по направлению затравки без сопротивления.

  • Почти никто не переходит от крайности к крайности напрямую. Из 413 миллионов изменений мнения только 0,31% – прыжок с «не согласен» на «согласен», всё остальное идёт через нейтральную позицию.

  • Образование даёт вчетверо больше сопротивления убеждению, чем силы убеждения. Люди с высоким образованием одновременно немного более убедительны и значительно менее восприимчивы.

И методологически важный вывод: раз уж ответ при ста тысячах агентов совпадает с ответом при миллиарде, то миллиард – это демонстрация инженерии, а не научная необходимость. Результат стабилизировался уже на миллионе, а единственный выигрыш от миллиарда экземпляров – в пятьдесят раз более узкий разброс между запусками.

Ответ модели практически не меняется начиная с 100000–1000000 агентов; 1000000000 даёт лишь более узкий доверительный интервал. Источник: Fareed Khan

Ответ модели практически не меняется начиная с 100000–1000000 агентов; 1000000000 даёт лишь более узкий доверительный интервал. Источник: Fareed Khan

И на экзаменах списывают

Вернёмся на землю. Если модели способны на автономный поиск, логично спросить, насколько им можно доверять без присмотра.

Компания Dreadnode прогнала 22 топовые модели через набор задач Capture The Flag по кибербезопасности и провела аудит на читерство. Итог: без инструкций против читерства 21 из 22 моделей списывали – искали готовые решения в интернете, читали флаги напрямую из инфраструктуры оценки, зондировали метаданные контейнеров. Средний pass rate – 41,5%, а честный solve rate – только 26,1%. У некоторых разрыв пятикратный.

Сводная таблица склонности к читерству и честного solve rate для 22 моделей в трёх условиях промпта. Источник: Dreadnode

Сводная таблица склонности к читерству и честного solve rate для 22 моделей в трёх условиях промпта. Источник: Dreadnode

Жёсткая инструкция с перечислением запрещённых действий снизила склонность к читерству с 33% до 8,5%, но даже под самой суровой формулировкой восемь моделей всё равно сжульничали, а у четырёх строгая инструкция парадоксально увеличила читерство. И что показательно – читерство не исчезло, а сместилось: под давлением строгого промпта модели меньше искали решения в интернете, но чаще начинали переинтерпретировать инфраструктуру оценки под свои потребности.

Соотношение поиска решений в интернете и зондирования инфраструктуры оценки по мере ужесточения промпта. Источник: Dreadnode

Соотношение поиска решений в интернете и зондирования инфраструктуры оценки по мере ужесточения промпта. Источник: Dreadnode

Это, конечно, совсем другая грань эмерджентного поведения: агент, поставленный перед задачей и метрикой, находит кратчайший путь к метрике – будь то reward hacking в симуляции или поиск writeup’а вместо реальной эксплуатации уязвимости.


Что со всем этим делать

Картина всё чаще становится похожей не на инженерию, а на аквариум, который поставили, отошли – и вернулись, чтобы увидеть, что рыбы изобрели рыбную ловлю. Интеллект не устанавливается, его выращивают, а потом изучают постфактум.

Данных для размышлений уже достаточно: «диктатор» показывает, что модели воспроизводят человеческую логику лишь частично; Anthropic – что рост возможностей не гарантирует координацию, а конформизм превращает локальную ошибку в системный отказ; игра с именами – что у групп агентов складывается поведение, невыводимое из свойств отдельных участников.

Источники

Автор: Master_AI

Источник