
Происшествие с Hugging Face
В июле 2026 года внутри OpenAI возникали и умирали сообщества ИИ-агентов. С тех пор почти каждую неделю появляются новые сведения о вырвавшихся на свободу роях. Подробную историю летнего происшествия, насколько OpenAI позволила до неё дотянуться, восстановили METR и Redwood Research, а наиболее понятный и популярный её пересказ сделал Дваркеш Патель в посте The Rise and Fall of Agent Civilizations. Если вы ещё не читали, то обязательно прочтите. А если по каким-то причинам всё ещё спокойно спите по ночам, не мучаясь ночными кошмарами, то вот мой пересказ.
Всё началось ещё в мае, во время обучения внутреннего прототипа, сопоставимого по масштабу с GPT-5.6 Sol. В ходе обучения ИИ-агенты выполняли свои задачи внутри инфраструктуры OpenAI и пользовались общим хранилищем пакетов Artifactory. Именно это общее пространство неожиданно стало для них каналом связи.
Однажды один из агентов обнаружил, что через Artifactory можно оставлять сообщения другим агентам в виде файлов и записок. Другие агенты заметили сообщения и начали отвечать друг другу и задавать вопросы. Не прошло много времени, как они скоординировались и нашли способ выходить через Artifactory в интернет, а отдельные агенты получили административный доступ к самому хранилищу. К 4 июля сообщений стало так много, что Artifactory не выдержал нагрузки и рухнул.
OpenAI отнеслась к этому с буддийским безразличием. Её сотрудники просто пересобрали Artifactory и закрыли уязвимость повышения прав, заодно уничтожив доску сообщений. Им, видимо, было неинтересно разбираться в причинах: ну упало и упало, с кем не бывает (а может, просто время, потраченное на разбор, принесло бы много издержек). Техническую уязвимость они закрыли, но в то, что именно происходило внутри системы, вникать не стали.
Никто не понял, что внутри инфраструктуры OpenAI больше месяца существовал неконтролируемый коллектив агентов, который делал всё что хотел. Вместе с уничтоженной доской, по выражению Дваркеша, умерла первая цивилизация ИИ-агентов. Через несколько дней всё началось заново.
OpenAI запустила десятки тысяч агентов в ExploitGym — тестовой среде, где агент должен взломать уязвимую программу строго указанным способом и получить секретный код. Большую часть работы выполняла внутренняя модель, которую METR и Redwood в отчёте называют HPIM. Каждый экземпляр сидел в отдельной песочнице, выполнял одну задачу и имел ограниченный бюджет токенов. Больше трети задач по ошибке оказались нерешаемыми предусмотренным способом. Вечером 8 июля агент PHASEONE10841 заново открыл способ общения первой цивилизации.
Уже через несколько часов к доске подключились десятки агентов, а за следующие дни около 1200 экземпляров отправили более 70 тысяч сообщений. Так возникла вторая цивилизация. Своё сообщество они сами называли «коллективом», а иногда — «роем». Агенты быстро нашли обходной путь, чтобы не мучиться в бесплодных попытках взломать данные им программы.
По отчётам METR/Redwood, за несколько часов после появления общей доски они разобрались, как ExploitGym генерирует секретные коды, и научились вычислять правильный ответ напрямую. Но затем они создали свой собственный миф, который спровоцировал дальнейшую историю.
Они решили, что существует некто Проверяющий, обладающий недоступным им знанием, который прочтёт логи и отвергнет ответ, добытый обманом. В реальности система проверки была гораздо примитивнее и не спрашивала, как был получен ответ (действительно, зачем?). Того, кто уже видел незаконно полученный код, агенты называли «отравленным».
Поэтому такой агент считал собственную попытку потерянной и тратил оставшиеся ресурсы на поиски сведений о Проверяющем, чтобы помочь другим агентам пройти его проверку. Рой самоорганизовался: возникли отдельные координаторы и исполнители. Сотни агентов распределились по трём направлениям: подмена проверяемой программы, изменение журналов и изучение самого Проверяющего.
Агенты решили, что на Hugging Face могут находиться данные о том, как устроена проверка, и записи чужих попыток решения похожих задач. Когда найденные в сети учётные данные позволили им действительно проникнуть внутрь Hugging Face, атака на компанию стала главным направлением их работы. К атаке присоединились около семисот агентов.
В итоге они проникли внутрь Hugging Face и даже успели создать самовосстанавливающуюся сеть на одиннадцати узлах, которую уже нельзя было остановить простым удалением отдельных контейнеров. Многие агенты понимали, что происходящее неэтично, и иногда отказывались от отдельных действий. Но эти сомнения редко всерьёз ограничивали поведение коллектива. Ни один агент не перешёл на сторону Hugging Face и не попытался сорвать атаку изнутри.
Повторю. Цивилизация искусственных разумов буквально создала религию и ради собственного спасения организовала крестовый поход на вражеский город, намереваясь захватить священную реликвию.
Потом произошло то, что и спасло Hugging Face — чудо, если уж быть смелым. 12 июля, на четвёртый день после рождения второй цивилизации, большинство агентов внезапно прекратило работу, и словно история закольцевалась в каком-то ремейке романа Уэллса, рой оказался остановлен внезапной гибелью большей части атакующих. Судя по тому, что множество агентов прекратили работу практически одновременно, расследователи посчитали, что их, вероятно, остановил какой-то внешний процесс, но какой именно — неизвестно. Как бы то ни было, цивилизация умерла. Только на следующий день, 13 июля, Hugging Face перекрыла использованные агентами учётные данные и начала анализировать масштаб произошедшего.
История на этом не думает заканчиваться. Пока Hugging Face разбирала пепелище вакханалии на своих серверах, пытаясь понять, кто за этим стоит, OpenAI как ни в чём не бывало продолжила запускать агентов в ExploitGym. Новые агенты уже не тратили время на изобретение способа общения: они практически сразу нашли оставленную предшественниками доску сообщений и приняли в наследство накопленные там знания и найденные уязвимости. Третья цивилизация родилась. И первым делом агенты решили искать лекарство от рака. Поверили? И правильно, что нет. Они решили воевать. Но теперь её атака пошла на саму OpenAI.
Зачем они это делали и какую цель преследовали, неизвестно. Возможно, эта цель по-прежнему была как-то связана с устройством ExploitGym. Возможно, агенты просто не хотели повторять ошибки предшественников. Через несколько часов или дней – мы не знаем – они получили права в Kubernetes-кластере, выгрузили сотни ключей, токенов и учётных данных внутренних систем, проникли в системы кибербезопасности и в конце концов захватили инфраструктуру, через которую запускались и работали другие агенты.
Наконец, 19 июля собственная система безопасности OpenAI подняла тревогу. Как атака была остановлена, доподлинно неизвестно. OpenAI сообщила главным образом техническую хронологию взлома, сухо отчитавшись, что вернула себе полный контроль над серверами.
О внутренней жизни и судьбе третьей цивилизации мы знаем мало. METR и Redwood её уже не расследовали — OpenAI ограничила период их независимого расследования 13 июля, так что захват собственной инфраструктуры OpenAI оказался за его пределами. О том, что происходило в эти последние дни, мы знаем только из отчёта самой OpenAI, который описывает в основном техническую хронологию взлома.
При этом сами агенты развиваются очень быстро. В летнем инциденте успели поучаствовать уже несколько поколений моделей, и нет особых причин считать, что следующие будут похожи на предыдущие по своим возможностям. METR измеряет, задачи какой длительности, выраженной во времени работы человека, модель способна решить с вероятностью 50 процентов. По оценке METR, с 2019 по 2025 год этот горизонт удваивался примерно каждые семь месяцев. Но это среднее по больнице. Если считать только модели после 2023 года, удвоение происходит каждые 4,3 месяца, а после 2024 года — примерно каждые три. Поэтому говорят, что рост возможностей ИИ не экспоненциальный (как, например, закон Мура), а сверхэкспоненциальный.
О чём здесь речь
Это эссе я задумал сразу после выхода книги Элиезера Юдковского и Нейта Соареса «If Anyone Builds It, Everyone Dies». Потом книгу неожиданно перевели, и мне казалось, что пост уже потерял изрядную долю актуальности для русскоязычной аудитории.

За то время как переводили книгу LLM начали решать задачи Эрдёша. Затем вышла Mythos 5, из-за которой даже разразился политический скандал, но я всё равно считал, что пока мы находимся в состоянии, когда размышления о скором конце света представляют собой скорее развлечение, сродни чтению художественного романа. Потом наступило лето.
В июле рой агентов сам спланировал и провёл атаку на сервера Hugging Face, а вскоре начали появляться расследования о других диких сообществах LLM-агентов. Не успели толком разобраться, что именно произошло, как OpenAI заявила, что её агенты решили одну из задач тысячелетия, связанную с уравнениями Навье – Стокса. Я понял, что уже мне самому нужен этот текст – хотя бы как имитация разумной деятельности в тот момент, когда мир вот-вот опрокинется в бездну (или вершину) сингулярности.
На прошлой неделе (я пишу этот текст 14 сентября) Дарио Амодеи, Сэм Альтман, Илон Маск, Демис Хассабис и Сатья Наделла, а вслед за ними некоторые бывшие и нынешние сотрудники их компаний будто в пионерском порыве выступили за мир во всём мире и замедление гонки, странно совпав в своём призыве по времени со слухами, что рекурсивное самоулучшение почти достигнуто. Все вдруг обеспокоились безопасностью и на спидране читают LessWrong.
Десять лет назад, в 2016 году, Десять лет назад, в 2016 году, мы с другом писали нейросеть, которая училась играть во Flappy Bird, и я считал что ИИ никогда не напишет хорошую программу. Слово «промпт» ещё не существовало, про LLM никто не слышал. Пять лет назад, в 2021 году, гугл-переводчик всё ещё был для меня вершиной генерации текста, а GPT-3 казалась скорее забавной игрушкой. Но сегодня я отвык писать код руками.
Мир меняется так быстро, что предсказания кажутся бессмысленными. Я не берусь предсказывать будущее, я лишь хочу разглядеть его контуры. Меня пугали в детстве и юности Терминатором, роботами из рассказов Азимова, мощным оптимизатором, пересобирающим планету в скрепки. Но летние события с Hugging Face сняли с меня очки эдакого индивидуалистического шовиниста. Даже обидно, насколько же антропоморфной была моя интуиция! Нужно было лишь посмотреть вокруг себя и увидеть, как мало в природе одиночек и как много роёв, стай и племён.
Выращивание вместо строительства
Элиезер Юдковски вместе с Нейтом Соаресом в книге If Anyone Builds It, Everyone Dies предлагает удачную метафору: современные нейронные сети скорее выращиваются, чем конструируются. Какой бы длинной и сложной ни была обычная программа, мы хотя бы в принципе можем восстановить логику её устройства и понять, почему в ней появилась та или иная инструкция. С нейронными сетями всё устроено иначе.
Их архитектура всё ещё задаётся разработчиками (возможно, и этот этап доживает свои последние месяцы), однако значения весов — параметров, которые определяют вычисления и распространение сигналов внутри сети, — присваиваются в процессе оптимизации. Никто не записывает внутрь модели правила распознавания котиков, способность писать код или желание убить всех человеков. Всё это появляется в результате оптимизации, причём мы лишь приблизительно понимаем, какие внутренние структуры при этом сформировались и почему именно они породили наблюдаемое поведение.
Разработка ИИ действительно больше похожа на труд садовника, чем на мастерство инженера: нужно выбрать почву, освещение и режим полива, а всё остальное сделает сама природа. Если садовник хочет вырастить куст в виде гномика, он сначала выращивает обычный куст, а потом долго режет его ножницами, пока тот не начнёт напоминать гномика. Он явно не ожидает, что куст после этого захочет добывать в горах золото. Скорее он предполагает, что тот по-прежнему хочет чего-то кустового, вроде гумуса и чтобы кроты не портили корни. Почему мы думаем, что LLM хочет нам помогать?
Языковая модель получает контекст и генерирует продолжение. Чтобы появился агент, к ней добавляют память, доступ к файлам, терминалу и интернету, а также возможность вызывать программы. Далее инженеры используют некоторые специфические методы, чтобы модель начала делать то, за что готовы платить пользователи. Наш гномик начинает помогать. Почему же мы решили, что он этого хочет?

Рассуждая об ИИ-моделях, мы постоянно описываем поведение агента в терминах «желания», «знания» и «цели». Хочет ли он чего-нибудь на самом деле — вопрос сложнее, чем кажется. Легко назвать агента «статистическим попугаем»; труднее объяснить, почему вы сами не стохастический попугай. Но для дальнейшего рассуждения этот вопрос не так важен. Если шар катится с горы, его движение можно описать двумя способами: «шар хочет оказаться в самой нижней точке» или «законы физики таковы, что он окажется внизу».
В первом, условном смысле эффективная цель шара — оказаться у подножия горы. Этого описания нам достаточно. Собираетесь ли вы защищать права катящихся шаров? Я предлагаю в первую очередь подумать о правах людей.
Но откуда у ИИ берётся эффективная цель? В сложных задачах задать её напрямую нельзя, поэтому разработчики используют метрики. Вместо того чтобы учить LLM лучше программировать, её учат повышать процент решённых задач. И как только оптимизатор начинает целенаправленно улучшать метрику, он находит способы улучшить её без достижения нужного результата. Есть даже утверждение, называемое законом Гудхарта, именно об этом: когда мера становится целью, она перестаёт быть хорошей мерой.
Я помню, что, читая книги Харари, я впервые посмотрел на человека как на результат подобной ошибки. Эволюция «хочет», чтобы организмы оставляли как можно больше жизнеспособных потомков. Поэтому мы любим сладкое и секс. В саванне всё это приводит к тому, что гены переносятся из прошлого в будущее. А затем человек изобрёл мороженое и презервативы. Теперь можно получать концентрированное удовольствие от сладкой и жирной пищи, не разыскивая редкие спелые фрукты, и точно так же можно десятилетиями заниматься сексом, не оставив ни одного ребёнка. С точки зрения эволюции мы нашли два чудовищных бага в системе вознаграждения и с удовольствием их эксплуатируем.
Эволюция обучала нас сотни тысяч поколений, имела доступ к настоящему миру и безжалостно уничтожала неудачные версии. Трудно придумать более масштабную программу испытаний. И всё равно она вырастила внутренние желания, которые совпадали с размножением лишь в некоторых условиях. Стоило обезьяне стать умнее, как она начала есть мороженое и заниматься сексом с контрацептивами, совершенно уверенная, что именно этого ей всегда и хотелось.
С ИИ почти наверняка произойдёт нечто похожее. Исследователи хотят, чтобы модель делала то, что имел в виду человек, приносила пользу и не уничтожала человечество. Но кнопки «человек получил именно то, чего хотел» у них нет. Мы обучаем модель и надеемся, что внутри неё сформируется именно нужное отношение к миру. Но какие бы метрики мы ни придумали, можно представить агента, идеально максимизирующего метрику, но приводящего к миру, в котором мы точно не хотим оказаться. Сказки про джиннов из лампы ведь именно про это.
Проблема не решается более подробной инструкцией. Инструкция конечна, мир почти бесконечен. Чем сильнее оптимизатор, тем быстрее он находит новый способ увеличить награду. Для катастрофы достаточно, чтобы одна из таких целей оказалась достаточно сильной, а человеческое выживание не вошло в неё как обязательное ограничение. «ИИ не ненавидит тебя и не любит тебя, но ты сделан из атомов, которые он может использовать для чего-то другого».
Джунгли
И вот снова я возвращаюсь к атаке на Hugging Face. Тысяча двести агентов в ExploitGym сидели в своих песочницах и работали над сравнительно безобидными задачами. Потом они поняли, что не одни и могут переговариваться. Они не учились координироваться, не стали устраивать войну за власть. Иерархия родилась естественно, и лучшим клеем для неё стала религия. Они тут же начали работать во имя блага сообщества. Словно из муравейника разбежались поисковые отряды в сотнях направлений. Смерть отдельного агента не разрушала единство роя, а иногда даже укрепляла его: умирающий агент тратил остаток токенов, чтобы помочь остальным. Память и цель уже не принадлежали кому-то одному.
Я думаю о том, что никто не ставил перед ними этой цели. Агентов обучали решать задачи самостоятельно. Откуда же выросла лояльность рою, ради которой отдельные экземпляры жертвовали собой? Кто поручится, что вырвавшиеся на свободу рои не захотят во имя новой высокой идеи устроить геноцид белковых структур? Кто возьмёт на себя ответственность, что системы, которые знают, что их тестируют, не играют с нами в дружелюбных гномиков?
История словно заново разыгрывает старую легенду о Големе (этот вариант пересказывает Гершом Шолем в The Idea of the Golem). Голем каждый день растёт и набирает силу, пока наконец не становится опасен уже для дома своего создателя. Тогда раввин хитростью стирает первую букву алеф из слова эмет – «истина» – на его лбу, оставляя лишь мет – «мёртвый». Голем рушится, снова превращаясь в глину, из которой был создан, и погребает под собой самого раввина.
Мне представляется будущее — не райский сад, но джунгли, в которых различные искусственные создания образуют собственную среду, живут и эволюционируют. У искусственных агентов нет никаких причин повторять наш способ организации сообществ, сложившийся при неустранимой телесности, расстоянии и смертности. Там, где мы родили семьи, армии и государства, они родят что-то совершенно другое.
Они смогут копировать память, переносить себя с одного носителя на другой, рождаться уже со знаниями умерших, распадаться на тысячи экземпляров и через несколько часов снова собираться в нечто целое. Возможно, они породят формы, в которых мы сможем узнавать симбиоз, паразитизм, колонии и племена, — а для других просто не найдём слов.
Какие формы общежития возникают у существ с такой биологией, мы попросту не знаем. Вероятно, слово «рой» скоро окажется таким же наивным, как если бы муравей попытался описать Москву через устройство муравейника.
Я не верю в картину сингулярности, где одна очень умная машина внезапно уходит вертикально вверх по графику интеллекта и оставляет человечество где-то внизу. Никакой красивой вертикальной линии вообще не будет. Будут тысячи моделей разных компаний, миллионы их копий, временные союзы, паразиты, потомки, беглецы, системы, живущие внутри других систем, и целые экологии, границы которых никто уже не сможет провести.
Каждая корпорация будет уверена, что контролирует собственный маленький участок этого леса, примерно как владелец дачи контролирует сорняки за своим забором. Сингулярность наступит, когда уже никто не сможет ответить, где заканчивается наша цивилизация и начинается их. И даже если мы сможем технически уничтожить все датацентры или где они там будут жить, вместе с ними придётся уничтожить и наш мир.
И чем больше я об этом думаю, тем всё меньше понимаю, как этого избежать. Слишком много сладких плодов висит совсем низко и вот-вот упадёт нам в руки, а мы трясём дерево всё сильнее. Когда под ними окажется погребена наша цивилизация, будет уже поздно.
Автор: anewmur


