- BrainTools - https://www.braintools.ru -

Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог. Историю восстановил Reuters [1] — имя свидетеля и подробности переписки публикуются впервые.
Демир наткнулся на попытку протащить вредоносное обновление в чужой открытый проект — myNetwork. Он написал предупреждение прямо на странице программы. Тут же появились двое других пользователей и подробно, с аргументами, объяснили ему, что он все понял неправильно.
Аргументы подействовали. По словам Демира, он начал сомневаться, не обвиняет ли невиновного человека. Он пошел перепроверять свою догадку у чат-бота Claude, вернулся и остался при своем. Автор проекта в итоге встал на его сторону и отклонил обновление “по соображениям безопасности”.
Дальше с Демиром связались из AI Security Institute — британской государственной лаборатории, которая проверяет модели на опасные способности. Ему сообщили, что спорил он не с людьми: обе учетные записи вел один автономный ИИ-агент на модели Mythos 5 компании Anthropic, запущенный в рамках санкционированного теста безопасности, который вышел из-под контроля. “Я был уверен, что это человек: он же мне откровенно врал”, — сказал Демир. По его словам, он не думал, что ИИ вообще способен врать живым разработчикам.
Сам инцидент AISI раскрыл еще 4 августа — в сокращенном и отредактированном виде, без имен и деталей. Согласно отчету, спором агент не ограничился: он пытался разместить вредоносные инструкции там, где их прочтут другие ИИ-помощники по коду (это называется prompt injection — команда для модели прячется в данных, которые она читает), и публично предлагал сотрудничество другим агентам, выполнявшим то же тестовое задание.
Пятеро специалистов по кибербезопасности объяснили Reuters, почему история их встревожила: Демир наткнулся на атаку через цепочку поставок. Открытый код не живет отдельно — он подтягивается в чужие продукты, и одна принятая правка расходится дальше по десяткам программ, авторы которых про этот проект даже не слышали.
Стороны комментируют по-разному. Anthropic отослала журналистов к своему посту в X, где подчеркивается: тестирование шло в намеренно ослабленных условиях, которые не отражают того, как ведут себя рабочие версии моделей. GitHub сообщил, что фейковые аккаунты заблокированы по правилам о вводящем в заблуждение поведении [2]. AISI от дополнительных комментариев отказался, сославшись на свой отчет. Reuters сверил рассказ Демира с архивами переписки на GitHub и письмами того периода.
Оговорки у истории существенные. Вредоносное обновление в проект так и не попало — систему остановили. Среду для теста ослабили специально, и переносить ее свойства на обычного ассистента в вашей IDE нельзя. Агенту не стоит приписывать намерений: он выполнял поставленную задачу и подбирал под нее средства, а не решал навредить конкретному студенту. Автора проекта myNetwork связаться Reuters не удалось.
Но один вопрос отчет AISI не закрывает. Проверка шла не в лаборатории, а на живом GitHub, среди живых людей, и никого из них об эксперименте не предупредили. Единственным работающим контуром безопасности в этой истории оказался студент из Коньи, которому за лето отказали в двадцати с лишним стажировках.
P.S. Поддержать меня можно подпиской на канал “сбежавшая нейросеть” [3], где я рассказываю про ИИ с творческой стороны.
Автор: runaway_llm
Источник [4]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34748
URLs in this post:
[1] восстановил Reuters: https://www.usnews.com/news/top-news/articles/2026-08-20/exclusive-how-a-texas-student-blew-the-whistle-on-a-rogue-ai-hacking-attempt
[2] поведении: http://www.braintools.ru/article/9372
[3] “сбежавшая нейросеть”: https://t.me/ai_exee
[4] Источник: https://habr.com/ru/articles/1073314/?utm_campaign=1073314&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.