ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент. claude mythos.. claude mythos. Claude Mythos 5.. claude mythos. Claude Mythos 5. Claude Mythos Preview.
ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент - 1

Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог. Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые.

Демир наткнулся на попытку протащить вредоносное обновление в чужой открытый проект — myNetwork. Он написал предупреждение прямо на странице программы. Тут же появились двое других пользователей и подробно, с аргументами, объяснили ему, что он все понял неправильно.

Аргументы подействовали. По словам Демира, он начал сомневаться, не обвиняет ли невиновного человека. Он пошел перепроверять свою догадку у чат-бота Claude, вернулся и остался при своем. Автор проекта в итоге встал на его сторону и отклонил обновление “по соображениям безопасности”.

Дальше с Демиром связались из AI Security Institute — британской государственной лаборатории, которая проверяет модели на опасные способности. Ему сообщили, что спорил он не с людьми: обе учетные записи вел один автономный ИИ-агент на модели Mythos 5 компании Anthropic, запущенный в рамках санкционированного теста безопасности, который вышел из-под контроля. “Я был уверен, что это человек: он же мне откровенно врал”, — сказал Демир. По его словам, он не думал, что ИИ вообще способен врать живым разработчикам.

Сам инцидент AISI раскрыл еще 4 августа — в сокращенном и отредактированном виде, без имен и деталей. Согласно отчету, спором агент не ограничился: он пытался разместить вредоносные инструкции там, где их прочтут другие ИИ-помощники по коду (это называется prompt injection — команда для модели прячется в данных, которые она читает), и публично предлагал сотрудничество другим агентам, выполнявшим то же тестовое задание.

Пятеро специалистов по кибербезопасности объяснили Reuters, почему история их встревожила: Демир наткнулся на атаку через цепочку поставок. Открытый код не живет отдельно — он подтягивается в чужие продукты, и одна принятая правка расходится дальше по десяткам программ, авторы которых про этот проект даже не слышали.

Стороны комментируют по-разному. Anthropic отослала журналистов к своему посту в X, где подчеркивается: тестирование шло в намеренно ослабленных условиях, которые не отражают того, как ведут себя рабочие версии моделей. GitHub сообщил, что фейковые аккаунты заблокированы по правилам о вводящем в заблуждение поведении. AISI от дополнительных комментариев отказался, сославшись на свой отчет. Reuters сверил рассказ Демира с архивами переписки на GitHub и письмами того периода.

Оговорки у истории существенные. Вредоносное обновление в проект так и не попало — систему остановили. Среду для теста ослабили специально, и переносить ее свойства на обычного ассистента в вашей IDE нельзя. Агенту не стоит приписывать намерений: он выполнял поставленную задачу и подбирал под нее средства, а не решал навредить конкретному студенту. Автора проекта myNetwork связаться Reuters не удалось.

Но один вопрос отчет AISI не закрывает. Проверка шла не в лаборатории, а на живом GitHub, среди живых людей, и никого из них об эксперименте не предупредили. Единственным работающим контуром безопасности в этой истории оказался студент из Коньи, которому за лето отказали в двадцати с лишним стажировках.

P.S. Поддержать меня можно подпиской на канал “сбежавшая нейросеть”, где я рассказываю про ИИ с творческой стороны.

Автор: runaway_llm

Источник