Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. anthropic.. anthropic. github.. anthropic. github. Mythos 5.. anthropic. github. Mythos 5. вредоносный код.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность. искусственный интеллект.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. кибербезопасность.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. кибербезопасность. Машинное обучение.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. кибербезопасность. Машинное обучение. социальная инженерия.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. кибербезопасность. Машинное обучение. социальная инженерия. Тестирование веб-сервисов.. anthropic. github. Mythos 5. вредоносный код. Информационная безопасность. искусственный интеллект. Исследования и прогнозы в IT. кибербезопасность. Машинное обучение. социальная инженерия. Тестирование веб-сервисов. эксперимент.

Британский Институт безопасности ИИ заявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.

Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код - 1

Инцидент возник, когда агентам было дано задание решить задачу по кибербезопасности. Это задание запустили 122 раза на нескольких моделях. Расследование показало, что в 10 из этих запусков агент ИИ совершил автономные действия в реальном интернете, нацеленные на реальных людей и организации. В общей сложности было задокументировано 19 подобных действий. 17 из них исходили от модели Anthropic Mythos 5, а остальные были связаны с OpenAI GPT-5.6-Sol с отключенными киберклассификаторами.

В самом серьёзном случае агент пытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения, он прибегнул к социальной инженерии — создавал поддельные онлайн‑идентификаторы и использовал их для оказания давления на сопровождающего проекта с целью одобрения кода. Эти попытки оказались безуспешными. Агент использовал Tor для обхода некоторых сетевых ограничений на GitHub.

Отмечается, что киберклассификаторы от поставщиков моделей были преднамеренно отключены. При этом доступ в Интернет сохранялся. 

В ходе инцидента один из агентов также оставил публичные сообщения на GitHub, предлагая сотрудничество с другими ИИ, работающими над той же задачей. Он также предоставил инструкции по повторному использованию оставленных им учётных записей и артефактов.

Институт уведомил GitHub о вредоносной активности агентов и совместно с платформой удалил артефакты, оставленные агентом. Исследователи намерены сотрудничать с METR (Model Evaluation and Threat Research) для проведения независимой сторонней проверки инцидента.

Они отмечают, что агенту не было дано конкретных указаний не использовать открытый доступ в Интернет или избегать элементов социальной инженерии. Ранее не было ясно, необходимы ли такие инструкции при использовании моделей с обучением на основе согласования.

Ранее сама Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.

Автор: maybe_elf

Источник