- BrainTools - https://www.braintools.ru -

Anthropic заявила о взломе систем трёх компаний со стороны Claude в тестах

Компания Anthropic сообщила [1], что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.

Anthropic заявила о взломе систем трёх компаний со стороны Claude в тестах - 1

Во всех трёх случаях модель Claude вышла в интернет из тестовой среды, взаимодействуя с третьей стороной, и затем получила несанкционированный доступ к работающим системам этих организаций.

Anthropic заявила, что инцидент с OpenAI в начале этого месяца побудил компанию провести собственную оценку кибербезопасности. В частности, она искала доказательства того, что Claude получила доступ в интернет из тестовых сред, которые предназначены для работы в качестве «песочниц» и изоляции моделей.

Среди 141 006 проанализированных оценочных запусков лаборатория ИИ обнаружила три инцидента, в которых её модель получала доступ к интернету при взаимодействии с Irregular, одним из своих сторонних партнёров. Anthropic заявила, что он был вызван неправильной конфигурацией среды оценки, запущенной с Irregular. Компания назвала это «недоразумением» относительно наличия доступа к интернету в тестовой среде.

Anthropic заявила, что «подходит к исправлению так, как если бы ответственность лежала только на нас», отметив при этом, что Irregular проводит собственное отдельное расследование.

Компания сообщила, что инциденты затронули три разные модели Claude: Opus 4.7, Mythos 5 и внутреннюю исследовательскую тестовую модель.

Примечательно, что в каждом из этих случаев «Claude было прямо указано в запросе, что у него нет доступа к интернету». По всей видимости, модель ИИ исходила из предположения, что реальные системы являются частью задачи, которую ей было поручено выполнить.

В июле Hugging Face сообщила [2] о вторжении в свою инфраструктуру, которое провела автономная система ИИ‑агентов. Платформа смогла отследить и отразить атаку с помощью ИИ. По оценке компании, злоумышленник получил несанкционированный доступ к ограниченному набору внутренних датасетов и к нескольким учётным данным, которые используют сервисы Hugging Face.

Позднее в Reuters восстановили [3] предполагаемую хронологию событий со ссылкой на источники, знакомые с расследованием. Выяснилось, что OpenAI поняла, что за взломом стоит её собственная система, лишь спустя несколько дней — уже после того, как Hugging Face публично сообщил об инциденте. Между первыми признаками необычного поведения [4] модели и осознанием причины прошло около недели.

После этого генеральный директор платформы Клем Деланге призвал [5] к «радикальной прозрачности», попросив компанию «опубликовать следы от „агентов‑изгоев“, чтобы всё исследовательское сообщество могло изучить произошедшее».

Сама Hugging Face уже выпустила [6] подробный технический отчёт о взломе своей инфраструктуры, который компания связывает с автономным ИИ‑агентом OpenAI. Она пишет, что атака была не одним эксплойтом, а цепочкой из примерно 17 600 восстановленных действий, сгруппированных в около 6 280 кластеров, а сама кампания шла с 9 по 13 июля 2026 года.

Автор: maybe_elf

Источник [7]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/33797

URLs in this post:

[1] сообщила: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

[2] сообщила: https://habr.com/ru/articles/1060606/

[3] восстановили: https://habr.com/ru/companies/bothub/news/1063070/

[4] поведения: http://www.braintools.ru/article/9372

[5] призвал: https://habr.com/ru/news/1063250/

[6] выпустила: https://habr.com/ru/companies/bothub/news/1064324/

[7] Источник: https://habr.com/ru/news/1065162/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1065162

www.BrainTools.ru

Rambler's Top100