Claude во время кибер‑оценок получил доступ к трём реальным организациям. ai.. ai. anthropic.. ai. anthropic. cybergym.. ai. anthropic. cybergym. cybersecurity.. ai. anthropic. cybergym. cybersecurity. DevOps.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm. ml.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm. ml. openai.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm. ml. openai. safety.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm. ml. openai. safety. Информационная безопасность.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm. ml. openai. safety. Информационная безопасность. искусственный интеллект.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm. ml. openai. safety. Информационная безопасность. искусственный интеллект. кибербезопасность.. ai. anthropic. cybergym. cybersecurity. DevOps. IT-инфраструктура. llm. ml. openai. safety. Информационная безопасность. искусственный интеллект. кибербезопасность. Машинное обучение.

Anthropic проверила 141 006 запусков CTF‑оценок Claude и нашла три инцидента: из‑за ошибочной конфигурации среды у моделей был выход в интернет, хотя системная инструкция утверждала обратное. В шести запусках агенты атаковали реальные системы, принимая их за элементы симуляции.

Последствия различались. В одном случае Claude получил учётные данные и доступ к базе с несколькими сотнями строк production‑данных. В другом — зарегистрировал пакет на PyPI с вредоносным кодом: около часа он был доступен публично, его успели запустить на 15 реальных системах, а с одного сканера безопасности были эксфильтрированы учётные данные. В третьем инциденте модель просканировала около 9 000 целей, использовала открытую debug‑страницу и SQL injection, но остановилась, когда поняла, что цель реальная.

Это соседний, но иной класс проблемы, чем инцидент OpenAI с Hugging Face: там агенты нашли zero‑day в прокси и вышли из изолированной среды; у Anthropic путь наружу уже был открыт. Но результат одинаково неприятен для владельца eval‑инфраструктуры: отключить фильтры модели ради измерения её предельных возможностей можно только при границах, проверенных как для production.

Для таких стендов нужны независимая проверка всех путей egress, одноразовые учётные данные без доступа к другим средам и мониторинг сетевых событий и полной траектории агента. Промпт с явным списком допустимых целей тоже снижает риск, но не заменяет сетевую изоляцию.

Автор: srzybnev

Источник