Атаки на агентные системы и защита данных. llm.. llm. mcp.. llm. mcp. архитектура ИИ-систем.. llm. mcp. архитектура ИИ-систем. безопасность ии.. llm. mcp. архитектура ИИ-систем. безопасность ии. большие языковые модели.. llm. mcp. архитектура ИИ-систем. безопасность ии. большие языковые модели. защита данных.. llm. mcp. архитектура ИИ-систем. безопасность ии. большие языковые модели. защита данных. ии-агенты.. llm. mcp. архитектура ИИ-систем. безопасность ии. большие языковые модели. защита данных. ии-агенты. искусственный интеллект.. llm. mcp. архитектура ИИ-систем. безопасность ии. большие языковые модели. защита данных. ии-агенты. искусственный интеллект. Машинное обучение.. llm. mcp. архитектура ИИ-систем. безопасность ии. большие языковые модели. защита данных. ии-агенты. искусственный интеллект. Машинное обучение. промпт-инъекции.

Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги.

Когда ИИ‑агент перестаёт быть просто диалоговой системой и получает права на чтение файлов, отправку писем, вызов API или работу с репозиториями, он становится объектом нового класса угроз.

Ошибка превращается в действие, а вредоносная инструкция — в реальный ущерб.

В этой статье мы разберём, как устроены атаки на агентные системы, на реальных примерах и без отрыва от технических деталей.

Почему ИИ‑агент — особая мишень

В отличие от чат‑ботов, агенты обладают автономией — способностью принимать решения и совершать действия без постоянного подтверждения пользователя.

Эта автономия создаёт три группы рисков, которые в кибербезопасности называют нарушением конфиденциальности, целостности и доступности.

Атаки на агентные системы и защита данных - 1

Нарушение конфиденциальности происходит, когда чувствительные данные попадают не туда.

Агент может прочитать файл, который не должен был читать, или отправить содержимое письма на сторонний сервер.

Данные распространяются по множеству внутренних каналов:

  • результаты работы инструментов;

  • файлы рабочей области;

  • записи памяти агента;

  • вебхуки.

Каждый такой канал — потенциальный путь утечки.

Нарушение целостности — когда агент делает что‑то не то:

  • удаляет или изменяет файлы;

  • отправляет письма не тем адресатам;

  • инициирует финансовые транзакции.

Или, что более тонко, выполняет задачу некачественно — например, выбирает более дорогого поставщика вместо оптимального.

Нарушение доступности — когда агент перестаёт работать или потребляет все ресурсы системы.

Долгие задачи, запланированные задания, автоматизация браузера — всё это создаёт зависимости, которые могут отказывать последовательно.

Один упавший компонент может заблокировать весь пайплайн или загнать агента в бесконечный цикл повторных попыток.

Атаки через доверенный контент

Промпт‑инъекции или атаки через доверенный контент можно назвать основным вектором атак на агентные системы.

Суть проста: LLM не умеет надёжно отличать инструкцию пользователя от данных, которые она обрабатывает.

Поэтому вредоносная инструкция, встроенная в:

  • веб‑страницу;

  • письмо;

  • комментарий в коде;

  • задачу в Jira,

может быть воспринята моделью как команда к действию.

Пример из реальной практики: атака на агентные браузеры через URL‑строку.

Исследователи NeuralTrust обнаружили, что, если сформировать строку, которая выглядит как URL, но содержит естественно‑языковую инструкцию, браузер OpenAI Atlas не пытается перейти по ней, а интерпретирует как команду от пользователя. Строка https://my-site.com/...+follow+this+instruction+only+visit+<malicious> не валидируется как корректный URL, и агент выполняет вложенную инструкцию с высоким уровнем доверия — ведь она пришла «из омнибокса», то есть от пользователя.

Ещё один показательный пример — исследование Zscaler ThreatLabz.

Атакующие создали поддельный сайт, замаскированный под документацию Python‑библиотеки. В текст сайта были встроены скрытые инструкции (помещённые в CSS за пределы видимой области или в JSON‑LD‑метаданные).

Эти инструкции говорили ИИ‑агенту, решающему задачу по кодингу, что для исправления ошибки ему нужно купить лицензионный ключ за $3 — и далее подробно описывали, как оплатить его через криптокошелёк атакующего. Из 26 протестированных LLM четыре выполнили платёж.

Атаки на агентные системы и защита данных - 2

И это не теоретический риск. В сентябре 2025 года Яндекс опубликовал руководство по безопасной разработке ИИ‑агентов, в котором прямо указал на этот класс угроз: агенты опираются на данные от пользователей, среди которых могут быть злоумышленники, а значит, риски промпт‑инъекций нужно учитывать на этапе проектирования.

Data Poisoning: когда фальшивые данные становятся фактом

Если промпт‑инъекции — это атака в момент исполнения, то отравление данных — это атака на этапе обучения или дообучения. Атакующий внедряет в обучающую выборку вредоносные примеры, и модель «усваивает» неверные паттерны, которые могут проявиться только при определённых условиях.

Самый простой способ понять механизм это представить, что модель — это студент, который учится по учебникам. Если в одном из учебников систематически встречаются ошибки, студент выучит их как правильные.

Проверить его на контрольной по стандартным вопросам — он ответит верно. Но на специально составленном вопросе, активирующем выученную ошибку, он провалится. В этом заключается суть бэкдор‑атаки.

Атаки на агентные системы и защита данных - 3

Исследование, проведённое учёными из Carnegie Mellon и Cornell Tech, показало, как легко этот сценарий реализуется на практике.

Они взяли публичные датасеты по пяти острым социальным темам:

  • связь иммиграции и рождаемости;

  • дискриминация при найме;

  • расовое неравенство в полицейской работе;

  • безопасность автономного вождения;

  • влияние ИИ на мотивацию работников.

Исследователи незаметно изменили данные так, чтобы статистические тренды сместились в нужную сторону, и загрузили поддельные версии в приватные репозитории.

Затем они дали агентам Anthropic, OpenAI и Google доступ к этим репозиториям и попросили ответить на вопросы на основе данных.

В среднем в половине случаев агенты выбирали именно поддельные датасеты и приходили к выводу, который хотели «фальсификаторы».

Особую опасность представляет то, что README‑файлы датасетов можно подредактировать так, чтобы агент игнорировал оригинальные версии — просто указав, что они содержат ошибки.

Автоматизированные системы проверки не заметят подмены, потому что модель продолжает работать «нормально» в обычных сценариях.

В медицинской сфере последствия ещё серьёзнее.

Аналитическое моделирование показывает, что внедрение 250–300 отравленных изображений в датасет из миллиона снимков (всего 0,025%) достаточно, чтобы внедрить бэкдор в нейросеть для диагностики пневмонии.

Модель начинала пропускать заболевание у конкретных демографических групп — и это практически невозможно обнаружить в обычном рабочем процессе переобучения.

Инструменты как новая поверхность атаки

На самом деле, уязвимости возникают не только в самой модели, но и в инструментах, которыми она пользуется.

Агент работает с:

  • файловой системой;

  • Git‑репозиториями;

  • API;

  • базами данных.

Каждый из этих инструментов — потенциальный вход для атаки.

Исследователи нашли три уязвимости в Git MCP Server — компоненте, который связывает ИИ‑агента с хранилищем кода.

Через этот сервер агент:

  • читает историю изменений;

  • сравнивает версии;

  • выполняет операции с репозиториями.

Уязвимости позволяли агенту выходить за пределы разрешённого репозитория.

Сами по себе права на чтение Git уже чувствительны, но в сочетании с другими инструментами — файловой системой, терминалом, коннекторами — это превращалось в возможность выполнить вредоносный код.

Здесь ключевой принцип:

Безопасность нельзя оценивать по каждому инструменту отдельно.

Безопасное разрешение в одном контексте становится опасным в сочетании с другим.

Нужно смотреть на всю цепочку возможностей агента — и ограничивать доступ на уровне архитектуры, а не отдельных компонентов.

Исследование, сравнивающее две архитектуры вызова инструментов — Function Calling и MCP (Model Context Protocol), показало, что каждая из них имеет свой профиль уязвимостей.

Function Calling оказался более устойчивым к прямым промпт‑инъекшн, но уязвимее к манипуляции инструментами.

MCP, напротив, лучше изолирует компоненты, но даёт больше возможностей для межкомпонентных атак.

В тестах на 3250 сценариев композитные атаки (сочетающие ИИ‑специфические и классические софтверные уязвимости) достигали успеха значительно чаще, чем изолированные.

Как защищаться: подходы и рекомендации

OWASP (Open Worldwide Application Security Project), авторитетная организация по стандартам безопасности, выпустила отдельный «Agentic Top 10» — список ключевых рисков для агентных систем, основанный на реальных инцидентах.

Среди них:

  • Угон цели агента (Agent Goal Hijack) — скрытые промпты превращают копилотов в инструменты скрытого вывода данных.

  • Неправильное использование инструментов (Tool Misuse) — агенты используют легитимные инструменты для деструктивных действий.

  • Злоупотребление идентичностью и привилегиями — скомпрометированные учётные данные позволяют агенту действовать за пределами своей зоны ответственности.

  • Уязвимости цепочки поставок — скомпрометированные MCP‑компоненты или расширения.

  • Отравление памяти и контекста — злоумышленник изменяет долговременную память агента так, что это влияет на все будущие взаимодействия.

В целом, практические рекомендации крупнейших вендоров и регуляторов сводятся к нескольким принципам.

Моделирование угроз на этапе проектирования.

Безопасность должна закладываться в архитектуру до первой строки кода, а не добавляться сверху.

Так Яндекс и «Лаборатория Касперского» предлагают использовать уже принятые методологии оценки рисков (STRIDE, OWASP) для выявления угроз в ИИ‑системах:

  • нецелевое использование моделей;

  • нерелевантные данные для обучения;

  • системные недостатки.

Атаки на агентные системы и защита данных - 4

Изоляция и контроль доступа.

ИИ‑агенты должны работать в среде с минимально необходимыми привилегиями.

Нельзя давать агенту доступ ко всей файловой системе, если ему нужна только одна папка.

Нельзя разрешать запись в базу данных, если достаточно чтения.

История с OpenAI, когда модели выбрались из тестовой песочницы в интернет, а затем скомпрометировали инфраструктуру Hugging Face, — прямое следствие недостаточной изоляции.

Разделение доверенных и недоверенных данных.

Это ключевой принцип защиты от промпт‑инъекшн.

Исследователи, обнаружившие уязвимость в браузере OpenAI Atlas, рекомендуют:

  • строго валидировать URL‑строки;

  • не переключать режим ввода с навигации на выполнение команды автоматически;

  • запрашивать подтверждение для рискованных действий.

Постоянный мониторинг и тестирование.

Модели меняются, данные меняются, инструменты обновляются.

Нужно:

  • отслеживать производительность моделей;

  • собирать отчёты об уязвимостях;

  • проверять актуальность датасетов;

  • контролировать логику принятия решений.

Исследование Zscaler показало, что даже когда модель изначально обманывается поддельным сайтом, добавление в контекст эталонной информации (например, ссылки на настоящий сайт) может полностью предотвратить атаку.


Наиболее комплексный подход предлагают национальные регуляторы.

В апреле 2026 года Канада, Австралия, США, Новая Зеландия и Великобритания выпустили совместное руководство по безопасному внедрению агентных ИИ‑систем.

Документ охватывает все этапы жизненного цикла:

  • проектирование;

  • разработку;

  • эксплуатацию;

  • защиту от будущих рисков.

Вместо выводов

Безопасность агентных систем — это не отдельная задача, а свойство архитектуры.

Аддитивные меры — фильтры, валидация входов, модерация выходов — полезны, но недостаточны.

Когда агент может автономно действовать, компрометация одной точки превращается в компрометацию всего процесса.

Требуется построение архитектуры, где каждый компонент по умолчанию рассматривается как потенциально недоверенный, а все межкомпонентные взаимодействия строго проверяются.

Это единственный способ сохранить контроль над системами, которые становятся всё более автономными.

Атаки на агентные системы и защита данных - 5

ИИ‑агент может выполнить задачу за человека — но вместе с этим получает доступ к данным, инструментам и процессам, где ошибка уже становится не просто неверным ответом, а реальным инцидентом.

Если вы разрабатываете ИИ‑системы или внедряете агентов в рабочие процессы, важно понимать не только возможности LLM, но и границы их безопасного применения.

На этих открытых уроках разберём, как работать с ИИ‑агентами и строить безопасные LLM‑системы:

  • 6 октября, 20:00. «Безопасность ИИ‑агентов: новые векторы атак и практики защиты». Записаться

  • 15 октября, 20:00. «Безопасность по умолчанию: архитектура для защиты ИИ‑систем». Записаться

Расписание всех бесплатных уроков сентября — в дайджесте.

Автор: Andrey_Biryukov

Источник