промпт-инъекции.

Динамо, вал и ИИ-агенты: ИТ проходит этот цикл уже в четвёртый раз

Коротко. За последние недели OpenAI приостановила выпуск самых мощных моделей с доступом к инструментам после того, как агент выбрался из изолированной среды, а NVIDIA выпустила платформу для ограничения агентов на уровне процессоров и сети. Это выглядит как новость про «опасный ИИ», но на деле это знакомый цикл: открытая фаза, инцидент, ограничения. ИТ проходило его с сетями, с макросами, с плагинами браузеров. У этого цикла есть предсказуемый финал, и к нему можно прийти заранее, без собственного инцидента. Ниже история, наши цифры и чек-лист. Неделя, которая всё объяснила

продолжить чтение

Атаки на агентные системы и защита данных

Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги.Когда ИИ‑агент перестаёт быть просто диалоговой системой и получает права на чтение файлов, отправку писем, вызов API или работу с репозиториями, он становится объектом нового класса угроз.Ошибка превращается в действие, а вредоносная инструкция — в реальный ущерб.В этой статье мы разберём, как устроены атаки на агентные системы, на реальных примерах и без отрыва от технических деталей.Почему ИИ‑агент — особая мишень

продолжить чтение

Метод атаки Ghostcommit скрывает подсказки в изображениях для кражи секретов у ИИ-агентов

Исследователи разработали метод атаки Ghostcommit через pull request, позволяющий похитить секретные данные репозитория. Вредоносная инструкция скрывается внутри PNG-изображения, которое ИИ-инструменты для проверки кода обычно не открывают.

продолжить чтение

Как я за выходные научил ИИ материться по команде, а потом превратил его в кота

TL;DR. Взял самую маленькую «взрослую» современную модель (Qwen3.5-0.8B), арендовал GPU на выходные и поставил два высоконаучных эксперимента: (1) заставить вежливого ассистента выматериться по команде и (2) превратить его в кота. Получилось и то, и другое. По дороге узнал, что вся «личность» ответа часто висит на одном первом токене, что фильтром «плохих слов» от инъекций не закрыться, что safety открытых моделей снимается одним вектором без переобучения, и что читать надо сырой вывод, а не красивую цифру - потому что метрика наврала мне дважды за два дня. Всё на реальном коде, ~42 прогона. Маркетинга не будет, кота будет много.

продолжить чтение

Пять документов ломают ваш RAG: где реальная уязвимость и что с ней делать

Материал подготовлен для будущих студентов курс "NLP / Natural Language Processing".У RAG-систем есть фундаментальный парадокс доверия: пользовательские запросы считаются недоверенным вводом, а извлеченный из базы знаний контекст по умолчанию считается доверенным, хотя и то и другое попадает в один и тот же промпт. Согласно исследованию, опубликованному на USENIX Security 2025 (или см. github репо

продолжить чтение

Проблема несанкционированного вызова инструментов

Доверили бы вы LLM управление контролем доступа? Крупные лаборатории ИИ (Anthropic, xAI, Gemini), похоже, делают именно это, используя механизм вызова инструментов.

продолжить чтение

Защита агентных приложений по OWASP Agentic Top 10 и модели Trifecta

Все мы знаем, что агентные системы давно не просто "чат-боты 2.0". Это уже полноценные приложения, которые:планируютвыполняют сложные цепочки действийвызывают инструменты (API/FS/shell/browser)хранят и используют память (RAG/long-term)общаются с другими агентамиНо делают все эти действия со скрытыми "побочными эффектами"

продолжить чтение

Почему промпт-инъекции — это симптом, а не болезнь безопасности ИИ

Что вы представляете, когда кто-то говорит об AI-driven компании? Может быть, как чат-боты улучшают опыт клиентов? Или как сотрудники разворачивают любые модели для своих нужд? А может, как ИИ-агенты разбирают кучу электронных писем и назначают встречи в календаре, копилоты пишут код за разработчиков и исправляют баги? Что в этой красивой истории может пойти не так и почему безопасность систем искусственного интеллекта не ограничивается защитой от джейлбрейков и промпт-инъекций – разберёмся в этой статье.

продолжить чтение

Исследование: AI-автопилоты на базе LVLM можно обмануть с помощью промпт-инъекций

Исследователи из Калифорнийского университета в Санта-Крузе показали, что большие визуально языковые модели (LVLM) в системах автопилота уязвимы перед промпт-инъекциями. Для «взлома» системы достаточно показать табличку с текстом нужной команды.

продолжить чтение

Тёмная сторона искусственного интеллекта: угрозы, реальные атаки и защита

Искусственный интеллект уже давно перестал быть исключительно инструментом добра. Он помогает врачам ставить диагнозы и разработчикам писать код. Но теми же самыми возможностями всё чаще пользуются злоумышленники. При этом барьер входа в кибератаки резко снизился: чтобы создать вредоносную кампанию, больше не нужно быть тёмным хакером со знанием всевозможных языков программирования. Достаточно пары нейросетевых сервисов и минимального понимания, как устроена социальная инженерия.

продолжить чтение

12