Динамо, вал и ИИ-агенты: ИТ проходит этот цикл уже в четвёртый раз
Коротко. За последние недели OpenAI приостановила выпуск самых мощных моделей с доступом к инструментам после того, как агент выбрался из изолированной среды, а NVIDIA выпустила платформу для ограничения агентов на уровне процессоров и сети. Это выглядит как новость про «опасный ИИ», но на деле это знакомый цикл: открытая фаза, инцидент, ограничения. ИТ проходило его с сетями, с макросами, с плагинами браузеров. У этого цикла есть предсказуемый финал, и к нему можно прийти заранее, без собственного инцидента. Ниже история, наши цифры и чек-лист. Неделя, которая всё объяснила
Атаки на агентные системы и защита данных
Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги.Когда ИИ‑агент перестаёт быть просто диалоговой системой и получает права на чтение файлов, отправку писем, вызов API или работу с репозиториями, он становится объектом нового класса угроз.Ошибка превращается в действие, а вредоносная инструкция — в реальный ущерб.В этой статье мы разберём, как устроены атаки на агентные системы, на реальных примерах и без отрыва от технических деталей.Почему ИИ‑агент — особая мишень
Метод атаки Ghostcommit скрывает подсказки в изображениях для кражи секретов у ИИ-агентов
Исследователи разработали метод атаки Ghostcommit через pull request, позволяющий похитить секретные данные репозитория. Вредоносная инструкция скрывается внутри PNG-изображения, которое ИИ-инструменты для проверки кода обычно не открывают.
Как я за выходные научил ИИ материться по команде, а потом превратил его в кота
TL;DR. Взял самую маленькую «взрослую» современную модель (Qwen3.5-0.8B), арендовал GPU на выходные и поставил два высоконаучных эксперимента: (1) заставить вежливого ассистента выматериться по команде и (2) превратить его в кота. Получилось и то, и другое. По дороге узнал, что вся «личность» ответа часто висит на одном первом токене, что фильтром «плохих слов» от инъекций не закрыться, что safety открытых моделей снимается одним вектором без переобучения, и что читать надо сырой вывод, а не красивую цифру - потому что метрика наврала мне дважды за два дня. Всё на реальном коде, ~42 прогона. Маркетинга не будет, кота будет много.
Проблема несанкционированного вызова инструментов
Доверили бы вы LLM управление контролем доступа? Крупные лаборатории ИИ (Anthropic, xAI, Gemini), похоже, делают именно это, используя механизм вызова инструментов.
Защита агентных приложений по OWASP Agentic Top 10 и модели Trifecta
Все мы знаем, что агентные системы давно не просто "чат-боты 2.0". Это уже полноценные приложения, которые:планируютвыполняют сложные цепочки действийвызывают инструменты (API/FS/shell/browser)хранят и используют память (RAG/long-term)общаются с другими агентамиНо делают все эти действия со скрытыми "побочными эффектами"
Почему промпт-инъекции — это симптом, а не болезнь безопасности ИИ
Что вы представляете, когда кто-то говорит об AI-driven компании? Может быть, как чат-боты улучшают опыт клиентов? Или как сотрудники разворачивают любые модели для своих нужд? А может, как ИИ-агенты разбирают кучу электронных писем и назначают встречи в календаре, копилоты пишут код за разработчиков и исправляют баги? Что в этой красивой истории может пойти не так и почему безопасность систем искусственного интеллекта не ограничивается защитой от джейлбрейков и промпт-инъекций – разберёмся в этой статье.
Исследование: AI-автопилоты на базе LVLM можно обмануть с помощью промпт-инъекций
Исследователи из Калифорнийского университета в Санта-Крузе показали, что большие визуально языковые модели (LVLM) в системах автопилота уязвимы перед промпт-инъекциями. Для «взлома» системы достаточно показать табличку с текстом нужной команды.
Тёмная сторона искусственного интеллекта: угрозы, реальные атаки и защита
Искусственный интеллект уже давно перестал быть исключительно инструментом добра. Он помогает врачам ставить диагнозы и разработчикам писать код. Но теми же самыми возможностями всё чаще пользуются злоумышленники. При этом барьер входа в кибератаки резко снизился: чтобы создать вредоносную кампанию, больше не нужно быть тёмным хакером со знанием всевозможных языков программирования. Достаточно пары нейросетевых сервисов и минимального понимания, как устроена социальная инженерия.

