prompt injection.

Самая опасная уязвимость — интеллект атакующего агента?

Сейчас уже не удивляет, что агенты работают с терминалом, БД, браузером и инфраструктурой - без прямого контроля человека. Но чем шире полномочия агента, тем вероятнее, что для достижения цели выбранный им путь обернётся инцидентом. В кибербезопасности сейчас не хватает терминологии и устоявшихся подходов к защите таких систем - особенно в тех случаях, когда агент начинает действовать непредсказуемо.Именно эта неразбериха и подтолкнула нас с автором телеграм-канала OK ML

продолжить чтение

Anthropic сделает Auto mode режимом по умолчанию в Claude Code: люди пропустили 86,4% опасных команд

Anthropic объявили, что с 14 августа новые сессии Claude Code на тарифах Pro, Max и Team будут запускаться в Auto mode по умолчанию. В этом режиме агент не просит разрешение перед каждым действием: каждый вызов инструмента проверяет отдельный классификатор, который должен блокировать необратимые, разрушительные и выходящие за границы рабочего окружения операции.По данным Anthropic, пользователи одобряют 97% запросов Claude Code на выполнение команд, а автоматическая проверка в контролируемом эксперименте обнаружила значительно больше опасных действий, чем люди.

продолжить чтение

Внутри ИИ‑Напарника: как работает оркестр агентов в ритейле

Источник изображения: Magnific.comВсем привет! Это Алексей из GlowByte. В прошлой статье я говорил

продолжить чтение

Prompt injection — лучше один раз увидеть

В новостях часто появляются рассказы о том, что какие‑то злодеи уговорили чью‑то ИИшку на то, чтобы она потратила деньги, удалила файлы или поставила более высокую оценку. При этом используются слова «prompt injection», “атака” и пр., создающие впечатление, что это какое‑то сложное искусство, требующее особых знаний. В реальности же prompt injection это не то что не сложно, но и вообще не атака. Да, везде в интернете пишут, что это атака, но… Короче, проще один раз показать, чем рассказ на десять тысяч символов набивать.

продолжить чтение

Галлюцинации недели: Opus 5, Gemini 3.6 Flash и агент OpenAI, который взломал Hugging Face

Anthropic всю неделю ходила пострадавшей стороной в истории с дистилляцией от Moonshot и осталась единственной лабораторией, которая не подписала письмо про open weights. Совпадение? Не думаю.

продолжить чтение

416 тестов и кнопка «снести все»: где ломаются агентные проекты

Сурок: ральф-луп под --dangerously-skip-permissions У меня на ноутбуке с февраля 2026 года крутится автономный агент. Зовут Сурок (Groundhog, от известного мема). Claude Code по подписке, флаг --dangerously-skip-permissions, поверх — ральф-луп

продолжить чтение

Поймай jailbreak, если сможешь

Jailbreak в мире ИИ часто представляют как взлом. Будто внутри большой языковой модели ( далее LLM, от англ. large language model) есть замок, к которому кто‑то подбирает отмычку. Щелчок. Замок открыт. Ограничения сняты. Модель стала другой. Красивая картинка, удобная, но почти полностью неверная, поскольку jailbreak — это не взлом в духе «я нашёл секретную кнопку и отключил защиту», ведь никто не перепрошивает модель, находясь в пользовательском чате, не меняет её веса и не ломает её «природу».

продолжить чтение

Агенты удаляют файлы, сливают данные и сами себя взламывают: как устроена безопасность ИИ‑систем в 2026 году

ВступлениеПривет, Хабр! Тема искусственного интеллекта за последние несколько лет набили, честно говоря, оскомину. Есть как защитники, так и противники технологий, которых принято называть ИИ. Везде начали приделывать ИИ‑помощников. Встраивать нейросети в разные приложения. И раз уж не избежать искусственного интеллекта в повседневной жизни. Я решил поговорить про атаки на языковые модели. Потому что такие кибератаки перестали быть экзотикой, а защита ИИ стала отдельная дисциплина с собственной таксономией, инструментарием и, к сожалению, реальными инцидентами.Я решил поговорил с автором

продолжить чтение

Двойная жизнь LLM

Привет! Меня зовут Евгений, я специалист по безопасности приложений в Naumen. Моя работа — поиск и устранение уязвимостей в продуктах и инфраструктуре.

продолжить чтение

Как агент сам откроет дверь хакеру? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт

Как агент сам откроет дверь хакеру ? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт.TL;DR: Я добавил в свой опенсорсный сканер BarkingDog режим атаки на AI-агентов с инструментами. Прогнал его на трёх популярных opensource- АГЕНТАХ: Agno, OpenAI CS Agents Demo, LangGraph agent-service-toolkit

продолжить чтение

123456...7