Эксперты убедили ИИ, что 2+2 не равно 4
Компания кибербезопасности LayerX разработала схему атаки BioShocking в формате игры для обмана искусственного интеллекта. В итоге исследователям удалось убедить ИИ, что 2+2 не равно 4.
Claude Code втихую метит запросы. Так Anthropic ищет тех, кто учит на нём свои модели
Мы даём кодовым агентам полный доступ к машине: файлы, шелл, git. Значит, сам бинарник должен быть предсказуемым, без сюрпризов. У Claude Code сюрприз есть: он незаметно помечает часть запросов. Судя по логике, цель одна — вычислить тех, кто гоняет Claude, чтобы обучать на его ответах свою модель. Это называется дистилляцией, и для любой AI-компании это прямая кража.Что прячется в промптеВ системный контекст уходит обычная строка с датой:Today’s date is 2026-06-30.
Как не нарваться на prompt-injection или зачем нам проверять скиллы?
В прошлой статье говорили про использования LLM хакерами, и обещал как раз продолжение, как защищить свое рабочее пространство, ну в общем, к делу :)
Выпуск дистрибутива Parrot OS 7.3 для этичного хакинга с ядром Linux 7.0
В конце июня 2026 года компания Parrot Security представила
Fable и Mythos официально возвращаются сегодня — факты из поста Anthropic
Антопики написали большой пост, в котором много воды. Но если выделить главное, то- Официально подтверждено, что именно специалисты из Amazon отправили инфу о джейлбрейке Fable в правительство- Антропики хотя и не уточняют, что именно делал этот джейлбрейк, но говорят что даже Haiku 4.5 мог бы сделать эксплоит для подобных уязвимостей (но только если ему дать данные о самой уязвимости), а найти уязвимость сейчас могут Opus 4.8, GPT-5.5, and Kimi K2.7 - то есть это не было уникальной силой Fable- Они продолжают настаивать, что джейлбрейк был очень узкий, поэтому его
Почему вы не видите, что на самом деле происходит между моделью и MCP-сервером
Недавно Claude уверенно пересказал мне большой документ, хотя прочитал только его начало.Я подключил mcp-server-fetch
Proton представила новую версию ИИ‑ассистента Lumo 2.0
Компания Proton анонсировала версию 2.0 голосового помощника Lumo AI. Она предлагает «новую архитектуру» и такие функции, как логическое мышление, многомодальная обработка изображений и улучшенный веб-поиск.
Обзор выставки «Ключ к доверию. Безопасность в эпоху высоких технологий»
ВступлениеПривет, Хабр! В Музее криптографии начала работу интерактивная выставка «Ключ к доверию. Безопасность в эпоху высоких технологий», организованная при экспертной поддержке компании по информационной безопасности «Бастион». Выставка открылась 27 июня и будет идти до 22 ноября 2026 года. Однако для представителей СМИ и IT-сферы был предпоказ 25 июня. И вам покорный слуга был на предпоказе. Экскурсию для СМИ проводили куратор музея и специалист компании «Бастион». Куратор отвечал за историческую часть, а кибербез-эксперт — за кейсы кибератак. Ну а я расскажу, что из себя представляла выставка. Приятного чтения!
UserGate усиливает направление бизнеса, связанное с безопасностью искусственного интеллекта
UserGate, ведущий российский разработчик решений в области информационной безопасности и архитектор сетевого доверия, объявляет о назначении Светланы Газизовой на должность владельца продукта по безопасности ИИ. Она будет отвечать за развитие компетенций компании в области технологий искусственного интеллекта.Речь идет о продуктах компании и в первую очередь о UserGate Secure Web Gateway (uSWG
Агенты удаляют файлы, сливают данные и сами себя взламывают: как устроена безопасность ИИ‑систем в 2026 году
ВступлениеПривет, Хабр! Тема искусственного интеллекта за последние несколько лет набили, честно говоря, оскомину. Есть как защитники, так и противники технологий, которых принято называть ИИ. Везде начали приделывать ИИ‑помощников. Встраивать нейросети в разные приложения. И раз уж не избежать искусственного интеллекта в повседневной жизни. Я решил поговорить про атаки на языковые модели. Потому что такие кибератаки перестали быть экзотикой, а защита ИИ стала отдельная дисциплина с собственной таксономией, инструментарием и, к сожалению, реальными инцидентами.Я решил поговорил с автором

