безопасность llm.

Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.

продолжить чтение

Модель выложила системный промпт, в котором было написано его не выкладывать

Началось это буднично. Я гонял логи своего сервиса и увидел ночью две записи, которых там быть не должно.Первая была просто мусором: ktrc ktrc ktrc

продолжить чтение

FlautGuard: как мы построили многоуровневую защиту LLM от prompt injection и утечек данных

Защита языковой модели отличается от защиты обычного веб-приложения одной принципиальной особенностью: пользовательский ввод для LLM — это не только данные, но и потенциальная инструкция.В обычном приложении строка остаётся строкой. В LLM пользовательский текст интерпретируется самой моделью, поэтому граница между «данными» и «командой» становится значительно менее очевидной.Отсюда появляются prompt injection, попытки извлечения системных инструкций, обход ограничений и утечки информации через ответы модели.С этой проблемой мы столкнулись при разработке FlautFast — нашей LLM внутри инфраструктуры FlautCompany.

продолжить чтение

350+ моделей без смены SDK: зачем разработчику слой абстракции над LLM‑провайдерами

Привет, Хабр! На связи команда Caila

продолжить чтение

Глобальное рабочее пространство в языковых моделях

продолжить чтение

Поймай jailbreak, если сможешь

Jailbreak в мире ИИ часто представляют как взлом. Будто внутри большой языковой модели ( далее LLM, от англ. large language model) есть замок, к которому кто‑то подбирает отмычку. Щелчок. Замок открыт. Ограничения сняты. Модель стала другой. Красивая картинка, удобная, но почти полностью неверная, поскольку jailbreak — это не взлом в духе «я нашёл секретную кнопку и отключил защиту», ведь никто не перепрошивает модель, находясь в пользовательском чате, не меняет её веса и не ломает её «природу».

продолжить чтение

Как сделать MCP-сервер из Spring-сервиса за один вечер. И что потом не даст спать спокойно

Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E-commerce, преподаю на курсах разработки и архитектуры. В этой статье расскажу, как взять обычный Spring-микросервис и за вечер сделать часть его функций доступными

продолжить чтение

Промпт-инъекции в реальных данных, широкие права доступа и другие способы сломать ИИ-агента

Привет, Хабр! На связи команда Jay Guard — платформы, которая помогает безопасно использовать языковые модели и ИИ-агентов.Недавно мы опубликовали статью про ИИ-агента для HR-процессов. В комментариях почти сразу появились вопросы про данные — куда уходят персональные данные, что из этого видит LLM, что пишется в логи (журнал событий) и как все это соотносится с требованиями ИБ, 152-ФЗ и внутренними регламентами.

продолжить чтение

GLiNER Guard: один schema-driven энкодер вместо зоопарка LLM-гардрейлов

Эта статья - адаптация моего материала, опубликованного на Towards AI, и одновременно продолжение предыдущего поста про эволюцию GLiNER от UniNER до GLiNER 2. Там мы остановились на том, что унификация задач в одной энкодерной модели стоит точности в отдельных задачах, но даёт огромный инженерный выигрыш. Сегодня посмотрим, как тот же принцип применяется к гардрейлам в LLM-приложениях - и что из этого вышло.📄 Arxiv · 

продолжить чтение

Пять документов ломают ваш RAG: где реальная уязвимость и что с ней делать

Материал подготовлен для будущих студентов курс "NLP / Natural Language Processing".У RAG-систем есть фундаментальный парадокс доверия: пользовательские запросы считаются недоверенным вводом, а извлеченный из базы знаний контекст по умолчанию считается доверенным, хотя и то и другое попадает в один и тот же промпт. Согласно исследованию, опубликованному на USENIX Security 2025 (или см. github репо

продолжить чтение

12