Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.
Модель выложила системный промпт, в котором было написано его не выкладывать
Началось это буднично. Я гонял логи своего сервиса и увидел ночью две записи, которых там быть не должно.Первая была просто мусором: ktrc ktrc ktrc
FlautGuard: как мы построили многоуровневую защиту LLM от prompt injection и утечек данных
Защита языковой модели отличается от защиты обычного веб-приложения одной принципиальной особенностью: пользовательский ввод для LLM — это не только данные, но и потенциальная инструкция.В обычном приложении строка остаётся строкой. В LLM пользовательский текст интерпретируется самой моделью, поэтому граница между «данными» и «командой» становится значительно менее очевидной.Отсюда появляются prompt injection, попытки извлечения системных инструкций, обход ограничений и утечки информации через ответы модели.С этой проблемой мы столкнулись при разработке FlautFast — нашей LLM внутри инфраструктуры FlautCompany.
350+ моделей без смены SDK: зачем разработчику слой абстракции над LLM‑провайдерами
Привет, Хабр! На связи команда Caila
Поймай jailbreak, если сможешь
Jailbreak в мире ИИ часто представляют как взлом. Будто внутри большой языковой модели ( далее LLM, от англ. large language model) есть замок, к которому кто‑то подбирает отмычку. Щелчок. Замок открыт. Ограничения сняты. Модель стала другой. Красивая картинка, удобная, но почти полностью неверная, поскольку jailbreak — это не взлом в духе «я нашёл секретную кнопку и отключил защиту», ведь никто не перепрошивает модель, находясь в пользовательском чате, не меняет её веса и не ломает её «природу».
Как сделать MCP-сервер из Spring-сервиса за один вечер. И что потом не даст спать спокойно
Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E-commerce, преподаю на курсах разработки и архитектуры. В этой статье расскажу, как взять обычный Spring-микросервис и за вечер сделать часть его функций доступными
Промпт-инъекции в реальных данных, широкие права доступа и другие способы сломать ИИ-агента
Привет, Хабр! На связи команда Jay Guard — платформы, которая помогает безопасно использовать языковые модели и ИИ-агентов.Недавно мы опубликовали статью про ИИ-агента для HR-процессов. В комментариях почти сразу появились вопросы про данные — куда уходят персональные данные, что из этого видит LLM, что пишется в логи (журнал событий) и как все это соотносится с требованиями ИБ, 152-ФЗ и внутренними регламентами.
GLiNER Guard: один schema-driven энкодер вместо зоопарка LLM-гардрейлов
Эта статья - адаптация моего материала, опубликованного на Towards AI, и одновременно продолжение предыдущего поста про эволюцию GLiNER от UniNER до GLiNER 2. Там мы остановились на том, что унификация задач в одной энкодерной модели стоит точности в отдельных задачах, но даёт огромный инженерный выигрыш. Сегодня посмотрим, как тот же принцип применяется к гардрейлам в LLM-приложениях - и что из этого вышло.📄 Arxiv ·

