Умеет ли Jev быть guard‑моделью для LLM?
картинка на подумать или посмеятьсяВведениеGuard модели становятся все более и более интересными. Еще 2 года назад лучшее, что мог дать опенсорс, был Wildguard
Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.
ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить
ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика.
Промпт не удержал медицинскую границу. Как мы добавили LLM-тренеру страж на регулярках
В 1trAIner ИИ-тренер отвечает спортсменам в чате, пишет планы и разбирает тренировки. Сервис информационный: диагнозов не ставит. В системном промпте с самого начала было правило «при боли и травме — к врачу». Мы считали вопрос закрытым, пока не начали проверять ответы на трёх языках.Ниже — как мы нашли дефект, почему промпт его не лечит и что сделали кодом. С цифрами, в том числе неудобными.Как нашли
GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)
В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию. Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.Архитектура: как устроен прогон
Как мы построили multilabel guardrail‑классификатор и как мы сделали его в 3 раза быстрее и дешевле
Как учесть 15 категорий риска одновременно, не потерять редкие и критичные классы, обмануть попытки обхода фильтров и не разориться на инференсе. Изображение сгенерировано с помощью seedream-5.0-pro
Как не сломать LLM, пока защищаешь данные: под капотом Guardrails Filter
В прошлый раз я рассказывал, как работает Guardrails Filter: зачем вообще понадобился отдельный слой защиты данных при работе с LLM и какие задачи он решает.
GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)
Всем привет, на связи команда HiveTrace!Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?".Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются.
Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve
Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента.
Атака на LLM, которую нельзя исправить патчем
Не так давно вопросы безопасности искусственного интеллекта считались скорее темой для научных докладов, чем реальной проблемой для бизнеса. Большинство компаний, внедрявших LLM, сосредоточились на нескольких первоочередных задачах. Они стремились как можно быстрее выпустить минимально жизнеспособный продукт. Также они подключали к нему корпоративные знания, обучали помощника отвечать клиентам и автоматизировали работу техподдержки. Вопросы безопасности при этом откладывали. Такой подход был

