guardrails.

Умеет ли Jev быть guard‑моделью для LLM?

картинка на подумать или посмеятьсяВведениеGuard модели становятся все более и более интересными. Еще 2 года назад лучшее, что мог дать опенсорс, был Wildguard

продолжить чтение

Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.

продолжить чтение

ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить

ИИ-ассистенты все чаще действуют от имени пользователя: работают с почтой, CRM, документами и API. Фактически это новый тип цифрового сотрудника с доступом к информации и возможностью принимать решения. Поэтому ошибка такого агента – это уже не просто неверный ответ, а реальная утечка данных, изменение записей в системе или отправка информации не тому адресату. Кроме того, в догонялки с индустрией играют регуляторная теория и практика.

продолжить чтение

Промпт не удержал медицинскую границу. Как мы добавили LLM-тренеру страж на регулярках

В 1trAIner ИИ-тренер отвечает спортсменам в чате, пишет планы и разбирает тренировки. Сервис информационный: диагнозов не ставит. В системном промпте с самого начала было правило «при боли и травме — к врачу». Мы считали вопрос закрытым, пока не начали проверять ответы на трёх языках.Ниже — как мы нашли дефект, почему промпт его не лечит и что сделали кодом. С цифрами, в том числе неудобными.Как нашли

продолжить чтение

GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию.  Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.Архитектура: как устроен прогон

продолжить чтение

Как мы построили multilabel guardrail‑классификатор и как мы сделали его в 3 раза быстрее и дешевле

Как учесть 15 категорий риска одновременно, не потерять редкие и критичные классы, обмануть попытки обхода фильтров и не разориться на инференсе. Изображение сгенерировано с помощью seedream-5.0-pro

продолжить чтение

Как не сломать LLM, пока защищаешь данные: под капотом Guardrails Filter

В прошлый раз я рассказывал, как работает Guardrails Filter: зачем вообще понадобился отдельный слой защиты данных при работе с LLM и какие задачи он решает.

продолжить чтение

GuardRate: как мы построили независимую арену для guardrail-моделей (часть 1)

Всем привет, на связи команда  HiveTrace!Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: "какой из двух гардрейлов лучше?".Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются.

продолжить чтение

Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента.

продолжить чтение

Атака на LLM, которую нельзя исправить патчем

Не так давно вопросы безопасности искусственного интеллекта считались скорее темой для научных докладов, чем реальной проблемой для бизнеса. Большинство компаний, внедрявших LLM, сосредоточились на нескольких первоочередных задачах. Они стремились как можно быстрее выпустить минимально жизнеспособный продукт. Также они подключали к нему корпоративные знания, обучали помощника отвечать клиентам и автоматизировали работу техподдержки. Вопросы безопасности при этом откладывали. Такой подход был

продолжить чтение

123