gliner2.

Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента.

продолжить чтение

Тихая эволюция zero-shot энкодеров. От UniNER до GLiNER 2

Эта статья является адаптацией моей статьи, опубликованной в Towards AIIntroБольшие языковые модели показывают впечатляющую обобщающую способность, причём не только в задачах генерации текста вроде QA-ассистентов, но и в классификации, распознавании именованных сущностей (Named Entity Recognition) и других NLP-задачах.С одной стороны, мы на старте эпохи AI агентов, где приложения с тулами управляются

продолжить чтение