embeddings.

474 712 строк за 35 лет: как мы с LLM и 21 экспертом приводим в порядок справочник автосервиса

НАР РУЧКУ ДВЕРЬ РАСПАШ З ПР С/УЭто не битая кодировка и не ошибка миграции. Это настоящее название работы из нашего справочника. За 35 лет в нём накопилось 474 712 строк: сокращения, дубли, опечатки, разные языки и разные варианты одной и той же операции.Опытный мастер-консультант многое понимает по контексту. Для специалиста по записи клиентов и аналитика такой справочник уже становится системной проблемой: первый зависит от знаний более опытных коллег, второму приходится вручную собирать разные названия одной операции.

продолжить чтение

Manticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутам

Manticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутамManticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутам

продолжить чтение

Месяц тюнил поиск по памяти, а починила всё одна строка в промпте

Месяц тюнил поиск по памяти, а починила всё одна строка в промптеУ меня телеграм-бот, который ведёт память по чату: вытаскивает из переписки факты и потом отвечает с оглядкой на них. Работает в полутора тысячах чатов.В конце августа я закончил месяц работы над его поиском. Поднял Recall@5 на 17%, перебрал параметры BM25, нашёл оптимальный вес слияния. Потом померил, как это сказалось на самих ответах.Никак. Прирост оказался статистически не значимым, p = 0.79.А потом я посмотрел в промпт, поправил там одну формулировку и получил плюс 16 процентных пунктов качества за вечер.

продолжить чтение

Карточки из музыкальной студии 1975 года против продуктовых тупиков

Я взял метод Брайана Ино, придуманный для музыкальной студии, и собрал из него небольшой AI-эксперимент для продуктовых тупиков. Не чтобы находить ответы за команду, а чтобы иногда сбивать её с привычного маршрута.Есть задачи, которые вроде бы не выглядят тупиком.Например, нужно решить, нужен ли в онбординге ещё один экран. Макет готов, аргументы у всех есть — а решение почему-то переезжает с недели на неделю. В чате появляются знакомые реплики: «Давайте ещё посмотрим аналитику», «Надо спросить пользователей», «Вернёмся, когда будет больше контекста».

продолжить чтение

Персонализация без Big Data: как мы ранжируем новости в Telegram с помощью pgvector и пяти сигналов

У меня накопилось 23 Telegram-канала.Не потому что я специально их коллекционировал. Просто со временем подписывался на новые. В какой-то момент понял, что читаю всего несколько процентов того, что приходит. Остальное просто пролистываю в поисках чего-то интересного.Проблема здесь простая. Telegram показывает посты только по времени публикации. Самые новые всегда наверху. Неважно, интересна тебе тема или нет. Никакой персонализации нет. Есть только хронология.Из-за этого появился CleanNews — бот, который собирает посты из ваших Telegram-каналов и формирует персональную подборку.

продолжить чтение

От текста к смыслу: Embeddings, GPT и многомерные векторы в конкурентном анализе мобильных приложений

Отзывы пользователей — один из самых ценных источников информации о продукте, при этом часто клиенты описывают одну и ту же тему или проблему десятками разных слов. Раньше работать с фидбэком было долго и ресурсоемко, но с появлением Embeddings и LLM это изменилось. 

продолжить чтение

Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

Привет, Хабр! В сентябре 2024 года Anthropic опубликовала технику Contextual Retrieval с обещанием снизить процент неудачных извлечений в RAG‑системах на 49% при использовании только embeddings и на 67% в сочетании с reranking. К середине 2026 года эта техника закрепилась как один из стандартов production‑RAG и применяется в подавляющем большинстве серьёзных корпоративных систем. Разберём, в чём её суть, почему она вообще работает, как её реализовать и где она ломается.Корневая проблема classical RAG, которую долго игнорировали

продолжить чтение

Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

В прошлой статье мы разбирали, почему retrieval в 2026 переехал с энкодеров на декодерные LLM: Qwen3-Embedding, NV-Embed, E5-Mistral эмбеддят лучше BGE, держат 32k контекста и понимают инструкции в промпте.Проблема простая. Декодерный эмбеддер 7–8B действительно дает качество. Но за это качество вы платите трижды: память (8B в fp16 - не только веса модели, но и жирные векторы в индексе), latency (forward-pass большой модели) и деньги (GPU под нагрузкой или счет за эмбеддинг-API). И если latency лечится инференс-стеком (SGLang, батчинг - тема будущей статьи серии), то стоимость

продолжить чтение

Как правильно выбрать эмбеддинг для проекта

Эмбеддинги (иначе говоря, векторные представления) — это способ представления абстрактных данных в виде набора чисел (в виде векторов, как вы могли уже понять), близкие значения которых связаны семантически и математически и с которыми может работать модель искусственного интеллекта. Разберемся какие модели лучше других подходят для кодирования слов. Параллельно с этим разберём принципы, на которые нужно опираться при выборе эмбеддинг-модели, пощупаем русские BERT-модели и внесём ясность про системные требования, контекстное окно и размер батча.1. Типы эмбеддингов и области применения

продолжить чтение

Где заканчивается вызов LLM и начинается backend система: локальный RAG на FastAPI и Ollama

На практике хотел понять где заканчивается простой вызов локальной LLM и начинается backend система: с API контрактом, логированием, request_id, источниками, индексом документов, диагностикой и честными ограничениями.Сначала проект выглядел просто: frontend отправляет вопрос, FastAPI принимает POST /ask, backend вызывает локальную модель через Ollama и возвращает ответ. Это уже работало, но стало понятно такой вариант ещё нельзя назвать системой по документации. Модель отвечает, но непонятно на что она опирается, откуда взяла ответ, сколько времени занял каждый этап и что делать если документы изменились.

продолжить чтение

123456...7