векторный поиск.

Винни-Пух в 768 измерениях: семантический поиск Codex Pets на YDB

В Codex можно поселить анимированного питомца. Пока агент работает, персонаж бегает, машет рукой, ждёт или печалится после неудачной команды. По его состоянию видно, что происходит с задачей. Сам пакет состоит из pet.json и атласа с кадрами анимации.Самих питомцев я собрал в каталоге Codex Pets. Сейчас в нем 153 одобренных питомца: от красной панды и аксолотля до героев игр и старых мультфильмов. Любого можно посмотреть в браузере, скачать в ZIP или установить одной командой.

продолжить чтение

Эволюция поиска вакансий в Авито Работе: ML-оптимизации и инсайты из АБ-тестов

Привет! Меня зовут Вадим Вахрушев, я старший DS-инженер в Авито, занимаюсь задачами поиска. В статье расскажу, как устроено ранжирование в Авито Работе: какие ML-модели помогают создавать выдачу вакансий, и какие инсайты мы вынесли из нескольких показательных АБ-тестов.Думаю, статья будет в первую очередь интересна ML-инженерам, которым важно разобраться, как поисковое ранжирование адаптируется под конкретную бизнес-вертикаль. Если хочется узнать про поиск в Авито в целом, загляните в обзорную статью — 

продолжить чтение

Строили ANN руками — когда это того стоило, а когда нет

Сразу отвечаю на вопрос, который вы задали бы в первом же комментарии: а почему не pgvector?Короткий ответ: ровно то, что pgvector делает хорошо — генерацию кандидатов (найти top‑k ближайших по косинусу) — мы и советуем отдавать pgvector, если он у вас есть. Свой ANN мы написали, потому что (1) pgvector есть не везде, где должна работать наша память, и (2) самое ценное в нашей задаче — вообще не генерация кандидатов. Про это вся статья, так что давайте по порядку.

продолжить чтение

Локальная RAG-система на Go, PostgreSQL и Ollama без облачных API

продолжить чтение

Не дали ИИ-агенту соврать — его же памятью

На днях наш агент собрался дежурно отчитаться об успехе. Прежде чем нажать «готово», он сверился с собственной памятью — и нашёл там запись из прошлой сессии: эту идею он уже проверял на реальных данных, и она провалилась. Он остановил сам себя, до ложного отчёта.

продолжить чтение

Метод, которого не существовало: как я собрал локальный RAG для CAD API

Локальный RAG для Smart3D API

продолжить чтение

Чек-лист тестирования поисковой системы: от engine sanity до RAG и графов знаний

Чек-лист для тестирования поисковых и RAG-систем — от базовой работоспособности поискового движка до качества генерации, агентных сценариев и поведения на неполных данных. Шесть уровней проверок, сводная таблица с инструментами для каждого уровня и глоссарий из 50+ терминов. Проверку стоит организовывать по порядку, нет смысла гонять RAG-метрики, если система не проходит Уровень 0, то проблема может быть в том, что поиск не находит документ из-за опечатки в запросе, а не в качестве генерации. Перед тестированием По каким полям/источникам поиск должен работать, по каким — нет

продолжить чтение

RAG для закупок: Qdrant и LlamaIndex в локальном контуре

Привет Хабр! Меня зовут Владимир, и недавно я решил изучить новую (для себя) технологию - LlamaIndex. А тут и задачка подвернулась - надоело копаться в Положении о закупках, поэтому понадобился RAG для ответов по ФЗ-44, ФЗ-223, ну и локальному положению.В этой статье разберу, как создать простенький RAG, не выходящий из локального контура, на базе LlamaIndex + Qdrant, напишем к нему API и UI на Gradio. Поехали.Конфигурация проектаДля сервиса понадобятся LLM, векторная БД Qdrant, эмбеддер и реранкер результатов. Сразу код конфигурации:Код конфигурации

продолжить чтение

Как мы создавали «умный» поиск по регламенту вуза

Сначала — пара слов о себе, иначе непонятно, откуда вообще взялся весь проект. Я преподаю на кафедре информационных технологий в одном из вузов нашего города и при этом больше двадцати лет пишу код не в учебных примерах, а в бою. Эти две роли — преподавателя и практикующего разработчика — в какой-то момент и сошлись в одном небольшом проекте, который я затеял для себя.

продолжить чтение

Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

Привет, Хабр! В сентябре 2024 года Anthropic опубликовала технику Contextual Retrieval с обещанием снизить процент неудачных извлечений в RAG‑системах на 49% при использовании только embeddings и на 67% в сочетании с reranking. К середине 2026 года эта техника закрепилась как один из стандартов production‑RAG и применяется в подавляющем большинстве серьёзных корпоративных систем. Разберём, в чём её суть, почему она вообще работает, как её реализовать и где она ломается.Корневая проблема classical RAG, которую долго игнорировали

продолжить чтение