qdrant.

PostgreSQL умер, да здравствует… PostgreSQL?

Привет, Хабр. Я хочу рассказать историю, которую вы уже, наверняка, где-то слышали. Только с другой стороны.

продолжить чтение

Приватная LLM в облаке: развертываем RAG-систему в Managed Kubernetes

продолжить чтение

Я убил все RAG‑системы и понял, как делать AGI. Или просто заменил RAG правилом в шесть строк

продолжить чтение

Qdrant + Tailscale — установка и защита

Qdrant — это векторная база данных, которую используют для поиска похожих текстов, изображений и других объектов. Например, Qdrant часто применяют в чат‑ботах, RAG‑системах, рекомендательных сервисах и приложениях на базе искусственного интеллекта.

продолжить чтение

RAG для закупок: Qdrant и LlamaIndex в локальном контуре

Привет Хабр! Меня зовут Владимир, и недавно я решил изучить новую (для себя) технологию - LlamaIndex. А тут и задачка подвернулась - надоело копаться в Положении о закупках, поэтому понадобился RAG для ответов по ФЗ-44, ФЗ-223, ну и локальному положению.В этой статье разберу, как создать простенький RAG, не выходящий из локального контура, на базе LlamaIndex + Qdrant, напишем к нему API и UI на Gradio. Поехали.Конфигурация проектаДля сервиса понадобятся LLM, векторная БД Qdrant, эмбеддер и реранкер результатов. Сразу код конфигурации:Код конфигурации

продолжить чтение

Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall

В прошлой статье мы разбирали, почему retrieval в 2026 переехал с энкодеров на декодерные LLM: Qwen3-Embedding, NV-Embed, E5-Mistral эмбеддят лучше BGE, держат 32k контекста и понимают инструкции в промпте.Проблема простая. Декодерный эмбеддер 7–8B действительно дает качество. Но за это качество вы платите трижды: память (8B в fp16 - не только веса модели, но и жирные векторы в индексе), latency (forward-pass большой модели) и деньги (GPU под нагрузкой или счет за эмбеддинг-API). И если latency лечится инференс-стеком (SGLang, батчинг - тема будущей статьи серии), то стоимость

продолжить чтение

Как создать ИИ‑ассистента на кодовой базе компании: опыт команды музыкального сервиса Звук

Привет! Хочу рассказать про AI‑трек, который проектировала наша команда на UWDC 2026, масштабной конференции разработчиков на Урале.

продолжить чтение

Retrieval в 2026: как RAG переехал с энкодеров на LLM (и что с этим делать в своём проекте)

продолжить чтение

RAG без downtime: настраиваем инкрементальное обновление документов на Qdrant и LangChain

PM: Нам нужно актуализировать базу знаний для ИИ-ассистента, там изменилась инструкция по смене пароля.DevOps: Не проблема, сейчас запущу скрипт, через два часа всё обновится. Предупреди Заказчика о недоступности сервиса.Знакомая ситуация? Полная зачистка векторной базы и реиндексация всех имеющихся документов с остановкой сервиса - решение простое и надёжное, но «прощается» только на этапе прототипа.В продакшене могут быть сотни тысяч документов, живые пользователи и

продолжить чтение

Математика кластеров: разбираемся в умной кластеризации данных на примере нашей системы поиска аномалий в логах. Часть 1

Привет, Хабр! Меня зовут Андрей Басов, я руководитель команды технической поддержки стрима корпоративных продуктов и сервисов в MWS, занимаюсь технической поддержкой и сопровождением продуктов линейки Partner Experience Platform. В прошлом материале

продолжить чтение

123