Карточки из музыкальной студии 1975 года против продуктовых тупиков
Я взял метод Брайана Ино, придуманный для музыкальной студии, и собрал из него небольшой AI-эксперимент для продуктовых тупиков. Не чтобы находить ответы за команду, а чтобы иногда сбивать её с привычного маршрута.Есть задачи, которые вроде бы не выглядят тупиком.Например, нужно решить, нужен ли в онбординге ещё один экран. Макет готов, аргументы у всех есть — а решение почему-то переезжает с недели на неделю. В чате появляются знакомые реплики: «Давайте ещё посмотрим аналитику», «Надо спросить пользователей», «Вернёмся, когда будет больше контекста».
Персонализация без Big Data: как мы ранжируем новости в Telegram с помощью pgvector и пяти сигналов
У меня накопилось 23 Telegram-канала.Не потому что я специально их коллекционировал. Просто со временем подписывался на новые. В какой-то момент понял, что читаю всего несколько процентов того, что приходит. Остальное просто пролистываю в поисках чего-то интересного.Проблема здесь простая. Telegram показывает посты только по времени публикации. Самые новые всегда наверху. Неважно, интересна тебе тема или нет. Никакой персонализации нет. Есть только хронология.Из-за этого появился CleanNews — бот, который собирает посты из ваших Telegram-каналов и формирует персональную подборку.
- Оставлено в
От текста к смыслу: Embeddings, GPT и многомерные векторы в конкурентном анализе мобильных приложений
Отзывы пользователей — один из самых ценных источников информации о продукте, при этом часто клиенты описывают одну и ту же тему или проблему десятками разных слов. Раньше работать с фидбэком было долго и ресурсоемко, но с появлением Embeddings и LLM это изменилось.
Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков
Привет, Хабр! В сентябре 2024 года Anthropic опубликовала технику Contextual Retrieval с обещанием снизить процент неудачных извлечений в RAG‑системах на 49% при использовании только embeddings и на 67% в сочетании с reranking. К середине 2026 года эта техника закрепилась как один из стандартов production‑RAG и применяется в подавляющем большинстве серьёзных корпоративных систем. Разберём, в чём её суть, почему она вообще работает, как её реализовать и где она ломается.Корневая проблема classical RAG, которую долго игнорировали
Сжатие декодерных эмбеддеров: как ужать 8B до продакшена без потери recall
В прошлой статье мы разбирали, почему retrieval в 2026 переехал с энкодеров на декодерные LLM: Qwen3-Embedding, NV-Embed, E5-Mistral эмбеддят лучше BGE, держат 32k контекста и понимают инструкции в промпте.Проблема простая. Декодерный эмбеддер 7–8B действительно дает качество. Но за это качество вы платите трижды: память (8B в fp16 - не только веса модели, но и жирные векторы в индексе), latency (forward-pass большой модели) и деньги (GPU под нагрузкой или счет за эмбеддинг-API). И если latency лечится инференс-стеком (SGLang, батчинг - тема будущей статьи серии), то стоимость
Как правильно выбрать эмбеддинг для проекта
Эмбеддинги (иначе говоря, векторные представления) — это способ представления абстрактных данных в виде набора чисел (в виде векторов, как вы могли уже понять), близкие значения которых связаны семантически и математически и с которыми может работать модель искусственного интеллекта. Разберемся какие модели лучше других подходят для кодирования слов. Параллельно с этим разберём принципы, на которые нужно опираться при выборе эмбеддинг-модели, пощупаем русские BERT-модели и внесём ясность про системные требования, контекстное окно и размер батча.1. Типы эмбеддингов и области применения
Где заканчивается вызов LLM и начинается backend система: локальный RAG на FastAPI и Ollama
На практике хотел понять где заканчивается простой вызов локальной LLM и начинается backend система: с API контрактом, логированием, request_id, источниками, индексом документов, диагностикой и честными ограничениями.Сначала проект выглядел просто: frontend отправляет вопрос, FastAPI принимает POST /ask, backend вызывает локальную модель через Ollama и возвращает ответ. Это уже работало, но стало понятно такой вариант ещё нельзя назвать системой по документации. Модель отвечает, но непонятно на что она опирается, откуда взяла ответ, сколько времени занял каждый этап и что делать если документы изменились.
Локальный RAG без магии: sources, timings, request_id и отказ от генерации
На практике было интересно не просто вызвать локальную LLM из Python а понять, в какой момент такой вызов превращается в backend-систему: с API-контрактом, логами, request_id, источниками ответа, индексом документов, диагностикой и честным отказом отвечать, если данных в документах нет.В этой статье показываю не теорию RAG, а небольшой локальный проект, где хорошо видно, какие инженерные проблемы появляются вокруг LLM:что попадает в prompt;какие sources были найдены;сколько заняли retrieval и generation;когда backend должен не вызывать LLM;почему stale index может давать странное поведение;
Chrome-расширение для Upwork: архитектура, метрики и опыт разработки с помощью ИИ
В свободное время я иногда захожу на Upwork, чтобы посмотреть, какие проекты там сейчас появляются и как устроен рынок изнутри.Если убрать фильтры и посмотреть на общий поток вакансий, довольно быстро становится видно типичную картину: большое количество разработчиков конкурируют за очень стандартные и недорогие задачи. В таких условиях основная проблема смещается не на поиск интересных проектов, а на скорость их обработки и подачи предложений. Это особенно заметно в сегменте разработчиков, которые работают на массовом рынке: им важно быстро отсекать нерелевантные предложения и экономить connects.

