локальная LLM.

Собираем приватный RAG-стек на pgvector

Приватный RAG-стек на pgvector помогает отвечать на вопросы по внутренним документам. Поиск подбирает отрывки, а языковая модель составляет по ним ответ. Например, сотрудник узнаёт порядок восстановления доступа и проверяет его по исходной инструкции.

продолжить чтение

Где заканчивается вызов LLM и начинается backend система: локальный RAG на FastAPI и Ollama

На практике хотел понять где заканчивается простой вызов локальной LLM и начинается backend система: с API контрактом, логированием, request_id, источниками, индексом документов, диагностикой и честными ограничениями.Сначала проект выглядел просто: frontend отправляет вопрос, FastAPI принимает POST /ask, backend вызывает локальную модель через Ollama и возвращает ответ. Это уже работало, но стало понятно такой вариант ещё нельзя назвать системой по документации. Модель отвечает, но непонятно на что она опирается, откуда взяла ответ, сколько времени занял каждый этап и что делать если документы изменились.

продолжить чтение

Локальный RAG без магии: sources, timings, request_id и отказ от генерации

На практике было интересно не просто вызвать локальную LLM из Python а понять, в какой момент такой вызов превращается в backend-систему: с API-контрактом, логами, request_id, источниками ответа, индексом документов, диагностикой и честным отказом отвечать, если данных в документах нет.В этой статье показываю не теорию RAG, а небольшой локальный проект, где хорошо видно, какие инженерные проблемы появляются вокруг LLM:что попадает в prompt;какие sources были найдены;сколько заняли retrieval и generation;когда backend должен не вызывать LLM;почему stale index может давать странное поведение;

продолжить чтение

Как я установил в свой игровой ПК серверный GPU за £200

У меня уже была установлена RTX 4080 с 16 ГБ VRAM. Её вполне достаточно для гейминга, но не для моделей, которые я хотел запускать локально. Так что следующим шагом было либо приобретение дорогущей карточки с бо

продолжить чтение

Внедрение ИИ‑агента в бизнес‑процесс за один день: от развертывания до прототипа

Меня зовут Андрей Коптелов, я долгие годы работаю с бизнес‑процессами и корпоративной архитектурой, теперь волею судеб мне приходится погружаться в тему искусственного интеллекта. По мере возможностей пытаюсь делиться своим скромным опытом в этой теме.Представьте: вам поручили «внедрить искусственный интеллект (ИИ)», но без бюджета, и с требованием сохранить данные внутри периметра организации. Результат нужен вчера. Ваши подчиненные не умеют программировать, и используют большие языковые модели только в режиме чата.Результат

продолжить чтение

Наливатор произносит тост «за Родину», поддерживает дружественный разговор в компании с подружкой, что дальше

Почему домашний бар перестал быть просто набором бутылок и что можно пересмотреть с 2020 года в данном устройстве, с чем идти дальшеАлександр Котов, Евгений РычковНаливатор в действии

продолжить чтение

Как устроен Meshtastic, зачем он нужен и как я подключил его к локальной модели на ноутбуке

Я давно хотел попробовать не просто LoRa-модули как отдельные радиожелезки, а именно Meshtastic - готовую систему для обмена сообщениями без сотовой сети, Wi-Fi и интернета.Идея Meshtastic выглядит очень привлекательно: берём несколько маленьких устройств с LoRa, прошиваем их, настраиваем общий канал - и получаем автономную mesh-сеть для коротких сообщений. Без SIM-карт, без роутеров, без облаков и без базовых станций оператора.

продолжить чтение

Как мы сделали AI code review через Ollama без облака?

TL;DR: Собрали CLI, который гоняет ревью кода на локальной LLM (Ollama): никаких API-ключей в облаке, код не уходит из машины, один diff - одна команда. В статье - зачем это нужно, как устроено и как попробовать за пять минут.ПроблемаРевью кода вручную отнимает время, а статический анализ (линтеры, SAST) ловит только то, что зашито в правила. Контекст проекта, типичные баги и «запахи» кода они не видят. Облачные AI-ревью (типа CodeRabbit) удобны, но код уходит в чужое API - для внутренних репозиториев или строгого комплаенса это не всегда ок.Хотелось чего-то среднего: умное ревью с контекстом, но полностью локально

продолжить чтение

GPT-OSS-20B, H100: выжимаем 156 миллиардов токенов в месяц

С выходом Open-Source модели от OpenAI, появилось очень много новостей и обсуждений бенчмарков, но реальной статистики, гайдов запуска, и загрузочных тестов, лично я не встречал. В этой статье я покажу максимальную производительность GPT-OSS 20B, которую можно добиться на современной H100, чтобы сэкономить время тем, кто вдруг решит ее разворачивать локально на своем оборудовании!С чего начнем? Установите Ubuntu 22.04.5 LTSСначала скачаем контейнер под vLLM для gpt-oss-20b. Он отличается тем, что внутри него конкретная версия vllm 0.10.1 и другие важные зависимости.

продолжить чтение

GPT-OSS-20B – 120B: Сухие цифры после реальных тестов

OpenAI выпустила GPT-OSS модели (https://huggingface.co/openai/gpt-oss-20b и https://huggingface.co/openai/gpt-oss-120b) , и сообщество немедленно начало экспериментировать. Но реальные бенчмарки производительности найти сложно. В этой статье представлены результаты нашего практического тестирования на арендованном железе через RunPod с использованием Ollama.Ремарка: Тесты проводились на Ollama для быстрого деплоя. Если будете использовать vLLM, то производительность будет примерно +30%, но он слабо адаптирован под консьюмерские GPU, за исключением RTX 5090. Что тестировалось:

продолжить чтение