локальные llm.

Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)

В сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут. Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.

продолжить чтение

Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8–27B. Что реально ускоряет, а что нет

Я хотел, чтобы кодовый агент работал целиком на ноутбуке, без облака: локальная модель, локальный сервер, агент в терминале. Главная боль с самого начала — скорость. Агент постоянно перечитывает длинный контекст и много «думает», и на локальном железе это превращается в минуты ожидания на каждую задачу.

продолжить чтение

Jev за 25 строк на Python

My name is JevВсе кому не лень говорят о Jev. Jev тут, Jev там. Все в Twitter только и говорят о Jev, что это следующее достижение больших языковых моделей и парадигмы ИИ. Мы в этом не уверены. Поэтому вот Jev за 25 строк на Python.Загрузим модель.

продолжить чтение

Хотел свою систему, которую можно менять когда угодно, и сделал три десктопных AI-приложения

Хотел свою систему, которую можно менять когда угодно, и сделал три десктопных AI-приложенияПривет, Хабр! Это моя первая статья, и она про Zeqou: небольшую экосистему десктопных приложений для работы с языковыми моделями. Два приложения уже готовы, третье выйдет совсем скоро. Расскажу, что они умеют, как устроены и с какими неожиданными проблемами я столкнулся.Коротко. Zeqou — это три приложения: чат, рабочее пространство для агентов и студия дообучения моделей. Они бесплатные и работают на Windows, macOS и Linux. Чат и Harness готовы, xtraining выйдет очень скоро.Зачем всё этоЯ всегда хотел иметь

продолжить чтение

«Друзья не дают друзьям пользоваться Ollama»

Ниже — перевод статьи «Friends Don’t Let Friends Use Ollama»

продолжить чтение

Локальный ассистент для зумов, часть 4: что происходит после кнопки Стоп — и почему вторая модель говорила в пустоту

В первой части ассистент записывал созвон и складывал его в граф, во второй граф учился не врать неделями, в третьей я трижды ошибся с вопросом, кто это говорит. Эта часть про двадцать пять минут после кнопки Стоп: на экране ничего не происходит, на диске происходит всё. Там на этой неделе нашлась дыра, которая жила с июля. Облачная ревизия находила ошибки локальной модели, аккуратно их описывала, и никто её не слушал.Одна встреча, четыре файла, двадцать пять минут

продолжить чтение

Локальный ассистент для зумов, часть 3: кто это говорит — и почему я трижды ошибся, отвечая на этот вопрос

В конце второй части я пообещал честный замер новых локальных моделей распознавания. Обещание пришлось выполнять целый день, и результат оказался самым обидным из возможных: менять нечего. Ни модель, ни эмбеддер, ни алгоритм. А три дефекта, которые я за этот день торжественно нашёл, оказались дефектами не системы, а моего измерительного стенда.Эта часть — про диаризацию: как ассистент отвечает на вопрос «кто это сказал» и почему на рабочем созвоне этот вопрос сложнее, чем разобрать слова. Предыдущие части читать не обязательно: первая

продолжить чтение

Локальный ассистент для зумов, часть 2: как граф встреч становится памятью и почему ему можно верить

В первой части я собрал ассистента, который слушает созвон, различает голоса, пишет стенограмму и складывает встречу в граф знаний в Obsidian. Всё на своём Маке, ничего не уходит в облако. С тех пор прошло полтора месяца ежедневной работы, и оказалось, что записать встречу — это меньшая половина дела. Большая — сделать так, чтобы через месяц из этих записей можно было достать правду, а не то, что модель придумала по мотивам.

продолжить чтение

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Все цифры сняты с работающего стенда: потребление токенов — за календарную неделю по данным шлюза, метрики движка — кумулятивно за период аптайма (11 426 обработанных запросов). Продолжение — про выбор модели по замерам, а не по бенчмаркам — будет отдельной статьёй.Для кого эта статьяДля тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не введение в трансформеры.

продолжить чтение

Как я искал идеальный промпт для сопроводительных писем (и что оказалось важнее модели)

Моё приложение пишет сопроводительные письма к вакансиям на hh либо локальной моделью через Ollama, либо облачным API. Акцент в разработке я хотел сделать на локальную модель, потому что это просто-напросто бесплатно. Один вопрос портит красивую картину: а маленькая локальная модель вообще умеет писать так, чтобы не стыдно отправить работодателю?Я по умолчанию считал, что качество упирается в мощность модели и большая облачная всегда обгонит маленькую локальную. Чтобы проверить это на цифрах, а не на ощущениях, я собрал слепую оценку. За несколько заходов она показала, что рычаг, за который я тянул, был вообще не тот.

продолжить чтение