Qwen3.8–27B на двух RTX 3060 12ГБ: как я разогнал OpenCode с ~9 до ~40 токенов-с при 128K контекста
Задача была простой: собрать дома собственный вычислительный блок для coding‑agent'ов и по возможности как можно меньше зависеть от облачных лимитов. Codex и Claude Code мне нравятся, но постоянно упираться в ограничения, а тем более платить за более дорогие тарифы 100 или тем более 200 долларов в месяц, я не хочу. Поэтому решил посмотреть, насколько далеко можно уехать на том, что уже есть.Железо для эксперимента постарался подобрать с минимальными вложениями: Core i7-4790, 32 ГБ DDR3, ASUS Sabertooth Z97 Mark 2 и две RTX 3060 по 12 ГБ. Никакого NVLink, CUDA P2P между картами тоже нет. Зато суммарно есть 24 ГБ VRAM и желание выжать из них все соки.
Мощный ИИ агент в 16гб VRAM
Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.нарисовано моделью из статьи
Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате
Экспериментальный O(1)-режим CMF заменяет растущий KV-кэш в 16 full-attention слоях Qwen3.8-27B фиксированным состоянием 44,1 МиБ. На длине 64K это сопоставляется с 4 ГиБ FP16 KV-кэша, но ценой приближённого восстановления дальнего контекста.Статья про CMF форматВ CMF
Новые ИИ-модели и LLM недели: Qwen3.8-Flash-Next, GLM-5.3, Granite 4.2, Hy4 и новые модели для видео, речи и изображений
С 24 по 31 августа разработчики выпустили сразу несколько заметных ИИ-моделей и LLM. В числе главных релизов недели — новая архитектура Qwen3.8-Flash-Next, мультимодальная GLM-5.3-Flash и публикация весов основной GLM-5.3, Granite 4.2 от IBM, Hy4 preview от Tencent и первая собственная LLM Thomson Reuters.Параллельно обновились модели для генерации видео, изображений и речи. Alibaba выпустила Wan 3.0, Bria AI — Fibo 1.5, а в speech-направлении появились Gemini 3.5 Transcribe, FireRedTTS3, Breeze TTS 2 и Sopro V2 Turbo. Ниже — главные релизы новых нейросетей и обновления AI-моделей за последнюю неделю августа.Новые LLM и мультимодальные языковые моделиThomson — собственная LLM от Thomson Reuters
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток-сек на двух RTX 3090
Плотная 27B-модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко, и надо разобраться, что и где подкрутить. Оказалось, что горлышек несколько, и все они снимаются флагами запуска: те же веса — 75 токенов в секунду. Ниже каждый флаг описан одинаково: зачем, что писать, что даёт, где ломается. В конце — готовый docker run.Стенд: 2× RTX 3090 (24 ГБ, PCIe 4.0 x16, без NVLink), Threadripper 3960X, 121 ГБ RAM, Ubuntu 26.04, драйвер 595.71.05. llama.cpp — образ ghcr.io/ggml-org/llama.cpp:full-cuda
Qwen3.8-27B на своей карте против 304B по API
Суббота, вечер. Хотел за час выяснить, какую из двух свежих моделей ставить себе - Qwen3.8-27B или DeepSeek V4 Flash 0731. Вышло семь часов и три новых строки в мой бенчмарк :)МодельБаллПрошлоtok/sTTFTQwen3.8-27B, NVFP4, своя карта0.78946/5059.627.7 сQwen3.8-27B, тот же вес по API0.78544/5015.0134.9 сDeepSeek V4 Flash 0731, по API0.73142/5053.3

