Локальные нейросети без Python, CUDA и терминала: делаю программу, в которой всё настраивается само
Запускать нейросети у себя дома давно можно. Модели бесплатно лежат на HuggingFace, llama.cpp работает даже на старых видеокартах, ComfyUI рисует картинки. Но дорога до первого ответа у обычного человека выглядит так: поставить Python нужной версии, разобраться с CUDA, выбрать между Q4_K_M и Q5_K_S, скачать десять гигабайт и только после этого узнать, что модель отвечает по слову в секунду.
Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток-сек на двух RTX 3090
Плотная 27B-модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко, и надо разобраться, что и где подкрутить. Оказалось, что горлышек несколько, и все они снимаются флагами запуска: те же веса — 75 токенов в секунду. Ниже каждый флаг описан одинаково: зачем, что писать, что даёт, где ломается. В конце — готовый docker run.Стенд: 2× RTX 3090 (24 ГБ, PCIe 4.0 x16, без NVLink), Threadripper 3960X, 121 ГБ RAM, Ubuntu 26.04, драйвер 595.71.05. llama.cpp — образ ghcr.io/ggml-org/llama.cpp:full-cuda
Тест Qwen3.5 9b, Gemma 4 12b и Bonsai 27b на легенде пенсионного возраста GTX 1080 ti
Все началось вообще не с идеи написать очередной бенчмарк. Мне нужно было собрать локальный пайплайн для длинных подкастов: получить транскрипт, найти в нем интересные куски, выбрать несколько сильных фрагментов и уже из них делать короткие вертикальные ролики.Облачные модели с этой задачей справляются, но постоянно гонять туда длинные расшифровки не очень хотелось. Плюс было интересно понять, насколько далеко сейчас можно уехать на железе.Под рукой была GTX 1080 Ti на 11 ГБ. Карта 2017 года, архитектура Pascal, никаких Tensor Cores.
DeepSeek 0731 на DGX Spark: разгоняю до 68 tok-s и разбираюсь, почему у автора карточки 57
TL;DRЖелезо: 2× NVIDIA DGX Spark (GB10, SM121), 128 GB unified номинально и около 122 GiB видимых системе на ноду, QSFP 200G / RoCEv2, TP=2, драйвер 580.159.03.Основную часть расхождения объяснила смена runtime‑образа. Переход со сборки на базе vLLM 0.21.1 на образ с 0.25.2 дал около +22% на том же чекпоинте. Конкретный коммит или компонент я не изолировал: поменялся весь пакет.Механика неочевидная: новый образ снизил расчётную частоту verification‑шагов примерно на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80.Главная находка в конфиге: --moe-backend flashinfer_b12x не выбирается режимом auto
Сколько на самом деле стоит решённая задача: считаем экономику self-hosted моделей vs API токены
Каждый раз, когда заходит разговор "что дешевле — поднять у себя открытую модель или платить за API", его почему-то ведут в ценах за токен. И почти всегда это спор не в тех единицах.Во-первых, self-hosting — это постоянные затраты, а API — переменные. Значит, ответ зависит не от цены за токен, а от того, насколько плотно вы это железо загрузите. Во-вторых, токены вообще никто не покупает как цель. Покупают решённые задачи. А модели очень по-разному тратят токены на одну и ту же задачу.
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Dub Studio - локальная утилита для перевода коротких роликов. Та самая утка тоже тут.
Google объяснила увеличение объёма занятой памяти на Android после обновлений системы
Google объяснила, почему объём памяти Android AICore иногда резко возрастает. Система позволяет запускать функции генеративного ИИ непосредственно на аппаратном обеспечении Android-смартфона или планшета.
Сборка дешевого домашнего вычислительного кластера на двух процессорах и 6 «почти» RTX3080
Я инженер, и у меня есть эдакий фетиш - все, что важно, должно находиться под моим контролем. Локально, в железе, которое можно измерить осциллографом, нагрузить до упора и при необходимости перепаять. Когда ты привык работать со схемами, сигналами и источниками питания, становится странно отдавать вычисления куда-то наружу и надеяться, что там “все нормально работает”.

