Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо: загрузить веса, поднять runtime, отдать API, подключить приложение.Теорию я понимал. Но честный ответ был таким: собственного опыта, в котором всё это проходит путь от файлов модели до работающего пользовательского сценария, у меня тогда не было.Через несколько дней такой опыт появился.
Проектирование медицинского ИИ, ориентированного на лечебное дело, в условиях экстремальных аппаратных ограничений
“The stone which the builders rejected, the same is become the head of the corner…” — Matthew 21:42 «Камень, который отвергли строители, тот самый сделался главою угла».От Матфея 21:42 ⚠️ Юридический дисклеймерВажно для читателей и регуляторов:Статус проекта: Описанная в статье система является исключительно личным pet-проектом (Proof of Concept) автора, созданным в научно-исследовательских и учебных целях. Проект развернут локально, не имеет публичного веб-интерфейса или API, не монетизируется и не распространяется.Медицинское регулирование:
Шесть часов на один рендер: как я собрал нативную студию Ideogram 4 на Swift и MLX
Эта картинка рисовалась на моём Mac 384 минуты 55 секунд.Quality, 48 шагов, 2048×2048 — 384 минуты 55 секунд, почти шесть с половиной часов.
«Четыре шага — и точка» Я сам придумал главное ограничение своего приложения
Пару недель назад я рассказывал здесь, как три ночи чинил рендер, который не был сломан
Claude Code с локальными Qwen3.6 на AMD Strix Halo: полное руководство по настройке
ВведениеВсем привет! Продолжаю тему предыдущей статьи. В ней сравнивалось железо для локального инференса — Nvidia DGX Spark, Mac Studio M3 Ultra и Strix Halo. И как можно было догадаться, остановился я именно на последнем.Железо есть, зарядим теперь на нем пару-тройку локальных моделей под управлением проверенного AI-агента.Claude Сode по подписке с оригинальными LLM - это, конечно, замечательно. Но это стоит денег, да и свой код в чужие дата-центры не всегда правильно отправлять. Плюс за всякое неосторожное движение можно попасть в бан, рискуя потерять все свои наработки.Одно из решений:
Capacitor: от веба к мобильным приложениям. Часть 4. Интегрируем локальный LLM в проект
Привет, Хабр! Продолжаем серию статей о разработке мобильных приложений с помощью Capacitor. Если вы не читали предыдущие части, лучше начать с них:Часть 0. Зачем нужен CapacitorЧасть 1. Миграция проекта на CapacitorЧасть 2: Как написать свой плагинЧасть 3: OTA-обновленияВ этой части разберём, как запустить языковую модель прямо на телефоне — без сервера, без API-ключей и без постоянного интернета.Зачем локальный AI
DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан
NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно.Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f, а нативные NVFP4-инструкции есть только в compute_120a и compute_121a. На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер.

