llama.cpp.

Я захотел, чтобы Obsidian заполнялся сам

1. Рутина душит

продолжить чтение

«Друзья не дают друзьям пользоваться Ollama»

Ниже — перевод статьи «Friends Don’t Let Friends Use Ollama»

продолжить чтение

Запустить LLM локально: что считать до покупки видеокарты?

Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса

продолжить чтение

Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток-сек на двух RTX 3090

Плотная 27B-модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко, и надо разобраться, что и где подкрутить. Оказалось, что горлышек несколько, и все они снимаются флагами запуска: те же веса — 75 токенов в секунду. Ниже каждый флаг описан одинаково: зачем, что писать, что даёт, где ломается. В конце — готовый docker run.Стенд: 2× RTX 3090 (24 ГБ, PCIe 4.0 x16, без NVLink), Threadripper 3960X, 121 ГБ RAM, Ubuntu 26.04, драйвер 595.71.05. llama.cpp — образ ghcr.io/ggml-org/llama.cpp:full-cuda

продолжить чтение

753B на одной видеокарте: разбор FreeToken

Чувак из Калифорнии вряд ли запускает это все на таком ноутбуке

продолжить чтение

3 бита вместо 16: разбираем TurboQuant и когда его реально стоит включать

продолжить чтение

Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

РептилоидЕсли вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать.

продолжить чтение

Тест локальных MOE моделей

продолжить чтение

Как я смог запустить 32b модель и сделать ее умнее в два раза на 3050

ПРЕДУПРЖДЕНИЕ : Автору 14 лет он плохо разбираеться в технологиях и программировании но основную теорию проекта придумал сам очень хотелось бы услышать критику конструктивнуюВсем здрайвствуйте я Titled и я создал форк llama.cpp где реализовал все свои жаветные мечты сейчас расскажу что это было и почему я написал такооой длиный заголовок.

продолжить чтение

Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

TL;DR.

продолжить чтение