Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах
Есть простая практическая задача, из-за которой я вообще все это затеял. Вы берете маленькую модель, квантуете ее, чтобы она влезла в ноутбучную видеокарту, и хотите заранее понимать, насколько просядет ее способность вызывать инструменты. Обычно для этого смотрят на BFCL или ToolACE: там все измерено, есть таблицы, есть готовые цифры деградации по уровням квантования. И кажется логичным, что этими цифрами можно пользоваться.
Маленькая модель на 0.6B держит квантование лучше, чем «крупная» на 1B: измерил деградацию function-calling на 4 ГБ VRAM
Началось всe с очень приземленной задачи. У меня ноутбук с RTX 3050 и четырьмя гигабайтами видеопамяти, и я хочу гонять на нeм маленькую модель, которая умеет вызывать инструменты: заполнять JSON по схеме, выбирать нужную функцию, не звать еe там, где не надо. Чтобы модель влезла, еe приходится квантовать, и вот тут возникает вопрос, на который я так и не нашeл честного ответа: насколько сильно квантование ломает именно способность к вызову инструментов, а не абстрактное «качество» модели.
Всё, что вы хотели знать про локальные LLM, но боялись заинференсить
Хардкорный NIAH или почему у Gemma 26B память рыбки, какой Qwen лучше, и что показали 8 моделей на RTX 5090Привет, Хабр.Меня зовут Артём Хакимов, я работаю в команде GPUGO.Большая часть наших пользователей, которая не создаёт ИИ-подружек, работает с LLM — кто-то дообучает, кто-то гоняет инференс. И у всех одни и те же вопросы: «что быстрее?», «сколько контекста влезет?», «какой квант брать?».
4.6-битные сети: от теории к практике. Причём здесь HardTanh?
Уже прошло два года с тех пор, как мы предложили схему 4.6-битного квантования и рассказали про нее, в том числе и на Хабре: раз и два. Вспомним, что при 4.6-битном квантовании веса и входы слоя принимают такие целые значения, что их попарные произведения помещаются в знаковый 8-битный тип данных. Такая схема позволила нам вычислять нейронные сети на процессорах мобильных устройств быстрее, чем в 8-битном формате, и точнее, чем в 4-битном, потому что уровней квантования больше.
Культ квантования: почему 3 битные LLM это диагноз, а не оптимизация
Если вы зайдете на Reddit или HuggingFace, вы увидите одну и ту же картину: люди соревнуются в том, кто сильнее покалечит модель, чтобы втиснуть её в свои 8 или 12 ГБ видеопамяти.«Смотрите, я запустил 70 миллиардную модель на RTX 3060! Правда, пришлось использовать 3 битное квантование с размером группы 32, но она работает!»
Калькулятор VRAM для локальных LLM: Какие модели ИИ запустятся у вас на компьютере?
Сравнил предсказания калькулятора с реальными запусками llama.cpp на RTX 4060 Ti, 3090 и Apple M2 Pro. Спойлер: где-то точно, где-то мимо на 30%Когда я начал ковыряться с локальными LLM полгода назад, главная боль была не в установке моделей, а в понимании, что вообще влезет в моё железо. Документация Hugging Face говорит «Llama 3.1 8B». Что это значит для моей видеокарты с 16 GB VRAM? А если я хочу 32k контекст? А с квантованием Q4_K_M? Цифры в README часто не учитывают KV cache, который при больших контекстах ест VRAM сильнее, чем сама модель.Несколько недель назад мне попался простой open-source калькулятор — whatmodelscanirun.ru (русскоязычный форк оригинального проекта
Как засунуть 62ГБ в 15ГБ и не сойти с ума: Партизанский MLOps на примере Gemma 4 31B
TL;DR: В этой статье мы возьмем новейшую Gemma 4 31B, которая в оригинале весит 62 ГБ, и заставим её работать и выгружаться на бесплатном Kaggle с лимитом диска в 57 ГБ. Спойлер: нам придется удалять исходники прямо во время работы Python-скрипта.Введение: Кремниевый голод и санкцииКогда у тебя нет кластера A100, а есть только бесплатные T4 от Google, каждый байт становится полем боя. Мы живем в эпоху, когда модели растут быстрее, чем наши возможности их качать. Но математику не заблокируешь. По заветам нашего «Ghetto AI Manifesto», мы будем использовать «палки, желуди и сырой код», чтобы сделать топовый ИИ доступным каждому.
Новый 3-битный алгоритм Google заставил рынок переоценить ИИ-индустрию
Индустрия искусственного интеллекта годами развивалась по пути грубой силы — бесконечного наращивания вычислительных мощностей. Но когда физические пределы «железа» стали очевидны, в игру вернулась чистая математика.В среду, 25 марта 2026 года, на биржах произошла аномалия. Пока индекс Nasdaq уверенно рос, акции гигантов индустрии памяти — Micron, Western Digital, Seagate, а также производителей оборудования Lam Research и Applied Materials —

