Я попробовал ужать LLaMA-7B до 1 ГБ без дообучения. Вот что произошло после 60+ экспериментов
В какой‑то момент я посмотрел на 13 ГБ весов LLaMA-7B и подумал: а почему, собственно, они должны занимать именно столько? Что, если не делать маленькую модель, не учить её заново и не заставлять копировать большую, а просто найти более короткую запись тех же «мозгов»?Здравый человек, вероятно, скачал бы готовую квантизацию и пошёл заниматься своими делами. Я вместо этого поставил цель ужать модель сначала до 2 ГБ, а в идеале — до одного. Без дообучения, дистилляции, pruning и изменения архитектуры. Только математика над уже готовыми весами и небольшая выборка текстов для калибровки.
Квантизация LLM: как запихнуть 70B модель в свою видюху
Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.
Нейронные сети нетрадиционного квантования
Классический процесс квантования нейронных сетей долгое время сводился к сжатию весов из исходных плавающих форматов (FP32 или BF16/FP16) в более компактные целочисленные типы (INT8, INT4) или промежуточные представления вроде EXL2 и GGUF/k-quants с использованием техник смешанного квантования (QAT/AWQ).
А мы и не заметили, или о том, какие ИИ живут в вашем кармане
Один разработчик запустил 400B-модель на iPhone 17 Pro.
Каталог из 83 форматов с плавающей точкой, который сам себя проверяет
Вторая статья про проект GoldenFloat. Первая была про φ-лестницу форматов и троичную «Сетунь» Брусенцова. Здесь — про инструмент, который из той работы вырос: один машинно-проверяемый каталог числовых форматов, где у каждого формата прописана разрядка битов, битовый отпечаток и метка зрелости — вплоть до той ступени, где формула ещё есть, а железа под ней уже нет.Если вы хоть раз ловили расхождение точности между двумя реализациями одной сети, то знаете это чувство. Один и тот же matmul
Линейка для чисел: как я собрал каталог из 83 форматов с плавающей точкой — и почему у каждого есть честная статус-метка
Это вторая статья про проект GoldenFloat. Первая была про φ-лестницу форматов и троичную «Сетунь». Здесь — про инструмент, который вырос из той работы: единый, машинно-проверяемый каталог форматов чисел, где у каждого формата есть точная разрядка битов, статус-метка и битовый отпечаток. И про главную дисциплину этой работы: у каждого формата есть честная статус-метка того, насколько он проверен — вплоть до границы, где формула ещё работает, а проверенного железа уже нет.
LongConspectWriter: автоматическая генерация структурированных конспектов лекций на потребительском GPU
АннотацияАвтоматическая генерация структурированных академических конспектов из аудиозаписей лекций по точным и естественным наукам затруднена для локальных малых языковых моделей (small language models, SLM). Транскрипт лекции продолжительностью ≈1,5 ч составляет около 15–20 тыс. токенов и формально умещается в контекстное окно современных локальных SLM, однако при обработке такого контекста single-call SLM систематически деградируют: теряют фрагменты из середины последовательности, не удерживают структуру и галлюцинируют термины и формулы. Это проявление эффекта Lost in the Middle

