веса моделей.

Квантизация LLM: как запихнуть 70B модель в свою видюху

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

продолжить чтение

Пробиваем себя в In the Weights: ярмарка тщеславия в 2026

Гуглить свое имя уже неактуально, теперь информацию о себе стоит узннавать у ИИ. Экс-сеньоры OpenAI Томас Димсон и Джои Флинн (привет, Global Illumination) решили оцифровать паранойю по поводу цифрового следа и запустили In the Weights.Суть проще некуда: сайт задаёт 13 моделям один и тот же вопрос: «Кто такой ? Дай до 10 результатов с кратким описанием и уверенностью». Среди опрошенных — GPT-5.5, Opus 4.8, Grok, Gemini, Llama (обе, 70B и 1B), DeepSeek, Qwen и прочие. Никакого веб-поиска, только то, что модель выучила на трейне.

продолжить чтение