Как запустить Qwen3.8-Flash-Next 125B на 6 ГБ VRAM
Qwen3.8-Flash-Next - открытая 125B-модель на архитектуре, которая станет основой Qwen4. По опубликованным Qwen результатам она конкурирует с закрытыми frontier-моделями в задачах программирования, работы с агентами и computer use.Мы запустили полный checkpoint Qwen/Qwen3.8-Flash-Next на одной RTX 4090. Пиковое потребление VRAM составило 5,95 ГБ, без 4-битной квантизации и дистилляции. Использовался полный checkpoint в bf16, который генерировал обычные токены.По сравнению с Opus 4.6 Max, согласно собственным данным Qwen:
Как с помощью graph RAG добиться многоходовых рассуждений от LLM с 2B весов
Пару недель назад YouTube подкинул мне пятиминутный ролик с небольшого канала, где автор демонстрирует преимущества RAG на графах над обычным RAG поверх корпуса текстов.Пример довольно простой. LLM должна ответить на вопрос: “Кто должен подписать возврат клиенту на 800 фунтов в марте?”. Ответ, естественно, содержится в предоставленных текстах, но для того, чтобы его добыть, нужно уметь в multi-hop reasoning, т.к. необходимая информация лежит в 3х разных местах:инструкциях по возврату средствсписке сотрудниковсообщениях электронной почтыДля правильного ответа (
Как настроить Arch Linux, чтобы он обошёл Windows 11 по производительности и стилю
Работа с Linux часто отпугивает начинающих пользователей. Возможно, вы слышали от альфа-айтишников, что на «Линуксе» чуть ли не весь мир стоит, но стоит вам задуматься об установке — и проступает капелька пота на лбу при мысли, что нужно будет сделать что-то невероятно сложное.Спойлер: Linux — не сложная система. Она просто другая. Чтобы с ней было удобно работать, её нужно настроить. Яркое доказательство моих слов — все системы на macOS. Это тоже UNIX (родственная Linux система с общими корнями и философией), просто настроенный и ушедший далеко от чёрной темы терминала. И люди не страдают от систем Apple, а наоборот, стремятся к ним.
Как настроить Arch Linux, чтобы он обошёл Windows 11 по производительности и стилю
Работа с Linux часто отпугивает начинающих пользователей. Возможно, вы слышали от альфа-айтишников, что на «Линуксе» чуть ли не весь мир стоит, но стоит вам задуматься об установке — и проступает капелька пота на лбу при мысли, что нужно будет сделать что-то невероятно сложное.Спойлер: Linux — не сложная система. Она просто другая. Чтобы с ней было удобно работать, её нужно настроить. Яркое доказательство моих слов — все системы на macOS. Это тоже UNIX (родственная Linux система с общими корнями и философией), просто настроенный и ушедший далеко от чёрной темы терминала. И люди не страдают от систем Apple, а наоборот, стремятся к ним.
Локальный ассистент для зумов, часть 2: как граф встреч становится памятью и почему ему можно верить
В первой части я собрал ассистента, который слушает созвон, различает голоса, пишет стенограмму и складывает встречу в граф знаний в Obsidian. Всё на своём Маке, ничего не уходит в облако. С тех пор прошло полтора месяца ежедневной работы, и оказалось, что записать встречу — это меньшая половина дела. Большая — сделать так, чтобы через месяц из этих записей можно было достать правду, а не то, что модель придумала по мотивам.
Как использовать облачные AI модели внутри контура компании и не получить по шее от ИБ?
Или пример того, что будет, если роль пакетного менеджера доверить AI.Короткий ответ — используйте шаблоны.Шаблон
NVIDIA выпустила PAIR — виртуальный маршрутизатор локального инференса для домашних ПК
NVIDIA представила
NVIDIA договорилась о покупке Hugging Face за $12,93 млрд
NVIDIA объявила о соглашении по приобретению платформы Hugging Face — одной из крупнейших площадок для разработчиков открытого искусственного интеллекта. Сумма сделки составит $12,93 млрд.О сделке стало известно 3 сентября 2026 года. После приобретения NVIDIA планирует масштабировать инфраструктуру Hugging Face и ускорить развитие открытых AI-моделей. Платформа объединяет миллионы разработчиков, исследовательских групп и компаний, которые используют её для публикации моделей, датасетов и приложений.Что изменится для разработчиков
«Аниме-завод» открыт: выкладываю код конвейера, который сам режет эпизоды на Shorts
За последнее время я написал три статьи про систему, которая превращает длинные видео в вертикальные клипы: общий обзор «аниме-завода», разбор виртуальной камеры с face tracking и рассказ о том, почему связка «транскрипт + LLM» почти всегда даёт мусор.Комментарий, который повторялся под всеми тремя, был один и тот же: «покажи код».Показываю.→ github.com/ialakey/shorts-factory

