qwen. - страница 2

Qwen выпустила Qwen3.8-Omni‑Flash

Команда Qwen представила Qwen3.8-Omni‑Flash — новую мультимодальную модель. Главный акцент в новой версии сделали на понимании видео. Qwen3.8-Omni‑Flash умеет анализировать длинные ролики, составлять по ним подробные отчёты и генерировать описания содержимого. В Qwen отдельно отмечают улучшение работы с временными метками: модель должна точнее связывать события с конкретными моментами видео.При этом текстовые возможности модели сохранили на уровне Qwen3.8-Flash. В API также доступны function calling и веб‑поиск, а режим рассуждений включён по умолчанию и может настраиваться через reasoning_effort.

продолжить чтение

Наш бенчмарк ИИ‑агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

Всем привет. На связи Сергей Игнатенко, основатель ИИ‑платформы VibePilot.Мы тут сделали свой бенчмарк моделей ИИ, которые работают внутри наших ИИ‑агентов.Почему вообще возникла эта задачаДело в том, что наши ИИ‑агенты работают на суверенных моделях Яндекса (Alice AI LLM, YandexGPT 5 Pro) уже с апреля этого года. Традиционно считается, что это слабые модели, которые не приспособлены для агентных сценариев. Благодаря проработанной архитектуре мы добились того, что слабые модели делают сложные задачи. Чтобы это доказать и показать, и была сделана страница.

продолжить чтение

Тест DeepSeek, Qwen, GLM и прочих LLM на продвинутом пользовательском железе

Привет, Хабр! Еще чуть больше года назад ваш покорный слуга наконец решился обновить комп, приобретя ПК с RTX 5090 и 96Gb RAM, которые, как я тогда думал, окажутся ультимативным решением для запуска всего, что может когда‑либо хотеться запустить. Но с выходом DeepSeek V4 Flash в апреле понял, что оказался в своеобразном «лимбо» — суммарных 128Gb VRAM+RAM хватало либо на запуск модельки в кванте

продолжить чтение

Семь ИИ‑моделей получили по $300 и три дня, чтобы заработать. Выручка — $0

Рандомные картинки на тему ИИ ставить на КДПВ не стал, сделал картинку «на тему»

продолжить чтение

Qwen и Grok отгадывают советские загадки на внимательность

Для сравнения были выбраны 2 советских загадки, которые активно гуляют по интернету (автором материалы взяты отсюда). У кого лучше с логикой и внимательностью? Чья архитектура позволит увидеть больше?Для разогрева поставим простую задачу поиска предметов (см. картинку ниже, взято отсюда). ИИ предстояло найти 10 объектов с первой картинки и найти их на второй.

продолжить чтение

NVIDIA выпустила PAIR — виртуальный маршрутизатор локального инференса для домашних ПК

NVIDIA представила

продолжить чтение

Стартап Mostik связал GLM-5.2 и Qwen-3.5 без текстового обмена

Российские математики разработали способ, который позволяет разным ИИ-моделям обмениваться информацией без промежуточной генерации текста. О разработке 2 сентября сообщил WIRED.В демонстрации команда связала GLM-5.2 на 753 млрд параметров и Qwen-3.5 на 4 млрд параметров. По заявлению Mostik, гибридная система работает примерно в 20 раз дешевле полной GLM-5.2, а её качество находится между результатами двух исходных моделей.

продолжить чтение

Переводим книги нейронками для себя: год спустя. Словари, скорости и почему переводчики всё ещё нужны

Год назад я написал статью «Переводим fb2 книжки, с нейронками, для себя» — про то, как собрал на паре Tesla P40 в гараже программу Sunny Narrator («Солнечный сказочник»), которая переводит художественные книги через локальные и облачные LLM. Тогда это был скорее прототип «доказать себе, что так можно»: черновики читались с головной болью, книга в тысячу страниц переводилась два дня, а электричество, отключённое посреди процесса, стоило ещё двух.За год программа доехала до версии 2.1, я перевёл достаточно книг, чтобы набить руку, и понял главное:

продолжить чтение

Новые ИИ-модели и LLM недели: Qwen3.8-Flash-Next, GLM-5.3, Granite 4.2, Hy4 и новые модели для видео, речи и изображений

С 24 по 31 августа разработчики выпустили сразу несколько заметных ИИ-моделей и LLM. В числе главных релизов недели — новая архитектура Qwen3.8-Flash-Next, мультимодальная GLM-5.3-Flash и публикация весов основной GLM-5.3, Granite 4.2 от IBM, Hy4 preview от Tencent и первая собственная LLM Thomson Reuters.Параллельно обновились модели для генерации видео, изображений и речи. Alibaba выпустила Wan 3.0, Bria AI — Fibo 1.5, а в speech-направлении появились Gemini 3.5 Transcribe, FireRedTTS3, Breeze TTS 2 и Sopro V2 Turbo. Ниже — главные релизы новых нейросетей и обновления AI-моделей за последнюю неделю августа.Новые LLM и мультимодальные языковые моделиThomson — собственная LLM от Thomson Reuters

продолжить чтение

Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток-сек на двух RTX 3090

Плотная 27B-модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко, и надо разобраться, что и где подкрутить. Оказалось, что горлышек несколько, и все они снимаются флагами запуска: те же веса — 75 токенов в секунду. Ниже каждый флаг описан одинаково: зачем, что писать, что даёт, где ломается. В конце — готовый docker run.Стенд: 2× RTX 3090 (24 ГБ, PCIe 4.0 x16, без NVLink), Threadripper 3960X, 121 ГБ RAM, Ubuntu 26.04, драйвер 595.71.05. llama.cpp — образ ghcr.io/ggml-org/llama.cpp:full-cuda

продолжить чтение