Qwen3.8 Max вышла: выше Claude Fable 5 в агентном индексе при цене $6 за миллион токенов
Финальная модель Alibaba получила миллион токенов контекста, независимые оценки и очень серьёзную цену. Проверяем, что осталось от июльских обещаний и где всё ещё приходится ждать.
BotHub за первое полугодие 2026: 72,4 млн ₽ выручки и переход к своим AI-продуктам
Для нас первая половина 2026 года стала не просто периодом роста, а моментом, когда бизнес вышел на устойчивую прибыль, а продуктовая стратегия сместилась от агрегатора моделей к собственным AI-сервисам.
Учёные создали открытую мультимодальную базу данных для изучения концентрации внимания
Команда российских исследователей при участии учёных НИУ ВШЭ в Санкт‑Петербурге разработала первую открытую мультимодальную базу данных с записями активности мозга, работы сердца и видеонаблюдения. База поможет учёным понять, что происходит с мозгом человека во время глубокой концентрации. В будущем эта разработка позволит ускорить создание нейроинтерфейсов, технологий реабилитации и систем искусственного интеллекта. Статья о результатах исследования опубликована в журнале Scientific Data.
Как научить ИИ понимать графики: разбираем новый набор данных ChartNet от MIT
Привет, Хабр! Меня зовут Павел, я ML-инженер и исследователь в области ИИ. Недавно наткнулся на исследование, посвященное проблеме понимания графиков визуально-языковыми моделями (Vision-Language Model, VLM), и решил подробнее разобраться в этой теме.В наши дни большое количество научных, деловых и политических данных представляется в формате графиков, однако современные VLM решают задачу их анализа лишь частично. Одна из главных причин этого — отсутствие масштабных и разнообразных наборов данных для обучения и тестирования.
Специалист против универсала: GLM‑OCR читает таблицы, которые Gemma 4 выдумывала
В первой части локальная Gemma 4 на мыльной таблице сочинила целую строку зарплат, а на гигантской — насыпала гладких круглых тысяч вместо реальных чисел. В комментариях читатель сказал: для OCR таблиц бери специальную модель, GLM‑OCR, она и меньше, и точнее. Я взял. На той же строке, которую Gemma выдумала, GLM прочитала всё верно.Откуда это вообще взялосьСтатью я писал не про «Gemma — лучший OCR» (она им не является), а про карту: где у общего локального VLM ломается зрение и как это ловить. И в комментарии badsynt
Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду
MacBook M3, 16 гигабайт, никакого облака. Свежая Gemma 4 берёт с картинки график и отдаёт CSV. Первые три кейса — идеально. На четвёртом модель начала врать. И врать аккуратнее, чем говорила правду.ВводнаяВышла Gemma 4 12B Unified — мультимодальная модель, которая читает не только текст, но и картинки. В квантованном виде она помещается на обычный ноутбук, и мне стало любопытно, что это даёт на практике, а не в бенчмарках.
Lenovo выпустила гаджет для детей с ИИ и GPS
Lenovo представила в Китае устройство AI Companion Device, предназначенное для детей. Оно предлагает функции искусственного интеллекта, геолокации и родительского контроля.
vLLM, LoRA и GPU-кластеры: техническая анатомия обогащения поисковой выдачи Авито мультимодальными моделями
Привет, Хабр! Меня зовут Кирилл Нетреба, я Backend-ML-инженер в Авито. В этой статье я разберу, как мы научили платформу отыскивать нужные пользователю объявления, даже если в них нет соответствующего запросу текста. Мы препарируем связку из Qwen2.5-VL, фреймворка vLLM и LoRA-адаптеров, а также заглянем в бэкенд-инфраструктуру, которая переваривает миллионы обновлений в сутки без деградации latency.Это история о том, как в эпоху, когда традиционный полнотекстовый поиск бессилен перед лаконичностью пользователей, ему на помощь приходит машина, обученная на изображениях и языке.
Мультимодальные модели – грубый и дорогой инструмент
Нам нужно новое зрение для интерфейсовПока все в погоне за всё более универсальными ИИ-агентами пытаясь создать тот самый AGI по нашему подобию, мне кажется полезным спуститься на уровень ниже и посмотреть на более приземлённую инженерную проблему.Мы неплохо научили модели работать с текстом, кодом, изображениями и инструментами. Мы научили их вызывать функции, научили эти ИИ писать собственные инструменты каждый раз для задач которые повторяются миллионы раз, видеть как мы(фото), думать как мы(рассуждения). Мы научились – дообучать их под новые сценарии через fine-tuning.

