мультимодальные модели.

В Anthropic работают около 30 000 ИИ‑агентов или как Claude разрабатывает себя сам

По внутреннему индексу автоматизации самих Anthropic, Claude уже ведёт 26% работы в области разработки ИИ: получает задачу на высоком уровне и выполняет большую часть работы самостоятельно, оставаясь под наблюдением человека. Более 90% работ выполняются как минимум при значительном участии ИИ. При этом полностью автономных направлений среди измеренных пока нет.

продолжить чтение

Qwen и Grok отгадывают советские загадки на внимательность

Для сравнения были выбраны 2 советских загадки, которые активно гуляют по интернету (автором материалы взяты отсюда). У кого лучше с логикой и внимательностью? Чья архитектура позволит увидеть больше?Для разогрева поставим простую задачу поиска предметов (см. картинку ниже, взято отсюда). ИИ предстояло найти 10 объектов с первой картинки и найти их на второй.

продолжить чтение

DeepSeek открыла веса экспериментальной V4-Flash-Vision

DeepSeek опубликовала веса DeepSeek-V4-Flash-Vision-Exp — экспериментальной мультимодальной модели на 305 млрд параметров. Их выкатили спустя 10 дней после первоначального релиза V4-Flash и распространяют под лицензией MIT.Модель построена на архитектуре V4-Flash, к которой добавили визуальный модуль и дополнительное обучение на мультимодальных данных. Задача — получить модель, способную не только работать с текстом, но и анализировать скриншоты, графики и другие изображения, а также использовать инструменты в агентных сценариях.Мультимодальные задачи

продолжить чтение

AI R&D DAY: два трека об исследованиях и продуктизации ИИ

Привет, Хабр!17 сентября 2026 года в Москве и онлайн пройдет AI R&D DAY. Это конференция для исследователей, ML‑инженеров, AI‑архитекторов, руководителей R&D‑команд и специалистов, которые превращают экспериментальные разработки в работающие продукты.Один из фокусов конференции — NextGenAI, проект команды R&D SberAI, посвященный технологиям следующего поколения. Команда поделится результатами исследований, расскажет о развиваемых продуктах и представит технологические направления, над которыми работает сейчас.

продолжить чтение

Qwen3.8 Max вышла: выше Claude Fable 5 в агентном индексе при цене $6 за миллион токенов

Финальная модель Alibaba получила миллион токенов контекста, независимые оценки и очень серьёзную цену. Проверяем, что осталось от июльских обещаний и где всё ещё приходится ждать.

продолжить чтение

BotHub за первое полугодие 2026: 72,4 млн ₽ выручки и переход к своим AI-продуктам

Для нас первая половина 2026 года стала не просто периодом роста, а моментом, когда бизнес вышел на устойчивую прибыль, а продуктовая стратегия сместилась от агрегатора моделей к собственным AI-сервисам.

продолжить чтение

Учёные создали открытую мультимодальную базу данных для изучения концентрации внимания

Команда российских исследователей при участии учёных НИУ ВШЭ в Санкт‑Петербурге разработала первую открытую мультимодальную базу данных с записями активности мозга, работы сердца и видеонаблюдения. База поможет учёным понять, что происходит с мозгом человека во время глубокой концентрации. В будущем эта разработка позволит ускорить создание нейроинтерфейсов, технологий реабилитации и систем искусственного интеллекта. Статья о результатах исследования опубликована в журнале Scientific Data.

продолжить чтение

Как научить ИИ понимать графики: разбираем новый набор данных ChartNet от MIT

Привет, Хабр! Меня зовут Павел, я ML-инженер и исследователь в области ИИ. Недавно наткнулся на исследование, посвященное проблеме понимания графиков визуально-языковыми моделями (Vision-Language Model, VLM), и решил подробнее разобраться в этой теме.В наши дни большое количество научных, деловых и политических данных представляется в формате графиков, однако современные VLM решают задачу их анализа лишь частично. Одна из главных причин этого — отсутствие масштабных и разнообразных наборов данных для обучения и тестирования.

продолжить чтение

Специалист против универсала: GLM‑OCR читает таблицы, которые Gemma 4 выдумывала

В первой части локальная Gemma 4 на мыльной таблице сочинила целую строку зарплат, а на гигантской — насыпала гладких круглых тысяч вместо реальных чисел. В комментариях читатель сказал: для OCR таблиц бери специальную модель, GLM‑OCR, она и меньше, и точнее. Я взял. На той же строке, которую Gemma выдумала, GLM прочитала всё верно.Откуда это вообще взялосьСтатью я писал не про «Gemma — лучший OCR» (она им не является), а про карту: где у общего локального VLM ломается зрение и как это ловить. И в комментарии badsynt

продолжить чтение

Локальная Gemma 4 на MacBook читает графики и таблицы — и врёт красивее, чем говорит правду

MacBook M3, 16 гигабайт, никакого облака. Свежая Gemma 4 берёт с картинки график и отдаёт CSV. Первые три кейса — идеально. На четвёртом модель начала врать. И врать аккуратнее, чем говорила правду.ВводнаяВышла Gemma 4 12B Unified — мультимодальная модель, которая читает не только текст, но и картинки. В квантованном виде она помещается на обычный ноутбук, и мне стало любопытно, что это даёт на практике, а не в бенчмарках.

продолжить чтение