vlm.

vlm.

Я обучил собственную визуально‑языковую модель меньше чем на 1 млрд параметров

Каково это сегодня — с нуля собрать и обучить собственную визуально‑языковую модель? Именно этот вопрос и подтолкнул меня попробовать самому. Я взял базовую языковую модель, подключил к ней визуальный бэкбон и несколько часов обучал всё это на арендованной GPU в RunPod, пытаясь добиться от модели осмысленных описаний изображений.TL;DR:

продолжить чтение

AI‑агент вместо ручного регресса: архитектура, метрики, инсайты

продолжить чтение

Почему VLM галлюцинирует объекты, которых нет: zero-shot детекция дыма и решение с помощью промпта

Ранняя детекция дыма и огня — частая и ценная задача уличной видеоаналитики. Камера может заметить возгорание раньше, чем люди на улице или оператор. Обучать отдельную модель детекции — это датасет, разметка и время, а возгорания в кадре выглядят слишком по-разному, чтобы быстро покрыть все случаи. Поэтому, когда сценариев детекции в рабочих проектах стало слишком много, я решила попробовать короткий путь, попросить VLM (языковую модель, умеющую работать с изображениями) найти дым текстовым промптом в zero-shot режиме, то есть вообще без обучения под задачу.Первой моделью взяла Qwen3.5-9B

продолжить чтение

Qwen и Grok отгадывают советские загадки на внимательность

Для сравнения были выбраны 2 советских загадки, которые активно гуляют по интернету (автором материалы взяты отсюда). У кого лучше с логикой и внимательностью? Чья архитектура позволит увидеть больше?Для разогрева поставим простую задачу поиска предметов (см. картинку ниже, взято отсюда). ИИ предстояло найти 10 объектов с первой картинки и найти их на второй.

продолжить чтение

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

продолжить чтение

Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2

В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и как вообще обучают физический ИИ. Теперь — про то, как все это работает в реальности. Про экономику, промышленность, государственные программы и человеческую природу.Кисти, батарейки и прочая прозаНачнем с интересного вопроса. Зачем вообще делать роботов похожими на людей? Неужели колесная тележка с манипулятором не практичнее?

продолжить чтение

Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1

Сколько времени вам, человеку, нужно, чтобы сложить футболку? Секунд пять, если аккуратно и секунд десять, если прям вообще аккуратно.А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы робот сложил ту же футболку сам — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины?Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.

продолжить чтение

Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

продолжить чтение

Как мы построили сервис компьютерного зрения на базе внешних VLM для контроля выкладки и ценников: опыт Fix Price

Привет, Хабр! Меня зовут Кристина Истратова и я руковожу центром аналитики данных в Fix Price. В нашей Сети более 8 000 магазинов, а в каждом из них — множество   товаров. Думаю, все из нас знают, как покупатели реагируют на отсутствие ценника или неверную цену на нем, какие чувства вызывает пустая полка, где нет товара, за которым приходишь в магазин.

продолжить чтение

Почему промпты для VLM работают наоборот: как это исправить

Недавно я пытался выжать максимум из корпоративной OCR-модели, перебирая промпты и гиперпараметры, когда наткнулся на issue в репозитории Qwen-3-VL. Автор утверждал, что точность задачи выросла просто от изменения порядка: сначала изображение, потом текст. Просто перестановка блоков.Звучало странно. Трансформеры используют позиционное кодирование, но модель видит те же пиксели и те же слова. Порядок не должен так сильно влиять. Я проверил, оказалось, автор был прав.| Если вам интересна тема AI‑агентов и внедрения нейросетей, заглядывайте в мой Telegram‑канал ДругОпенсурса

продолжить чтение