vlm.

vlm.

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

продолжить чтение

Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2

В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и как вообще обучают физический ИИ. Теперь — про то, как все это работает в реальности. Про экономику, промышленность, государственные программы и человеческую природу.Кисти, батарейки и прочая прозаНачнем с интересного вопроса. Зачем вообще делать роботов похожими на людей? Неужели колесная тележка с манипулятором не практичнее?

продолжить чтение

Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1

Сколько времени вам, человеку, нужно, чтобы сложить футболку? Секунд пять, если аккуратно и секунд десять, если прям вообще аккуратно.А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы робот сложил ту же футболку сам — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины?Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.

продолжить чтение

Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

продолжить чтение

Как мы построили сервис компьютерного зрения на базе внешних VLM для контроля выкладки и ценников: опыт Fix Price

Привет, Хабр! Меня зовут Кристина Истратова и я руковожу центром аналитики данных в Fix Price. В нашей Сети более 8 000 магазинов, а в каждом из них — множество   товаров. Думаю, все из нас знают, как покупатели реагируют на отсутствие ценника или неверную цену на нем, какие чувства вызывает пустая полка, где нет товара, за которым приходишь в магазин.

продолжить чтение

Почему промпты для VLM работают наоборот: как это исправить

Недавно я пытался выжать максимум из корпоративной OCR-модели, перебирая промпты и гиперпараметры, когда наткнулся на issue в репозитории Qwen-3-VL. Автор утверждал, что точность задачи выросла просто от изменения порядка: сначала изображение, потом текст. Просто перестановка блоков.Звучало странно. Трансформеры используют позиционное кодирование, но модель видит те же пиксели и те же слова. Порядок не должен так сильно влиять. Я проверил, оказалось, автор был прав.| Если вам интересна тема AI‑агентов и внедрения нейросетей, заглядывайте в мой Telegram‑канал ДругОпенсурса

продолжить чтение

От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев

Привет, Хабр! Меня зовут Иван Попов, я руковожу командой компьютерного зрения CV Hub в дирекции искусственного интеллекта X5 Tech. А ещё у нас в команде есть Иваныч. Так пользователи «Пятёрочки» ласково называют нашу CV-систему, которая модерирует фотографии в «Клубе тайных покупателей». Когда анкета закрывается за час, в комментариях пишут: «Иваныч сегодня хорошо работает». Имя дали сами пользователи, совпадение с моим именем чистая случайность, опыт Amazon Go не повторяем))

продолжить чтение

Finetune Lora Qwen3vl и прочие приключения

У меня была видеокарта NVIDIA A100 с максимальным объёмом памяти 79,254 Гб. Нужно было извлечь ключевую информацию (задача Question Answering) из 6 тыс. многостраничных документов. Всего было 15 полей разного типа:

продолжить чтение

От OCR к смыслу: как мы научили модель понимать, кто кому отец, мать, жених и свидетель

продолжить чтение

Как Vision-Language Models учатся работать с 3D-миром

продолжить чтение