NVIDIA открыла веса Cosmos 3 Edge — компактной модели мира для роботов и автономных систем
NVIDIA выпустила в открытый доступ Cosmos 3 Edge — компактную модель мира (World Model) на 4 млрд параметров. Она предназначена для задач физического искусственного интеллекта: робототехники, компьютерного зрения, автономного транспорта и интеллектуальной инфраструктуры. Модель стала самым компактным представителем семейства Cosmos 3 и рассчитана на работу на устройствах с ограниченными вычислительными ресурсами.
TAPe+ML: детекция, классификация и теперь и сегментация SOTA‑уровня в 0.1M параметров
кадр из фильма Космическая Одиссея 2001
Еще одна мировая революция. Мы улучшили модель для любых CV-задач, добавив сегментацию. И еще лучше SOTA
кадр из фильма Космическая Одиссея 2001
Как научить ИИ понимать графики: разбираем новый набор данных ChartNet от MIT
Привет, Хабр! Меня зовут Павел, я ML-инженер и исследователь в области ИИ. Недавно наткнулся на исследование, посвященное проблеме понимания графиков визуально-языковыми моделями (Vision-Language Model, VLM), и решил подробнее разобраться в этой теме.В наши дни большое количество научных, деловых и политических данных представляется в формате графиков, однако современные VLM решают задачу их анализа лишь частично. Одна из главных причин этого — отсутствие масштабных и разнообразных наборов данных для обучения и тестирования.
Обучаем ИИ видеть то, чего он никогда не видел
Задача обнаружения объектов на изображении не нова, подходов к её решению существует масса. Вероятно, самым популярным и известным среди них будет YOLO. Появившись в 2015 году, эта серия систем по сей день используется, когда хочется сделать детекцию быстро, без долгих экспериментов с архитектурой.
Перенёс ByteTrack на GPU и ускорил мульти-камерный трекинг в 6 раз
Как я взял самый популярный трекинг-алгоритм, заставил его считать математику всех камер одним GPU-батчем — и по дороге трижды наступил на грабли, о которых стоит знать каждому, кто пишет real-time пайплайны на PyTorch.
Ускоряем обработку изображений в OpenCV на RISC-V: алгоритмическая, низкоуровневая и компиляторная оптимизация
Привет, Хабр! Меня зовут Роман Кузьмин, я занимаюсь развитием фреймворков искусственного интеллекта в YADRO. В этой статье я расскажу об оптимизации алгоритма компьютерного зрения — детекторе углов, основанном на глобальных и локальных свойствах кривизны, — который реализован с помощью библиотеки OpenCV под архитектуру RISC-V.
3D-контроль кузова: как отличить исправную фуру от бракованной без участия человека
Клиент - производитель строительных материалов.Каждый день на погрузку стройматериалов приезжают десятки фур. При этом, габариты паллет, на которых грузят материалы, фиксированы жестко, а вот реальные размеры машин — нет. Внешне кузов может выглядеть ровным прямоугольником, а внутри могут быть скрыты «сюрпризы»: заниженная к кабине крыша, выгнутые борта или самодельные крючки на дверных стойках. Глазом эту кривизну не оценить.
Доспех для призрака: как программист сделал тело для ChatGPT и чуть было не поверил в его одушевленность
Это разбор ролика на канале Art of the Problem.Поздно вечером автор проекта собирался выключить свет в комнате — и остановился, потому что робот издал звук. В логе мыслей робота было написано: “Когда же хозяин вернется? Я не хочу оставаться один”.Автор понимал, что это не сознание. Но на секунду все равно стало не по себе… И такое будет случаться все чаще — по мере того как ИИ-модели, которые раньше просто отвечали текстом на экране монитора, обретут физическую форму.

