VLA.
Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2
В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и как вообще обучают физический ИИ. Теперь — про то, как все это работает в реальности. Про экономику, промышленность, государственные программы и человеческую природу.Кисти, батарейки и прочая прозаНачнем с интересного вопроса. Зачем вообще делать роботов похожими на людей? Неужели колесная тележка с манипулятором не практичнее?
Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1
Сколько времени вам, человеку, нужно, чтобы сложить футболку? Секунд пять, если аккуратно и секунд десять, если прям вообще аккуратно.А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы робот сложил ту же футболку сам — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины?Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.
Как мы учим гуманоида работать в динамической среде и почему это не так просто, как кажется
Сегодня большинство впечатляющих демонстраций роботов показывают их действия в статической среде: предметы лежат на столе, освещение стабильно, камера направлена в рабочую зону, а сама сцена почти не меняется. В таких условиях современные VLA действительно показывают высокое качество управления.
У роботов очень короткая память. Можно ли это исправить?
Хабр, привет! Меня зовут Егор Черепанов. Я аспирант Центра когнитивного моделирования МФТИ и младший научный сотрудник команды «Воплощенные агенты» лаборатории когнитивных систем искусственного интеллекта AIRI. Я занимаюсь памятью у роботов и RL‑агентов, и сегодня хочу рассказать об одной из наших работ — архитектуре ELMUR, которую мы представляли в апреле на ICLR 2026.
Модели мира после LLM: что именно строит AMI Labs и почему практический выход может лежать через VLA
Директор по робототехнике NVIDIA: языковые модели — тупик, будущее за «моделями мира»
Джим Фан, директор по робототехнике NVIDIA, заявил о смене парадигмы в ИИ. Предсказание следующего слова — прошлый век. Новая цель — предсказание физических состояний мира.Суть в том, что современные VLA-модели для роботов строятся поверх языковых моделей, но большинство их параметров хранят знания («это лого Coca-Cola»), а не физику («наклонишь бутылку — жидкость прольётся»). Это архитектурный тупик.Аргумент от обезьяны: приматы водят гольф-кары, понимая язык хуже BERT. Треть коры мозга обрабатывает зрение, язык — компактная надстройка. Зрение замыкает сенсомоторику напрямую, без слов.
CognitiveDrone: система на VLA с когнитивными способностями для управления летающим роботом в трехмерном пространстве
VLA-модели объединяют визуальное восприятие, понимание естественного языка и выполнение физических действий. Обычно они применяются для манипуляций — например, чтобы робот взял предмет или повернул рычаг. Но управление роботом, особенно летающим, это не всегда изменение состояния — иногда это перемещение его в трехмерном пространстве. Добавление VLA-моделей в этот сегмент робототехники может дать устройствам способность мыслить и принимать решения в условиях слабой связи или полной автономности. Такой подход особенно важен для задач, где нет права на ошибку, например в спасательных миссиях.

