Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники. icra.. icra. ml.. icra. ml. rl.. icra. ml. rl. Алгоритмы.. icra. ml. rl. Алгоритмы. конференция.. icra. ml. rl. Алгоритмы. конференция. роботы.. icra. ml. rl. Алгоритмы. конференция. роботы. Транспорт.
Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 1

В начале июня в Вене прошла главная международная конференция по робототехнике и автономным системам — International Conference on Robotics and Automation (ICRA). В этом году среди участников была и наша команда автономного транспорта Яндекса.

Топиков, которые обсуждаются на ICRA, много, потому что она не только об ML — она скорее о робототехнике в целом. Например, есть секции о механизмах и дизайне, а также о медицинских роботах. Было немало и чисто инженерных работ.

Ключевой топик докладов на конференции — RL, он же Reinforcement Learning, обучение с подкреплением. Также нас интересовали статьи по классическому пайплайну автономного автомобиля: perception + prediction + planner + simulation. Новые подходы к Robotic Learning тоже интересны, так как их можно перенести на задачи автономного транспорта.

Меня зовут Егор Волков, я занимаюсь претрейном модели планирования движения в автономном транспорте Яндекса. Вместе со мной на конференцию ездил Максим Спорышев (@msporyshev) — руководитель службы поведения и предсказания движения. В этой статье мы собрали самые интересные тренды, доклады и инженерные развилки, которые заметили на ICRA 2026, — от Reinforcement Learning и генерации редких edge‑кейсов до того, куда вообще двигается ML в робототехнике.


О выборе жюри: best papers

Организаторы конференции отметили несколько ключевых работ. Best Conference Paper Award получили две статьи:

  1. SymSkill: Symbol and Skill Co‑Invention for Data‑Efficient and Reactive Long‑Horizon Manipulation — интересный не ML‑подход к манипуляционным задачам с большим горизонтом планирования.

  2. OmniRetarget: Interaction‑Preserving Data Generation for Humanoid Whole‑Body Loco‑Manipulation and Scene Interaction — новый способ ретаргетинга для обучения роботов‑гуманоидов на человеческих демонстрациях, который сохраняет пространственные отношения с объектами.

Не менее интересными были и победители других номинаций. Поговорим о них чуть подробнее. 

В номинацию Best Paper Award on Robot Learning попала работа: Do You Know Where Your Camera Is? View‑Invariant Policy Learning with Camera Conditioning. В ней описывается необычный кондишенинг на положения камер в VLA‑моделях — тех, что переводят картинку и инструкцию в действия робота. Задача решалась на примере роборуки, но в целом актуальна для любых роботов и автономного транспорта.

У робота есть камера, которая снимает, что он делает, и авторы показали, что качество всех VLA сильно проседает, если камеру переставить: в сетапах с рандомным размещением success rate падает практически в два раза. При этом у разных роботов камеры стоят в разных местах.

Авторы предложили простое и при этом элегантное решение: положение камер закодировали в каждом пикселе при помощи плюккеровых координат. Задали луч камеры для каждого пикселя шестью дополнительными числами: дельтами и моментами. В результате профит есть даже без рандомизации положения камеры — качество работы моделей выросло.

В номинации Best Paper Award on Robot Perception отметили одну интересную статью: FindAnything: Open‑Vocabulary and Object‑Centric Mapping for Robot Exploration in Any Environment. Здесь речь идёт об exploration и mapping над пространством объектов. Робот ищет произвольный объект в неизвестной локации и по пути строит карту всего, что нашёл. Для каждого объекта он запоминает языковое описание, положение в пространстве, геометрию и визуальные признаки. Решается задача при помощи сетапа из нескольких foundation‑моделей.

Основная сложность была в том, чтобы совместить 3D‑фичи с моделями, которые умеют скрещивать картинки с текстом в момент построения карты. Так что пайплайн получился сложный, но интересный, а главное — работающий на реальном роботе.

О воркшопах

Один из основных воркшопов был целиком посвящён теме Reinforcement Learning в робототехнике. Рассказывали о разных вариантах претрейна на демонстрационных данных (IL, Offline RL), как делать ризонинг в embodied‑моделях, sim2real/real2sim, world modelling. 

На воркшопе по автономным автомобилям, организованном Мюнхенским университетом, команда исследователей из Huawei, NVIDIA Research и OpenDriveLab из Shanghai AI Laboratory рассказала о своём посттрейновом фреймворке World Engine: обученная с его помощью модель планирования позволяет автономному автомобилю проезжать в среднем 200 км по Шанхаю без вмешательства водителя‑испытателя. Уже выложили в опенсорс. Работа нам показалась интересной с точки зрения генерации safety‑critical‑сценариев. Также в своём докладе NVIDIA объявили, что вслед за недавним релизом модели Alpamayo 2 и симулятора выложат огромный датасет и запустят челлендж AlpaSim. 25 стран, 2500 городов и 1700 часов проездов — звучит супермощно. 

Другой интересный воркшоп — о предсказании траекторий пешеходов. На нём обсудили ключевую сложность задачи: движение пешехода зависит от взаимодействия с машинами и от того, что он считает безопасным. К сожалению, прорывных решений проблемы пока никто не предложил. 

О докладах и постерах

Residual Off‑Policy RL for Finetuning Behavior Cloning Policies

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 2

Работа от Amazon Frontier AI & Robotics про планирование движения. Снова всё рассматривается на роботах, но подходы вполне применимы и в автономном транспорте.

Для больших VLA хорошо работает претрейн на behaviour cloning, а вот RL пока масштабируется плохо: данных не хватает, сложно учитывать success rate на длинных горизонтах, а пространства экшенов слишком большие, чтобы их покрыть, — в статье упоминаются 29 степеней свободы.

Авторы предлагают учить Residual RL — политику, которая даёт небольшую добавку к экшену от behaviour cloning. А ещё в статье делятся рецептом реализации.

FP3: A 3D Foundation Policy for Robotic Manipulation

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 3

Авторы критикуют vision‑энкодеры в современных VLA и утверждают, что без трёхмерного представления о мире не обойтись. В качестве решения они предлагают сетап обучения с Uni3D как энкодером. В чём заключаются ключевые преимущества:

  • Высокая эффективность с малым объёмом данных. Для адаптации к новой задаче достаточно всего около 80 демонстраций. 

  • Сильное обобщение. Модель показывает высокую успешность (выше 90%) в новых средах с ранее не встречавшимися объектами. 

  • Важность 3D‑представления. Эксперименты показывают, что использование 3D‑информации значительно улучшает способность робота адаптироваться по сравнению с чисто 2D‑подходами. 

Search3D: Hierarchical Open‑Vocabulary 3D Segmentation

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 4

Постер о новом подходе к open vocabulary от ETH, Google и Stanford. Застать авторов, к сожалению, не получилось.

В статье рассказывается про подход в компьютерном зрении, который по текстовому запросу на обычном языке находит объект в 3D‑сцене и выделяет его границы. Ключевая идея — описать сцену иерархически, сразу на нескольких уровнях детализации: целый объект, его части, отдельные области. Запрос может попасть в любой из этих уровней — и в предмет целиком, и в его деталь.

COMPASS: Cross‑embOdiment Mobility Policy via Residual RL and Skill Synthesis

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 5

COMPASS — фреймворк от NVIDIA Research для универсальных политик передвижения: одна политика на роботов с разной конструкцией.

Идея — закрыть разрыв между общим и частным. Правила навигации у роботов примерно одни, а что робот физически может — зависит от его конструкции. COMPASS соединяет три подхода: Imitation Learning, Residual RL и дистилляцию политик.

В чём ещё преимущества COMPASS:

  • Позволяет эффективно адаптироваться к новым роботам, используя данные лишь с одной исходной платформы. 

  • Обеспечивает высокую обобщающую способность: политика‑генералист достигает примерно в 5 раз более высокой успешности на unseen‑эмбеддингах по сравнению с предобученной IL‑политикой. 

  • Демонстрирует потенциал для zero‑shot‑переноса из симуляции в реальные условия (sim2real). 

Интересные статьи об автономном транспорте

Diffusion‑guided Generalizable Enhancer for Urban Scene Reconstruction

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 6

Работа от Waabi AI. Они улучшили 3D‑реконструкцию в зоне, ближайшей к исходному треку. 

Основная идея — взять диффузионные модели как генеративный prior и на нём дотянуть 3D‑реконструкцию до устойчивости к экстраполяции. Для автономного транспорта это больное место: симуляция сенсоров нужна с тех ракурсов, которых в логах не было.

Тесты проводят на дистанциях 3, 4 и 5 метров от исходных положений камер: делают feedforward‑рендеринг с помощью 3D Gaussian Splatting, добавляют шум и денойзят всё диффузией, которая училась восстанавливать изображения на дистанции 3 метра.

Это хорошее решение для симуляции небольшого отклонения, например перестроения, но неподходящее для сложных разворотов и прокладывания нового маршрута.

AttBEV: Enhancing Multi‑Modal 3D Object Detection with CBAM Attention in BEVFusion for Autonomous Driving

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 7

Attention BEV — развитие идеи BEV Fusion, то есть всё того же представления сцены сверху, но с прибавкой по метрикам на nuScenes, одном из основных бенчмарков в автономном транспорте.

К классическому BEV здесь добавляется блок Fusion — цепочка аттеншенов. Данные на входе мультимодальные: с одной стороны — пространственная размерность, то есть координаты, с другой — каналы, лидар и несколько камер. Авторы считают, что перемножать эти размерности целиком незачем: аттеншен применяют к каждому пространству по очереди.

Такой подход улучшает способность модели фиксировать ключевую информацию за счёт динамической калибровки каналов и пространственных измерений. AttBEV показывает лучшие результаты по сравнению с BEVFusion по большинству оценочных показателей. 

  • NDS достигает 0,6795 (на 2,63% выше, чем у BEVFusion);

  • mAP доходит до 0,6426 (на 1,79% выше, чем у BEVFusion). 

TreeIRL: Safe Urban Driving with Tree Search and Inverse Reinforcement Learning 

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 8

Авторы хотели совместить два мира: алгоритмический и ML‑планировщик. Сразу оговорюсь, почему считаю эту статью интересной: из множества постеров только этот — о решении, которое уже в проде. Они действительно ездят на этой технологии по Лас‑Вегасу.

Предлагаемая модель состоит из двух блоков:

  • поиск Монте‑Карло по дереву (Monte‑Carlo Tree Search, MCTS) для генерации траекторий кандидатов;

  • обученный с помощью Inverse Reinforcement Learning (IRL) scorer для выбора лучшей траектории. 

MCTS генерирует 100 траекторий: все они удовлетворяют формальным требованиям физичности, однако не все из них применимы в реальности. IRL scorer оценивает каждую траекторию с точки зрения человеческих предпочтений. В итоге выбирается одна финальная траектория — она физична и похожа на то, как водил бы человек.

Модель показала себя хорошо по сравнению с бейзлайном без MCTS не только на датасете nuPlan, но и в реальной жизни. Средняя дистанция до вмешательства водителя — более 400 км.

Learning to Annotate Delayed and False AEB events: a Practical System for Extreme Class Imbalance and Asymmetric Label Noise

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 9

Авторы решают задачу автоматической аннотации событий для системы автономного экстренного торможения — Automated Emergency Braking. Чтобы её оптимизировать, нужны точные метки, но всё самое важное сидит в хвосте распределения: задержанные и ложные срабатывания — это меньше 5% всех триггеров. Разметить их руками слишком дорого и долго.

Авторы предлагают два решения:

  • Физически правдоподобная аугментация данных. Вместо обычного перевзвешивания классов авторы генерируют реалистичные примеры редких событий: варьируют параметры целевой зоны, переносят динамику автомобиля между примерами и маскируют нерелевантных участников движения. Это уменьшает влияние дисбаланса классов и улучшает обучение детектора.

  • Очистка шумных меток. Метод оценивает сложность (hardness) каждого примера и с помощью probe‑guided adaptive threshold отличает вероятные ошибки разметки от действительно сложных пограничных случаев. В результате обучающий набор очищается, а качество обнаружения редких событий повышается.

Learning to Drive by Imitating Surrounding Vehicles

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 10

Статья и постер об обучении через имитацию действий других участников дорожного движения. Чтобы собрать тренировочный датасет, авторы берут сцены на nuPlan, выбирают на них одного‑двух хороших агентов и трансформируют их движение так, будто всё происходит от лица эго‑агента. Оставляют только хорошие треки, используя фильтрации по метрикам комфорта, пройденной дистанции и TTC.

Вывод работы: поведение окружающих машин — это тоже обучающие данные, и ими можно расширить выборку для Imitation Learning. Но брать всё подряд нельзя. Среди чужих траекторий попадаются и опасные, и просто неинформативные, так что всё решает стратегия отбора примеров.

Правда, есть нюанс: с ростом количества данных эффективность обучения падает. На размере датасета в несколько тысяч сцен виден большой профит по метрикам, который почти сводится к нулю на ста тысячах сцен. 

EP‑Diffuser: An Efficient Diffusion Model for Traffic Scene Generation and Prediction via Polynomial Representations

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 11

В задаче симуляции трафика на сцене исследователи предлагают EP‑Diffuser. Модель предсказывает траектории сразу всех участников движения — водителей и пешеходов — и достраивает реалистичное продолжение дорожной сцены, опираясь на её геометрию и историю движения агентов.

EP‑Diffuser похожа на MotionDiffuser, но входы и выходы диффузера — полиномы, в то время как у Motion Diffuser выходы — PCA‑представление. Полиномами описываются и элементы карты, и траектории агентов.

Чем же этот подход лучше? Авторы показывают, что полиномы переносятся с одного мира на другой: EP‑Diffuser работает с приемлемым качеством на датасете, на котором не обучался. MotionDiffuser с PCA‑компонентами так не умеет — PCA требует переобучения под новый датасет. При этом полиномы выигрывают и у сырого представления фич.

Отсюда и основной вклад работы: не новая диффузия, а удачное представление под неё.

Perfect Prediction or Plenty of Proposals? What Matters Most in Planning for Autonomous Driving

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 12

Эта работа интересна тем, что у неё довольно неочевидный вывод: даже идеальная информация о будущем (perfect predictions) — точные, «правильные» траектории других участников движения — не даёт существенного выигрыша в качестве итогового плана. Более того, в некоторых случаях (например, с методом DTPP) использование идеальных предсказаний даже ухудшало результат.

Проверялось это на двух бенчмарках:

  • Val14 — более распространённые сценарии с невысокой сложностью взаимодействия;

  • interPlan — высокоинтерактивные и выходящие за распределение данных ситуации.

По мнению авторов, фокус в развитии планирования сместился не на бесконечное улучшение предсказаний, а на умение системы генерировать богатый и качественный пул возможных действий, при этом используя предсказания разумно — в первую очередь для быстрой проверки сгенерированных планов на коллизии.

VL‑DPO: Vision‑Language‑Guided Finetuning for Preference‑Aligned Autonomous Driving

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 13

Авторы дообучают модель предсказания траекторий с помощью VLM. Сама VLM тут вспомогательный модуль, который выбирает лучшую траекторию из сгенерированных. Дальше этот преференс уходит в лосс основной модели.

Во время обучения VLM получает на вход 12 сгенерированных вариантов траектории, сцену в виде фотографий с камеры в разные моменты времени и вопрос: «У нас вот такая сцена. Скажи, пожалуйста, какую из этих траекторий ты предпочитаешь?» 

Дальше модель должна пройти всю цепочку сама: понять, что происходит, найти, кто важен, сообразить, куда едут агенты, оценить риски и назвать лучшую траекторию. Рассуждение идёт в формате вопрос — ответ.

Чтобы превратить ответ VLM в лосс, берут DPO. Он поочерёдно сравнивает преференс‑траекторию со всеми остальными и приучает модель предпочитать её каждой из них. Относительно классического сетапа с выбором ближайшей траектории такой модуль качество поднимает.

По итогам на метриках open‑loop стало лучше. Closed‑loop авторы не проверяли.

KiGRAS: Kinematic‑Driven Generative Model for Realistic Agent Simulation

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 14

Сильная сторона KiGRAS — на момент публикации модель была SOTA на челлендже симуляции агентов. Задача у неё простая: генерировать реалистичные траектории и поведение агентов.

Основная идея: сырая траектория сама по себе мало что объясняет, а движением агентов и машины управляет физика. Значит, описывать надо не точки, а кинематику — в каждый момент времени движение описывается продольным и поперечным ускорением. После этого траекторию можно разбить на дискретные токены, и дальше всё выглядит очень похоже на языковые модели. А работать с токенами проще, чем с шумными точками.

Авторы показывают, что на этом выигрывают и в качестве, и в вычислениях. Складывается выигрыш из трёх вещей:

  • Компактное представление. Сцена превращается в распределения вероятностей действий на каждом шаге времени — данных и вычислений нужно меньше.

  • Физическая осуществимость. Кинематические ограничения не дают сгенерировать состояние, которое неисполнимо автомобилем.

  • Проще обучение. Задача свелась к классификации токенов действия на каждом шаге вместо регрессии сырых координат точек. А классификация всегда проще регрессии.

Conditional Flow‑VAE for Safety‑Critical Traffic Scenario Generation

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 15

Работа Waabi AI о генерации сложных сценариев поведения. Авторы учат Flow Matching переводить обычные дорожные сценарии в safety‑critical.

В чём суть: обычно водители стараются ни в кого не въезжать, а это и хорошо, и плохо. Хорошо потому, что так и нужно, а плохо потому, что в датасетах для обучения автономного транспорта нужны примеры опасного вождения — ситуации, из которых надо выбираться с достоинством.

И у обычного сценария, и у safety‑critical есть своё распределение, и по мысли авторов нужно научиться переходить из одного в другое. Сначала обучают вариационный автоэнкодер, который предсказывает будущие траектории агентов и эго — самой машины.

Здесь и появляется латентное пространство: Flow Matching делают именно в нём, потому что исходное пространство слишком сложное и многомерное. Flow‑модель учится переводить латент обычной сцены в латент опасной. Чтобы получить новый опасный сценарий, берут латент существующего примера и прогоняют через обученную flow‑модель — на выходе латент уже в пространстве safety‑critical. Подход хорош тем, что траектории выходят опаснее, но не скатываются в коллизии и не теряют реалистичности.

Бонус: что ещё запомнилось

  • Было много статей об автоматической парковке: есть end‑to‑end‑решения и подходы с декомпозицией задачи на предсказание интентов агентов и дальнейшую генерацию траектории, согласованной с намерениями агентов.

  • Сразу несколько работ были посвящены предсказанию опасных траекторий. Например, манёвров перестроения с подрезанием автономного автомобиля для последующей проверки в симуляции.

  • Одна команда собрала целый мини‑город в масштабе 1: 15 для тестирования планировщика.

Чем запомнилась ICRA 2026: Reinforcement Learning, генерация сложных сценариев поведения и будущее робототехники - 16

Ну и общий настрой, когда уже сбился со счету, сколько посмотрел плакатов и докладов, но осталось ещё много интересного:

Что мы увезли с ICRA 2026

Наблюдение первое. Самое интересное среди докладов и плакатов этого года — не в архитектурах, а в представлениях. Плюккеровы координаты вместо неявного положения камеры, полиномы вместо PCA‑компонент, кинематические токены вместо точек траектории, латентное пространство вместо исходного. Сами модели при этом знакомые — диффузия, трансформер, автоэнкодер. Меняется то, что в них подают, — именно это даёт и перенос между датасетами, и экономию вычислений.

Наблюдение второе. То и дело мелькает Residual RL. И в Amazon, и в COMPASS базовую политику никто не выбрасывает: её аккуратно дотачивают небольшой добавкой. 

Наблюдение третье. Данных реального мира недостаточно, приходится их симулировать: safety‑critical‑сценарии, ракурсы в трёх метрах от записанного трека. Особенно важно симулировать редкие сценарии. 

Всё же ICRA — это конференция про то, что будет работать, а не про то, что уже работает, и относиться к ней стоит именно так. А самое полезное на ней — возможность пообщаться с авторами статей, чтобы спросить о том, чего нет в исследовании. Ради этого и стоит сюда ехать.

Подписывайтесь на наш канал об ML в автономном транспорте 404 Driver Not Found, чтобы не пропускать обзоры актуальных научных статей и новости с конференций.

Автор: egavolk

Источник