Может ли нейросеть выучить физику, просто наблюдая за миром?. adept.. adept. cv.. adept. cv. gnn.. adept. cv. gnn. slot attention.. adept. cv. gnn. slot attention. world model.. adept. cv. gnn. slot attention. world model. Алгоритмы.. adept. cv. gnn. slot attention. world model. Алгоритмы. Блог компании BotHub.. adept. cv. gnn. slot attention. world model. Алгоритмы. Блог компании BotHub. искусственный интеллект.. adept. cv. gnn. slot attention. world model. Алгоритмы. Блог компании BotHub. искусственный интеллект. Машинное обучение.. adept. cv. gnn. slot attention. world model. Алгоритмы. Блог компании BotHub. искусственный интеллект. Машинное обучение. машинное+обучение.. adept. cv. gnn. slot attention. world model. Алгоритмы. Блог компании BotHub. искусственный интеллект. Машинное обучение. машинное+обучение. Модели мира.. adept. cv. gnn. slot attention. world model. Алгоритмы. Блог компании BotHub. искусственный интеллект. Машинное обучение. машинное+обучение. Модели мира. модель.. adept. cv. gnn. slot attention. world model. Алгоритмы. Блог компании BotHub. искусственный интеллект. Машинное обучение. машинное+обучение. Модели мира. модель. научно-популярное.

О когнитивных способностях человека есть много исследований. Одно из самых известных это исследование за авторством Элизабет Спелке. Оно о том как у человека появляется самое первое, базовое понимание мира и физических законов. Её работа ставит под сомнение традиционные взгляды на то, что всё человеческое знание приобретается исключительно через опыт, и выдвигает гипотезу о наличии врожденных когнитивных систем.

На основе когнитивных экспериментов Спелке доказывает, что фундаментальные представления о мире начинают проявляться в самых ранних месяцах жизни и являются частью врожденного аппарата человека.

Итак, если Спелке показывает, что человеку для этого нужно врожденное ядро знаний, то как с этим справляются ИИ? 
Способна ли нейросеть самостоятельно выделить объекты из огромного числа пикселей, построить внутренний физический движок и предсказать, куда упадет брошенный мяч, не зная формулы F=ma

Рассмотрим как современные ИИ-системы пытаются понять физический мир через наблюдение. Где у них это действительно получается, и почему хорошая визуальная экстраполяция всё еще не означает истинного понимания природы вещей.


Как увидеть физику в пикселях

Спелке представила 6 основных тезисов-предположений, которые звучат так: 

  1. Знание возникает на самых ранних этапах развития (уже к 3 месяцам)

  2. Начальное знание является доменно-специфичным (Принципы, работающие в одной области, не применяются в другой)

  3. Начальное знание охватывает самые надежные и фундаментальные ограничения среды (Дети с рождения понимают непрерывность объекта, что он не может исчезнуть в одной точке и появиться в другой, не пройдя путь между ними. При этом до определенного возраста они могут не учитывать гравитацию или инерцию)

  4. Начальное знание является врожденным (Это знание не может быть результатом обучения, так как оно само является условием для возможности обучения)
    На мой взгляд это самый интересный тезис. Спелке обосновывает его тем, что опыт и обучение не могут быть причиной возникновения первичных знаний, поскольку ребенок не смог бы выучить правила поведения объектов/людей, если бы изначально не умел выделять их из окружающего потока информации как отдельных сущностей. 

  5. Начальное знание не исчезают с возрастом, а составляют ядро зрелого разума

  6. Начальное знание является задачно-специфичным (Младенцы по-разному оценивают движение объекта, когда просто смотрят на него, и когда пытаются схватить его руками)

В текущий момент в сфере искусственного интеллекта происходят споры. Долгое время физику в компьютеры пытались зашить через математические уравнения, правила, законы и тд. В общем через что-то строгое. (привет экспертным системам!)

Но когда у вас есть ИИ, который может учится, а вместе с ним развиваются современные видеомодели и World Models, то зачем хардкодить наш мир и всю его бескрайнюю физику? Может нейросеть сама выучит законы механики, гравитации и кинематики, просто обрабатывая данные? Люди ведь именно так и открывали для себя науку, путем анализа, гипотез и рассуждений.

Ну давайте рассуждать.

Для нас с вами падающий мяч это очевидный предмет с четкими границами, массой и траекторией. А для ИИ видео, на котором показан этот процесс, лишь 4D-тензор.

Чтобы модель могла строить физические гипотезы как люди, ей надо пройти те же этапы, что и люди. Надо начать с примитивного и простого — то, что умеют даже младенца: выделять из зрительного шума отдельные сущности. Для этого исследователи создали несколько алгоритмических подходов.

1. Slot Attention

Архитектура Slot Attention (разработанная в Google Brain) решает задачу выделения объектов без единого подсказанного человеком слова

Работает это вот как:
Архитектура функционирует по принципу конкуренции за внимание между абстрактными слотами (в работе слотами называют набор зависимых от задачи абстрактных представлений. По сути это векторы, которые служат абстрактными представлениями объектов).

Слоты выступают как «Объектные файлы» (object files в оригинале). Авторы работы напрямую ссылаются на психологическую концепцию объектных файлов, которая созвучна тезисам Элизабет Спилке о врожденных механизмах восприятия.

Объект в данном подходе — это результат объединения низкоуровневых признаков (пикселей или векторов) в единую структуру на основе общих закономерностей.

Всё начинается с процесса инициализации. Создается K слотов. В начале работы их значения инициализируются случайно из общего нормального распределения, но в дальнейшем они берутся из обучаемого гауссовского распределения.

Важной особенностью является то, что слоты не привязаны к конкретным классам объектов заранее(по типу «собака» или «стул»). Каждый слот может стать «файлом» для любого объекта.

Далее наступает процесс разделения элементов сцены. Он происходит на этапе итеративной конкуренции. Входные карты признаков и слоты проецируются в пространства ключей k, запросов q и значений v.

В отличие от классических механизмов внимания, где нормализация через операцию Softmax выполняется вдоль элементов входа, в Slot Attention она производится вдоль слотов. Такая инверсия заставляет слоты конкурировать за каждый пиксель изображения. То есть, если один слот забирает максимальный вес внимания к конкретной области, доступность этой области для остальных слотов пропорционально снижается. 

Следующий этап – это сбор и обобщение информации с последующим обновлением состояний. Для каждого слота вычисляется взвешенное среднее векторов значений v.

Затем полученная агрегированная информация используется для динамической корректировки представлений. Корректировка векторов слотов выполняется с помощью рекуррентного блока GRU и последующего многослойного перцептрона. Весь этот процесс повторяется циклически в течение нескольких итераций (обычно 3). За время этих итераций слоты постепенно, без явного внешнего управления, распределяют между собой элементы сцены.

Источник. Модуль Slot Attention и примеры его применения для (b) неразмеченного обнаружения объектов и (c) размеченного прогнозирования множеств с метками целевых объектов y_i

Источник. Модуль Slot Attention и примеры его применения для (b) неразмеченного обнаружения объектов и (c) размеченного прогнозирования множеств с метками целевых объектов y_i

2. SCALOR 

Рассмотренный выше Slot Attention хорош скорее для простых сцен. А теперь поговорим про алгоритм SCALOR. Его архитектура представляет собой модель без учителя. Используется для анализа видео и сцен с большим количеством движущихся элементов (несколько десятков). В основе работы лежит разделение каждого кадра на изолированные динамические объекты (foreground) и фоновую среду (background). Модель обрабатывает эти компоненты параллельно и это позволяет ей масштабироваться на сцены с десятками элементов без потери производительности.

Процесс обработки видеопотока начинается с модуля отслеживания уже известных объектов. Для каждого, найденного на предыдущих кадрах, элемента запускается параллельный трекер. Он работает на базе рекуррентной нейросети (Object-Tracker RNN). Этот модуль использует механизм локального внимания. Он фокусируется на области вокруг предыдущего положения объекта и затем предсказывает его новую позицию, масштаб и вероятность того, что объект остался в кадре.

Параллельно с отслеживанием старых объектов происходит поиск новых. Модель разбивает кадр на сетку ячеек и выдвигает гипотезы о наличии новых элементов в каждой из них. Для исключения повторных обнаружений объектов, которые уже были найдены, применяется механизм отклонения. Если предложенный гипотетический объект перекрывает область, где уже работает трекер, эта гипотеза отбрасывается.

Так же есть отдельный модуль. Он отвечает за моделирование динамического фона. Изображение кадра вместе с информацией о найденных объектах передается в фоновый рекуррентный блок. Он фиксирует глобальные изменения сцены, обычно это сдвиги освещения, движение облаков, колыхание листвы и др. Этот модуль не дает фоновому шуму мешать отслеживанию отдельных предметов.

На финальном этапе происходит отрисовка кадра. Модель извлекает из скрытых векторов объектов параметры их внешности, пространственного положения, маски и глубины. Затем накладывает объекты поверх сгенерированного динамического фона с учетом их взаимного перекрытия и глубины. В конце SCALOR восстанавливает итоговое изображение и обновляет внутреннее состояние для обработки следующего кадра.

Источник. Процедура вывода (inference) SCALOR: (A) Генерация предложений (Proposal), (B) Принятие-Отклонение (Accept-Reject), (C) Распространение / Трекинг (Propagation), (D) Фоновый модуль и процесс рендеринга (Background Module and Rendering Process).

Источник. Процедура вывода (inference) SCALOR: (A) Генерация предложений (Proposal), (B) Принятие-Отклонение (Accept-Reject), (C) Распространение / Трекинг (Propagation), (D) Фоновый модуль и процесс рендеринга (Background Module and Rendering Process).

Для наглядности реальные результаты работы SCALOR на датасете Grand Central Station.

Источник

3. Interaction Networks (GNN)

Так, ладно, мы поняли как происходит выделение объектов. Но ведь это только полдела. Чтобы возникла физика, нужно понять, как эти объекты влияют друг на друга. С этим отлично справляются графовые нейросети (GNN) и, в частности, архитектура Interaction Networks от DeepMind.

Архитектура Interaction Network построена на разделении физического мира (или любой сложной системы) на два ключевых элемента: 

  1. Объекты (узлы графа). В них сохраняется динамические состояния (положение, скорость) и статические характеристики (масса, форма, размер) объектов.

  2. Отношения между объектами (ребра графа). Они описывают, например, наличие пружины, гравитационное притяжение или потенциальную возможность столкновения. В общем всё в этом духе.

Работа сети на каждом шаге симуляции строится по строгому трехэтапному алгоритму.

Первый этап называется маршалингом (Marshalling). На нем модель подготавливает данные для каждого индивидуального взаимодействия. Для каждой пары «объект-отправитель» и «объект-получатель» формируется единый вектор. Он объединяет параметры обоих предметов и характеристики связывающего их отношения. Благодаря этому сеть может изолированно рассмотреть воздействие одной сущности на другую.

Второй этап – это расчет эффектов взаимодействий. Подготовленные векторы поступают в реляционную модель – многослойный перцептрон. Он оценивает результат каждого отдельного контакта и затем генерирует вектор «эффекта». На этом этапе сеть фактически вычисляет локальные физические силы или импульсы, возникающие между телами.

Третий этап — это агрегация и обновление состояний объектов. На этом этапе все локальные эффекты, направленные на один и тот же объект-получатель, суммируются в единый вектор суммарного воздействия. К нему добавляются внешние факторы (например, глобальная гравитация) и текущее состояние самого предмета. После этого объектная модель обрабатывает эти данные и предсказывает динамику предмета на следующем шаге во времени (например, его новую скорость или траекторию движения).

Источник. Схема сети взаимодействий (Interaction Network).

Источник. Схема сети взаимодействий (Interaction Network). 

Итак, с помощью алгоритмов вроде Slot Attention, SCALOR и Interaction Networks нейросеть справилась с двумя тезисами Элизабет Спелке: она научилась выделять сущности из хаоса и строить между ними базовые связи. Но чтобы понять физику этого ещё мало. Физика раскрывается именно в динамике, а значит, алгоритму нужно научиться делать главное –предсказывать будущее.


В этой главе разберем модели мира (World Models). Узнаем в чём принципиальная разница между умением генерировать реалистичную картинку и реальным пониманием причинно-следственных связей, а так же поговорим о том как исследователи тестируют ИИ с помощью когнитивных методик, созданных для младенцев, и умеет ли нейросеть «удивляться» физически невозможным событиям.

От наблюдения к предсказанию

Модели мира (World Models)

Для того самого предсказания будущего разработчики создают модели мира (World Models). Главная идея этих моделей состоит в том, что они переводят сцену в абстрактное скрытое пространство (известное как latent space). Это очень сильно экономит вычислительные ресурсы. Экономия возникает из-за того, что не нужно генерировать каждый отдельный пиксель кадра, что очевидно очень затратно. 

Внутри этого скрытого пространства модель пытается запустить автономную физическую симуляцию, то есть отмотать время вперед и понять, как изменится состояние среды под воздействием различных сил и действий агента.

Это похоже на то как работает человеческий мозг. Хороший пример: у бейсбольного бэттера есть миллисекунды, чтобы решить, как он должен ударить битой. Это короче времени, которое требуется для того, чтобы сигналы от наших глаз достигли нашего мозга. Причина, по которой мы можем ударить по мячу, летящему со скоростью 100 миль в час, заключается в нашей способности инстинктивно предсказывать, когда и куда пойдет мяч. Для профессиональных игроков все это происходит подсознательно. Их мышцы рефлекторно бьют битой в нужное время и в нужном месте в соответствии с прогнозами их внутренних моделей.

Так как же устроены модели мира? Их архитектура строится на фундаментальном разделении обязанностей между тремя процессами:

  1. Восприятие (Сжатие реальности). Модель переводит сырой визуальный поток (пиксели) в сжатый вектор скрытого состояния. Вместе с этим она отбрасывает визуальный шум и оставляет только физическую суть.

  2. Память и Прогнозирование (Физический движок ). Рекуррентный блок модели получает сжатое описание текущего кадра и действие агента, после чего предсказывает, каким станет скрытое состояние среды в следующий момент времени.
    Здесь очень важен вероятностный подход. Реальный мир всегда содержит случайность. Например брошенный кубик может упасть любой гранью, а колесо машины – подскочить на кочке. Полноценная модель мира должна предсказывать не один жесткий кадр будущего, а распределение вероятностей. По сути, она должна формировать некий веер возможных сценариев по типу: «С вероятностью 80% мяч отскочит от стены вправо, но с вероятностью 20% из-за шероховатости заденет угол».

  3. Принятие решений (Контроллер). Поскольку вся сложная работа по разбору пикселей и просчету будущих вероятностей уже сделана первыми двумя блоками, самому управляющему алгоритму остается лишь выбрать действие на основе сжатого «настоящего» и спрогнозированного «будущего».

Теперь хочу рассказать об эксперименте Дэвид Ха и Юрген Шмидхубер, они продемонстрировали концепцию обучения агента внутри воображаемой среды.

Процесс состоял из двух этапов:

  1. Сначала авторы запустили агента в реальный симулятор, чтобы собрать 10 000 игровых сессий . На этих данных блоки 1 и 2 выучили визуальный язык среды и её внутреннюю физическую динамику.Затем реальный симулятор отключили

  2. В эксперименте с симулятором VizDoom (Take Cover, где нужно уворачиваться от фаерболов) контроллер агента обучали исключительно внутри «сна», генерируемой моделью 2. Модель мира предсказывала сжатый следующий кадр, агент совершал действие, а модель обновляла сгенерированное состояние.

Результаты

Когда агента, обученного внутри сна модели мира, выпустили в реальный симулятор VizDoom, он справился с задачей: набрал вплоть до 1100 шагов жизнеспособности при норме в 750 шагов.

Параллельно в задаче автосимулятора CarRacing-v0 контроллер, показал результат 906 +- 21 очков за 100 попыток (при норме в 900 очков).

Думаю, можно сказать: эксперимент доказал, что да, агенту всё ещё необходим какой-то контакт с реальностью для сбора данных, но модель мира способна настолько точно выучить физику среды, что агент может эффективно формировать навыки внутри ее воображаемого пространства.

Так, с моделями мира разобрались. Теперь нужно разобраться реально ли успех World Models означает, что ИИ постиг законы природы. Или это лишь иллюзия? 

Визуальная экстраполяция vs трушная физика

В своей работе «Initial Knowledge: Six Suggestions» Элизабет Спелке (я писал про эту работу в самом начале) выдвигает концепцию «начального знания» – врожденного ядра, с помощью которого мозг младенца с первых месяцев жизни организует хаотичный визуальный поток в понятный мир.

Для доказательства того, что у трехмесячного ребенка уже есть эти представления когнитивисты используют методику «Нарушения ожиданий» (Violation of Expectation, VoE). Эксперимент устроен просто: если происходящее на экране логично, ребенок быстро теряет интерес. Но если перед его глазами разворачивается физически «невозможное» событие, младенец замирает и смотрит на сцену существенно дольше. Его мозг фиксирует ошибку предсказания (сюрприз).

Для оценки понимания физики нейросетями создали специальные тестовые среды. При этом эти среды сильно отличаются между собой.

Первые используют бенчмарки на «нарушение ожиданий» (Violation of Expectation, VoE), такие как ADEPT. Моделям демонстрируют видеоряд с физически невозможными событиями (тяжёлый шар взлетает вверх вопреки гравитации или проваливается сквозь пол) и измеряют уровень их «удивления» через величину ошибки предсказания (loss / perplexity) в скрытом пространстве.

В других существуют бенчмарки на физическое планирование и решение задач, такие как PHYRE. В них модель решает головоломки: ей нужно самой разместить на сцене один или два шара так, чтобы после запуска физического симулятора выполнялась заданная цель.

Теперь чуть подробнее поговорим про эти среды и подходы.

ADEPT

В исследовании ученых из MIT и Гарварда «Modeling Expectation Violation in Intuitive Physics with Coarse Probabilistic Object Representations» была представлена модель ADEPT (Approximate Derenderer, Extended Physics, and Tracking), соавтором которой является Элизабет Спелке. Авторы создали набор тестовых 3D-сцен, которые воспроизводят эксперименты из детской психологии, проверяя фундаментальные физические ограничения среды такие как:

  • Постоянство объекта. Пример: предмет заезжает за ширму. В возможном сценарии он выезжает с другой стороны. В невозможном ширма опускается, а предмета за ней нет.

  • Непроницаемость и Солидность. Пример: одно твердое тело пытается пройти сквозь другое.

  • Непрерывность траектории. Пример: объект исчезает в одной точке и мгновенно появляется в другой, пропуская промежуточный путь.

Обычные авторегрессионные видеомодели (которые просто генерируют видео пиксель за пикселем) на таких тестах провалились. Для них исчезновение шара за ширмой это нормально.
Настоящее удивление показали только модели с явными объектно-ориентированными репрезентациями. Все благодаря тому, что в модели ADEPT специальный блок сначала находит объект на кадре и превращает его в объёмную 3D-модель. Затем встроенный физический движок продолжать следить за этим предметом, даже когда тот заезжает за ширму. Так как система точно знает, что шар всё ещё там, его внезапное исчезновение вызывает резкий сбой в прогнозе. Что и фиксируется как «удивление».

PHYRE и IntPhys

Другие бенчмарки проверяют не просто пассивный «испуг» нейросети, а её способность использовать эти физические принципы для действий:

  • IntPhys (Intuitive Physics Benchmark). Моделям показывают тысячи видеороликов и просят оценить вероятность происходящего. Архитектуры с объектным представлением четко разделяют видео. Физически реальные события получают вероятность 0.68-0.76, а «магические» 0.51-0.58 (при случайном угадывании 0.50) . Ссылка на статью об этом.

  • PHYRE (от Meta AI / FAIR). Заставляет ИИ решать физические головоломки. Модели дают двухмерную арену с шариком/шариками и цель. 

    Источник. Три примера задач PHYRE (слева) и один пример решения (справа). Чёрные объекты являются статическими; объекты любого другого цвета являются динамическими и подвержены действию гравитации. В задачах описывается конечное целевое состояние, которое может быть достигнуто путём размещения дополнительных объектов в сцене и запуска симулятора. Задача, показанная на крайней левой картинке, для своего решения требует размещения двух шаров, тогда как остальные могут быть решены с помощью одного шара. На крайней правой панели показано решение (красный шар) и динамика этого решения.

    Источник. Три примера задач PHYRE (слева) и один пример решения (справа). Чёрные объекты являются статическими; объекты любого другого цвета являются динамическими и подвержены действию гравитации. В задачах описывается конечное целевое состояние, которое может быть достигнуто путём размещения дополнительных объектов в сцене и запуска симулятора. Задача, показанная на крайней левой картинке, для своего решения требует размещения двух шаров, тогда как остальные могут быть решены с помощью одного шара. На крайней правой панели показано решение (красный шар) и динамика этого решения.

    Чтобы поразить цель, модель должна добавить на сцену всего один новый предмет, запустив цепную реакциюСсылка на статью об этом.

Источник. Главный график с результатами. На нём показан процент решённых задач (Success percentage) в зависимости от количества попыток (до 100 попыток) для пяти протестированных моделей на двух уровнях сложности (PHYRE-B и PHYRE-2B) как в режиме within-template, так и в cross-template.

Источник. Главный график с результатами. На нём показан процент решённых задач (Success percentage) в зависимости от количества попыток (до 100 попыток) для пяти протестированных моделей на двух уровнях сложности (PHYRE-B и PHYRE-2B) как в режиме within-template, так и в cross-template.

В отличие от пассивных тестов, решение практических физических задач дается современным нейросетям с трудом. Случайный перебор или наивное запоминание показывают очень низкие результаты.

Лучшие обученные агенты, после ранжирования вероятных действий по входной картинке сцены, находят решение в среднем за 10 попыток в знакомых типах задач. Но при переносе на новые типы задач их эффективность падает. Более того, последующие исследования FAIR показывают, что явные объектно-ориентированные структуры и физические графы не являются единственной панацеей. Модели, прогнозирующие динамику на уровне глубоких визуальных признаков или пикселей (pixel/feature-based), зачастую выбирают удачные действия не хуже объектных систем.


Ответ на главный вопрос

Ну так в итоге: может ли нейросеть выучить физику, просто наблюдая за миром?

Результаты современных исследований дают нам четкий ответ. Кстати, подтверждающий правоту Элизабет Спелке в ее исследовании:

Попытка заставить алгоритм выучить законы физики только из сквозного видеопотока без структуры не даёт никакого результата. Модель без априорных рамок обречена совершать глупые ошибки. И скорее всего никогда не поймёт законы физики.

Но так же нет необходимости прописывать уравнения или формулы вручную. Чтобы извлечь смысл из хаотичного потока восприятия, нейросети необходимо грамотно спроектированное ядро. В современном ИИ оно задается через индуктивные ограничения самой архитектуры.

Настоящее понимание физики возникает когда гибкость нейросети, позволяет учиться на наблюдениях. Ровно так, как это делает человек.

Автор: Magnificus

Источник