Быстрое обучение, экономия ресурсов и другие преимущества сетей эхо-состояний. ESN.. ESN. Graph memory.. ESN. Graph memory. reservoir.. ESN. Graph memory. reservoir. svd.. ESN. Graph memory. reservoir. svd. временные ряды.. ESN. Graph memory. reservoir. svd. временные ряды. графовая память.. ESN. Graph memory. reservoir. svd. временные ряды. графовая память. нейрополевые модели.. ESN. Graph memory. reservoir. svd. временные ряды. графовая память. нейрополевые модели. резервуарные вычисления.. ESN. Graph memory. reservoir. svd. временные ряды. графовая память. нейрополевые модели. резервуарные вычисления. рекуррентные нейросети.. ESN. Graph memory. reservoir. svd. временные ряды. графовая память. нейрополевые модели. резервуарные вычисления. рекуррентные нейросети. сети эхо-состояний.

Существует класс рекуррентных нейросетей, в котором обучается только линейный выходной слой, а внутренняя структура (резервуар) остаётся фиксированной. Отсюда появилось название более общего подхода — «резервуарные вычисления».

Такая архитектура делает нейросети крайне быстрыми и энергоэффективными, но сложными в настройке. Поэтому они пока не получили широкого распространения и долгое время оставались в тени более универсальных архитектур.

Сотрудник отдела перспективных исследований компании «Криптонит» Илья Андросов провёл глубокий сравнительный анализ архитектур и методов обучения сетей эхо-состояний (Echo State Networks, ESNs). Автор выполнил обзор ряда известных ESNs и для некоторых из них предложил модификации, существенно улучшившие их основные характеристики.

Почему ESNs так ценны?

В отличие от сетей других распространённых архитектур (LSTM, трансформеры), ESNs обладают рядом преимуществ:

  1. Они не требуют десятков тысяч эпох обучения. Выходной слой обучается за один проход (offline) или пошагово (online) за несколько десятков или сотен шагов, что можно использовать для обучения в реальном времени.

  2. Так как резервуар не обучается, то можно для нескольких задач использовать один резервуар, отличие будет только в дешёвом выходном слое.

  3. ESNs более «прозрачны». В них можно анализировать, какие части резервуара отвечают за какие частоты сигнала, что критично в медицине и финансах для объяснения прогноза регуляторам.

  4. Резервуар куда проще реализовать физически (например, на FPGA), чем классическую нейросеть, так как резервуар не обучается.

  5. ESNs устойчивы к шуму. Фиксированный резервуар действует как нелинейный фильтр, сглаживая выбросы.

Рис. 1. Схематическое изображение ESN, иллюстрирующее входной слой с сигналом p(t), резервуар с состоянием x(t) и выходной слой y(t), соединённые через входные веса W_in и W_out

Рис. 1. Схематическое изображение ESN, иллюстрирующее входной слой с сигналом p(t), резервуар с состоянием x(t) и выходной слой y(t), соединённые через входные веса W_in и W_out

Энергоэффективность ESNs позволяет внедрять их в маломощные устройства (датчики, периферийные контроллеры) для прогнозирования отказов оборудования, мониторинга процессов в реальном времени, реализуя методику edge-computing.

Графовая память

Автор вводит понятие графовой памяти (Graph Memory) для сетей эхо-состояний и формулирует её свойства. В ESN она обеспечивает способность запоминать прошлые сигналы за счёт задержек распространения сигнала по графу. Разная длина путей заставляет нейроны воспринимать сигнал в разные моменты времени. Это решает проблему отсутствия пространственно-временной привязки в классических ESNs, добавляя в систему естественные временные метки, «вшитые» в структуру связей.

Концепцию графовой памяти иллюстрирует рис. 2., показывающий зависимость задержек распространения сигнала от топологии графа.

Рис. 2. Ориентированный граф связей ESN, демонстрирующий графовую память. В нём вершины – это нейроны, а рёбра – ненулевые веса в матрице связей. Вершины помечены кратчайшими расстояниями от выбранной начальной вершины с индексом «0».

Рис. 2. Ориентированный граф связей ESN, демонстрирующий графовую память. В нём вершины – это нейроны, а рёбра – ненулевые веса в матрице связей. Вершины помечены кратчайшими расстояниями от выбранной начальной вершины с индексом «0».

Графовая память улучшает способность сети разделять похожие входные сигналы, поступающие в разное время, без потери нелинейной динамики. С графовой памятью можно эффективнее моделировать распространение волн, химические реакции, нейродинамику и другие сложные процессы, сохраняя низкие вычислительные затраты. 

Также графовая память не требует дополнительной настройки весов и возникает из самой топологии. Используя графовую память, разработчик может получить более точный прогноз, затрачивая меньше ресурсов на симуляцию.

Главный результат

Автор сравнил разные методы обучения, как оффлайновые (гребневая регрессия, QR-разложение, SVD, усечённое SVD), так и онлайновые (RLS-FORCE и LMS-FORCE). Дополнительно в статье сравниваются разные архитектуры резервуаров: классические ESNs, их версии с непрерывным временем (ESNs DE), модели с задержками, нейрополевые модели Амари и Нуньеса, системы «реакция-диффузия» и один нейрон с запаздывающей обратной связью.

В задаче прогнозирования хаотического временного ряда, описываемого уравнением, Макки–Гласса лучшей оказалась архитектура ESN с кососимметрической матрицей весов (ESN skew) в сочетании с алгоритмом RLS-FORCE. Она дала минимальную ошибку (NRMSE ~0.066 на 400 шагов). Почти так же точно, но с дополнительными бонусами (масштабируемость, наглядность, встроенная графовая память) выступила модель Neural Field (NF) skew.

Выводы

Выполненная работа даёт чёткие сравнительные характеристики и содержит экспериментальные результаты, что экономит время и ресурсы других исследователей на выбор архитектур и подбор гиперпараметров. 

Проведённый анализ показывает, что наиболее перспективными ESNs являются конструкции, которые порождают несинхронизированные колебания и включают графовую память. В частности, архитектура нейронного поля (skew) продемонстрировала конкурентоспособную производительность, предлагая при этом ряд дополнительных преимуществ. 

Главное преимущество резервуарных вычислений состоит в том, что резервуары не нужно обучать. Процесс обучения затрагивает только выходной слой. Он выполняется на порядки быстрее и дешевле, чем при использовании нейросетей классической архитектуры. 

Способность улавливать сложную, изменяющуюся во времени динамику на которую влияет большое число  не измеряемых непосредственно факторов, в том числе с элементами хаотического поведения, используется для раннего обнаружения рыночных аномалий, в краткосрочном прогнозировании нагрузки на электросети, для оптимизации транспортной логистики, прогнозирования оставшегося ресурса оборудования и предотвращения аварий, в раннем предсказании аритмий и эпилептических приступов, прогнозировании эпидемий, обнаружении DDoS-атак и множестве других сценариев, сводящихся к анализу изменчивых временных рядов.

Подробнее читайте в научной статье Ильи Андросова «Сравнительный анализ методов обучения и архитектур Echo State Networks» (PDF на русском языке).

Автор: AI-SHA

Источник