Теория возможностей заменит теорию вероятностей в ML?. байесовская вероятность.. байесовская вероятность. байесовские методы.. байесовская вероятность. байесовские методы. байесовский вывод.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика. машинное обучениe.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика. машинное обучениe. Машинное обучение.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика. машинное обучениe. Машинное обучение. научно-популярное.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика. машинное обучениe. Машинное обучение. научно-популярное. научпоп.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика. машинное обучениe. Машинное обучение. научно-популярное. научпоп. неопределенность.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика. машинное обучениe. Машинное обучение. научно-популярное. научпоп. неопределенность. оптимизация.. байесовская вероятность. байесовские методы. байесовский вывод. градиентный спуск. ИИ. искусственный интеллект. математика. машинное обучениe. Машинное обучение. научно-популярное. научпоп. неопределенность. оптимизация. теория вероятностей.

Современные генеративные модели используют мощный аппарат теории вероятностей: байесовскую оптимизацию, оценки максимального правдоподобия и тп. Но у этого подхода есть свои недостатки, например, галлюцинации, с которыми, наверняка, большинство сталкивалось при работе с ИИ.

Проведем обзор не новой, но набирающей популярность теории возможностей и ее использования в машинном обучении. Для этого проанализируем доклад профессора Наньянского технологического (Сингапур) и Уорикского университетов (Великобритания) Jeremie Houssineau.

Начнем с примера, демонстрирующего, как в космонавтике и теории рисков отличают две неопределенности: алеаторную (случайную) и эпистемическую (связанную с нехваткой знаний).

ESA and Delande, Jah, and Jones (2019)

ESA and Delande, Jah, and Jones (2019)

Поломка ракеты при запуске – это бинарное событие: даже зная все о ракете и ее траектории, мы не можем со 100%-ной уверенностью сказать, произойдет ли авария. Поэтому 2 исхода с порогом вероятности  p_0.

Справа находится пример эпистемической неопределенности: космический мусор на орбите. Мы не знаем, где находится каждый объект, его скорость или массу, поэтому не можем сказать, прилетит ли он в МКС. Так появляется третья зона (желтая).

График по центру отвечает за вероятность столкновения в зависимости от точности данных (ковариации позиции). Разные цвета обозначают разные размеры обломков. Пунктиром отмечена алеаторная неопределенность, т.е. игнорирование отсутствия информации и использование только физической случайности. Вероятность здесь низкая и убывает. Сплошной линией – эпистимическая и здесь вероятность столкновения высокая: чем меньше знаем, тем больше риск, причем по мере уточнения данных вероятность падает, что логично.

Таким образом, мы приходим к концепции: “Если нет информации, возможно все”. Немного формализуем задачу и заодно отметим различия с теорией вероятностей.

Теория вероятностей

Теория возможностей

исследуемый параметр theta in Theta

случайная величина

неопределенная переменная (uncertain variable)

основная функция f_theta(theta)

плотность распределения и нормировка через интеграл

possibility function f_theta (theta) geq 0 и нормировка через супремум: sup_{theta in Theta} f_theta(theta)=1

“среднее”

математическое ожидание через интеграл плотности

mathbb{E}^*(theta)=argsup_{theta in Theta} f_theta(theta)

дисперсия

mathbb{D}(theta)=mathbb{E}(theta - mathbb{E}(theta))^2

mathbb{V}(theta)=mathbb{E}^*(-frac{d^2}{dtheta^2} logf_theta(theta))^{-1}

Особый случай: если нет информации, считаем f_theta(theta)=1 для любого theta in Theta. Также одним из интересных свойств является независимость от параметризации (в отличие от появляющегося якобиана при замене в плотности), это объясняется очень просто: если мы ничего не знаем в одном пространстве, то ничего не знаем и в другом.

Продолжим анализ свойств функций возможностей и сравнение с аппаратом теории вероятностей.

Теория вероятностей

Теория возможностей

работа с выборками

можно сэмплировать

нельзя сэмплировать

inference

условная вероятность

f_{psi}(psi)=sup_{theta in Theta} f_{theta,psi}(theta, psi)

f_{theta}(theta mid psi)=frac{f_{theta,psi}(theta, psi)}{f(psi)}

независимость величин

независимость событий

f_{theta,psi}(theta, psi)=f_{theta}(theta) f_{psi}(psi)

факторизация

при независимости случайных величин совместная плотность представляется в виде произведения единственным образом.

при независимости разложение совместного распределения на множители не является единственно возможным.

Теорема Байеса

pi(theta mid y)=frac{L(y mid theta)pi(theta)}{pi(y)}, где:

L(y mid theta) – правдоподобие, pi(theta) – априорная вероятность, pi(theta mid y) – апостериорная вероятность и знаменатель вычисляется как:

pi(y)=begin{cases}  int L(y mid theta)pi(theta),mathrm{d}theta & text{if } pi text{ probabilistic} \ sup_{theta in Theta} L(y mid theta)pi(theta) & text{if } pi text{ possibilistic} end{cases}

Вероятностная часть была известна уже давно, а возможностная была представлена в 2026 году.

Рассмотрим еще один относительно свежий результат (2025 года). В теории вероятностей формула Донскера-Варадхана связывает математическое ожидание экспоненты случайной величины с относительной энтропией (KL-дивергенцией) и в машинном обучении используется для поиска верхних границ вероятности переобучения нейросетей. Ученые из Наньянского технологического университета представили аналог этой теоремы для теории возможностей. Главное отличие в том, что во втором случае мы получаем две формулы, это объясняется тем, что, в отличие от теории вероятностей, у нас нет жесткого ограничения на плотность распределения (интеграл = 1), поэтому приближать можно по-разному (см. график). То есть на множестве функций возможностей можно ввести частичный порядок.

частичный порядок

частичный порядок

Комментарий к графику:

CBO(g) – аналог ELBO в байесовском выводе, но для теории возможностей.

underline{text{CBO}}(g)=sup_{g in mathcal{F}(Theta)} inf_{theta in Theta} { -ell(theta) - log frac{g(theta)}{pi(theta)} }

overline{text{CBO}}(g)=inf_{g in mathcal{F}(Theta)} sup_{theta in Theta} { -ell(theta) - log frac{g(theta)}{pi(theta)} }

underline{text{CBO}} rightsquigarrow { g in mathcal{F}(Theta) : g preceq g^*_{max} }

overline{text{CBO}} rightsquigarrow { g in mathcal{F}(Theta) : g^*_{max} preceq g }

Также под теорию возможностей было адаптировано “ядро” обучения – градиентный спуск. Ниже приводится алгоритм upper CBO Optimisation (uCBOpt):

  1. textbf{Требуется:} скорости обучения {rho_t}, коэффициент затухания весов delta > 0, параметр кривизны vartheta in (0, delta], параметры момента beta_1, beta_2 in [0, 1], и начальное значение гессиана h_0 > 0.

  2. textbf{Инициализация:} eta leftarrow (веса нейросети), h leftarrow h_0, g leftarrow 0.

  3. textbf{для} t=1, 2, dots textbf{выполнять}

  4. hat{g} leftarrow hat{nabla} ell(eta) – Стохастический градиент

  5. hat{h} leftarrow hat{g} odot hat{g}

  6. g leftarrow beta_1 g + (1 - beta_1)hat{g}

  7. h leftarrow beta_2 h + (1 - beta_2)hat{h}

  8. bar{g} leftarrow g / (1 - beta_1^t)

  9. eta leftarrow eta - rho_t(bar{g} + deltaeta) / (h + delta - vartheta)

  10. textbf{конец цикла}

  11. textbf{вернуть} eta

визуализация работы алгоритма

визуализация работы алгоритма

Сравнение с Adam:

Adam

uCBOpt

η−rhofrac{bar g}{sqrt{h}+varepsilon}

η-rhofrac{bar g+deltaeta}{h+delta-vartheta}

деление на sqrt{h}

деление на h

varepsilon только стабилизирует

delta, vartheta управляют верхней оценкой кривизны

нет weight decay в формуле шага

deltaeta встроен в обновление

Встраивание weight decay напрямую в обновление позволяет лучше контролировать регуляризацию.

Также авторами была приведена сравнительная таблицу для разных датасетов.

результаты 1

результаты 1

Сравнение проводилось на данных, которые модель видела во время обучения, и на незнакомых. В качестве метрик были выбраны: Accuracy, Negative Log-Likelihood, Expected Calibration Error, False Positive Rate at 95% True Positive Rate, Area Under the Receiver Operating Characteristic curve, Area Under the Precision-Recall curve for Out-of-domain. Рассмотрим результаты для нового алгоритма подробнее.

In-domain.

Доля правильных ответов (точность) на “знакомой” выборке выше относительно остальных. Низкое отрицательное лог. правдоподобие означает, что модель не просто угадывает класс, но и выдает высокую вероятность для правильного класса и низкую для неправильных. Ожидаемая ошибка калибровки измеряет разницу между уверенностью модели и её реальной точностью, низкий результат у uCBOpt-adapt (алгоритм выше с адаптацией гиперпараметров в процессе обучения).

Метрики говорит о том, что когда информация есть, теория возможностей работает не хуже теории вероятностей: uCBOpt-adapt показывает лучшие результаты по ключевым метрикам

Out-of-domain.

FPR@95 для детекции аномалий: показывает, как часто модель ошибочно принимает “незнакомый” объект за “знакомый”, когда мы настроены на то, чтобы поймать 95% всех аномалий, один из новых алгоритмов оказался в топе лучших. AUPR-Out, альтернатива AUROC, которая лучше работает в условиях сильного дисбаланса классов. Она показывает, насколько хорошо модель находит “чужие” объекты, не ошибаясь при этом на “своих”.

Также авторами для сравнения были использованы и другие датасеты: CIFAR-10, CIFAR-100. Таблица приводится ниже, для краткости, без анализа.

результаты 2

результаты 2

Заключение

Таким образом, теория возможностей предлагает альтернативный подход к описанию неопределенности. Повторяя некоторые аспекты теории вероятностей (независимость, теорема Байеса), она меняет общее представление об информации. Теория вероятностей в машинном обучении является фундаментом, имеет удобный аппарат для описания большинства процессов, поэтому неудивительно, что для теория возможностей доказываются аналоги теорем. Появление приведенного алгоритма и построение новой теории является примером непрерывного развития науки. Так машинное обучение помогает двигать вперед математику, а не только отбирает ее хлеб.

Автор: Ir1na

Источник