- BrainTools - https://www.braintools.ru -

Теория возможностей заменит теорию вероятностей в ML?

Современные генеративные модели используют мощный аппарат теории вероятностей: байесовскую оптимизацию, оценки максимального правдоподобия и тп. Но у этого подхода есть свои недостатки, например, галлюцинации, с которыми, наверняка, большинство сталкивалось при работе с ИИ.

Проведем обзор не новой, но набирающей популярность теории возможностей и ее использования в машинном обучении [1]. Для этого проанализируем доклад профессора Наньянского технологического (Сингапур) и Уорикского университетов (Великобритания) Jeremie Houssineau.

Начнем с примера, демонстрирующего, как в космонавтике и теории рисков отличают две неопределенности: алеаторную (случайную) и эпистемическую (связанную с нехваткой знаний).

ESA and Delande, Jah, and Jones (2019)

ESA and Delande, Jah, and Jones (2019)

Поломка ракеты при запуске – это бинарное событие: даже зная все о ракете и ее траектории, мы не можем со 100%-ной уверенностью сказать, произойдет ли авария. Поэтому 2 исхода с порогом вероятности  p_0.

Справа находится пример эпистемической неопределенности: космический мусор на орбите. Мы не знаем, где находится каждый объект, его скорость или массу, поэтому не можем сказать, прилетит ли он в МКС. Так появляется третья зона (желтая).

График по центру отвечает за вероятность столкновения в зависимости от точности данных (ковариации позиции). Разные цвета обозначают разные размеры обломков. Пунктиром отмечена алеаторная неопределенность, т.е. игнорирование отсутствия информации и использование только физической случайности [2]. Вероятность здесь низкая и убывает. Сплошной линией – эпистимическая и здесь вероятность столкновения высокая: чем меньше знаем, тем больше риск, причем по мере уточнения данных вероятность падает, что логично [3].

Таким образом, мы приходим к концепции: “Если нет информации, возможно все”. Немного формализуем задачу и заодно отметим различия с теорией вероятностей.

Теория вероятностей

Теория возможностей

исследуемый параметр theta in Theta

случайная величина

неопределенная переменная (uncertain variable)

основная функция f_theta(theta)

плотность распределения и нормировка через интеграл

possibility function f_theta (theta) geq 0 и нормировка через супремум: sup_{theta in Theta} f_theta(theta)=1

“среднее”

математическое ожидание через интеграл плотности

mathbb{E}^*(theta)=argsup_{theta in Theta} f_theta(theta)

дисперсия

mathbb{D}(theta)=mathbb{E}(theta - mathbb{E}(theta))^2

mathbb{V}(theta)=mathbb{E}^*(-frac{d^2}{dtheta^2} logf_theta(theta))^{-1}

Особый случай: если нет информации, считаем f_theta(theta)=1 для любого theta in Theta. Также одним из интересных свойств является независимость от параметризации (в отличие от появляющегося якобиана при замене в плотности), это объясняется очень просто: если мы ничего не знаем в одном пространстве, то ничего не знаем и в другом.

Продолжим анализ свойств функций возможностей и сравнение с аппаратом теории вероятностей.

Теория вероятностей

Теория возможностей

работа с выборками

можно сэмплировать

нельзя сэмплировать

inference

условная вероятность

f_{psi}(psi)=sup_{theta in Theta} f_{theta,psi}(theta, psi)

f_{theta}(theta mid psi)=frac{f_{theta,psi}(theta, psi)}{f(psi)}

независимость величин

независимость событий

f_{theta,psi}(theta, psi)=f_{theta}(theta) f_{psi}(psi)

факторизация

при независимости случайных величин совместная плотность представляется в виде произведения единственным образом.

при независимости разложение совместного распределения на множители не является единственно возможным.

Теорема Байеса

pi(theta mid y)=frac{L(y mid theta)pi(theta)}{pi(y)}, где:

L(y mid theta) – правдоподобие, pi(theta) – априорная вероятность, pi(theta mid y) – апостериорная вероятность и знаменатель вычисляется как:

pi(y)=begin{cases}  int L(y mid theta)pi(theta),mathrm{d}theta & text{if } pi text{ probabilistic} \ sup_{theta in Theta} L(y mid theta)pi(theta) & text{if } pi text{ possibilistic} end{cases}

Вероятностная часть была известна уже давно, а возможностная была представлена [4] в 2026 году.

Рассмотрим еще один относительно свежий результат (2025 года). В теории вероятностей формула Донскера-Варадхана связывает математическое ожидание экспоненты случайной величины с относительной энтропией (KL-дивергенцией) и в машинном обучении используется для поиска верхних границ вероятности переобучения нейросетей. Ученые из Наньянского технологического университета представили [5] аналог этой теоремы для теории возможностей. Главное отличие в том, что во втором случае мы получаем две формулы, это объясняется тем, что, в отличие от теории вероятностей, у нас нет жесткого ограничения на плотность распределения (интеграл = 1), поэтому приближать можно по-разному (см. график). То есть на множестве функций возможностей можно ввести частичный порядок.

частичный порядок

частичный порядок

Комментарий к графику:

CBO(g) – аналог ELBO в байесовском выводе, но для теории возможностей.

underline{text{CBO}}(g)=sup_{g in mathcal{F}(Theta)} inf_{theta in Theta} { -ell(theta) - log frac{g(theta)}{pi(theta)} }

overline{text{CBO}}(g)=inf_{g in mathcal{F}(Theta)} sup_{theta in Theta} { -ell(theta) - log frac{g(theta)}{pi(theta)} }

underline{text{CBO}} rightsquigarrow { g in mathcal{F}(Theta) : g preceq g^*_{max} }

overline{text{CBO}} rightsquigarrow { g in mathcal{F}(Theta) : g^*_{max} preceq g }

Также под теорию возможностей было адаптировано “ядро” обучения – градиентный спуск. Ниже приводится алгоритм upper CBO Optimisation (uCBOpt):

  1. textbf{Требуется:} скорости обучения {rho_t}, коэффициент затухания весов delta > 0, параметр кривизны vartheta in (0, delta], параметры момента beta_1, beta_2 in [0, 1], и начальное значение гессиана h_0 > 0.

  2. textbf{Инициализация:} eta leftarrow (веса нейросети), h leftarrow h_0, g leftarrow 0.

  3. textbf{для} t=1, 2, dots textbf{выполнять}

  4. hat{g} leftarrow hat{nabla} ell(eta) – Стохастический градиент

  5. hat{h} leftarrow hat{g} odot hat{g}

  6. g leftarrow beta_1 g + (1 - beta_1)hat{g}

  7. h leftarrow beta_2 h + (1 - beta_2)hat{h}

  8. bar{g} leftarrow g / (1 - beta_1^t)

  9. eta leftarrow eta - rho_t(bar{g} + deltaeta) / (h + delta - vartheta)

  10. textbf{конец цикла}

  11. textbf{вернуть} eta

визуализация работы алгоритма

визуализация работы алгоритма

Сравнение с Adam:

Adam

uCBOpt

η−rhofrac{bar g}{sqrt{h}+varepsilon}

η-rhofrac{bar g+deltaeta}{h+delta-vartheta}

деление на sqrt{h}

деление на h

varepsilon только стабилизирует

delta, vartheta управляют верхней оценкой кривизны

нет weight decay в формуле шага

deltaeta встроен в обновление

Встраивание weight decay напрямую в обновление позволяет лучше контролировать регуляризацию.

Также авторами была приведена [6]сравнительная таблицу для разных датасетов.

результаты 1

результаты 1

Сравнение проводилось на данных, которые модель видела во время обучения, и на незнакомых. В качестве метрик были выбраны: Accuracy, Negative Log-Likelihood, Expected Calibration Error, False Positive Rate at 95% True Positive Rate, Area Under the Receiver Operating Characteristic curve, Area Under the Precision-Recall curve for Out-of-domain. Рассмотрим результаты для нового алгоритма подробнее.

In-domain.

Доля правильных ответов (точность) на “знакомой” выборке выше относительно остальных. Низкое отрицательное лог. правдоподобие означает, что модель не просто угадывает класс, но и выдает высокую вероятность для правильного класса и низкую для неправильных. Ожидаемая ошибка [7] калибровки измеряет разницу между уверенностью модели и её реальной точностью, низкий результат у uCBOpt-adapt (алгоритм выше с адаптацией гиперпараметров в процессе обучения).

Метрики говорит о том, что когда информация есть, теория возможностей работает не хуже теории вероятностей: uCBOpt-adapt показывает лучшие результаты по ключевым метрикам

Out-of-domain.

FPR@95 для детекции аномалий: показывает, как часто модель ошибочно принимает “незнакомый” объект за “знакомый”, когда мы настроены на то, чтобы поймать 95% всех аномалий, один из новых алгоритмов оказался в топе лучших. AUPR-Out, альтернатива AUROC, которая лучше работает в условиях сильного дисбаланса классов. Она показывает, насколько хорошо модель находит “чужие” объекты, не ошибаясь при этом на “своих”.

Также авторами для сравнения были использованы и другие датасеты: CIFAR-10, CIFAR-100. Таблица приводится ниже, для краткости, без анализа.

результаты 2

результаты 2

Заключение

Таким образом, теория возможностей предлагает альтернативный подход к описанию неопределенности. Повторяя некоторые аспекты теории вероятностей (независимость, теорема Байеса), она меняет общее представление об информации. Теория вероятностей в машинном обучении является фундаментом, имеет удобный аппарат для описания большинства процессов, поэтому неудивительно, что для теория возможностей доказываются аналоги теорем. Появление приведенного алгоритма и построение новой теории является примером непрерывного развития науки. Так машинное обучение помогает двигать вперед математику [8], а не только отбирает ее хлеб.

Автор: Ir1na

Источник [9]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/36102

URLs in this post:

[1] обучении: http://www.braintools.ru/article/5125

[2] случайности: http://www.braintools.ru/article/6560

[3] логично: http://www.braintools.ru/article/7640

[4] была представлена: https://arxiv.org/pdf/2607.08019

[5] представили: https://arxiv.org/pdf/2511.21223

[6] была приведена : https://icml.cc/virtual/2026/84050

[7] ошибка: http://www.braintools.ru/article/4192

[8] математику: http://www.braintools.ru/article/7620

[9] Источник: https://habr.com/ru/articles/1087094/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1087094

www.BrainTools.ru

Rambler's Top100