Мы провели 35 контролируемых экспериментов с «экзотическими алгебрами» в нейросетях. воспроизводимость.. воспроизводимость. гиперкомплексные числа.. воспроизводимость. гиперкомплексные числа. кватернионы.. воспроизводимость. гиперкомплексные числа. кватернионы. нейросети.. воспроизводимость. гиперкомплексные числа. кватернионы. нейросети. октонионы.

TL;DR. Кватернионные, октонионные, седенионные и Clifford-слои регулярно появляются в статьях с обещаниями parameter efficiency и «особой выразительности». Мы два месяца строили их, бенчмаркали — и честно пытались заставить выиграть. Каждый раз, когда в сравнение добавлялся один правильно подобранный real-valued baseline, преимущество испарялось. Все 35 раз. По дороге мы убили собственный headline-результат, нашли единственное настоящее исключение (и объяснили его), доказали несколько потолков невозможности с точными константами и свели всё к правилу в одну строку, которое любой ревьюер может применить за 30 секунд. Препринт: doi:10.5281/zenodo.21623615, код и сырые per-seed результаты: github.com/mxkuzn/hypercomplex-placebo-audit.

Почему в это легко поверить

Лестница Кэли–Диксона действительно красива. Берём вещественные числа. Удваиваем: комплексные. Ещё раз: кватернионы — умножение перестаёт коммутировать, зато 3D-повороты бесплатно. Ещё раз: октонионы — умножение перестаёт быть ассоциативным, что звучит как поломка, но математически глубоко. Ещё раз: седенионы, и у вас появляются делители нуля — ненулевые числа, дающие в произведении ноль.

Каждый этаж выглядит созданным для machine learning. Norm-preserving умножение? Ровно то, что нужно рекуррентным сетям для стабильности. Некоммутативность? Чувствительность к порядку из коробки. Делители нуля? Готовый примитив «взаимного исключения» — идеально для логических противоречий, разве нет?

Литература согласна: quaternion CNN, октонионные knowledge-graph embeddings, parameterized hypercomplex multiplication (PHM), гиперкомплексные адаптеры для LLM — стабильный поток статей с выигрышами, обычно в формулировке «та же точность при 1/n параметров».

Мы тоже купились. Наш проект гонял десятки экспериментов, пытаясь строить reasoning-модули на этих алгебрах. Ранние результаты выглядели отлично. Один из них — «октонионные state-space модели доминируют на неабелевом group tracking» — какое-то время был нашим главным козырем.

Контроль, который поле забыло поставить

Неудобный вопрос, который почти ни одна гиперкомплексная статья не задаёт: matched против чего?

Типичный baseline — плотная сеть или диагональная рекуррентность. Но гиперкомплексный слой это не просто «сеть» — это компактная, структурированная, недиагональная билинейная операция. Если сравнивать его с чем-то бесструктурным, невозможно отличить вклад экзотической алгебры от вклада банальной структуры.

Мы добавили четыре скучных контроля, каждый — param-matched:

Контроль

Что изолирует

Real-ротация (произведение Householder-отражений)

некоммутативность или просто честный поворот?

Shuffled structure tensor (случайно переставленная таблица умножения)

конкретная алгебра или любая компактная билинейность?

Real HRR (циркулярная свёртка, технология 1995 года)

алгебра или просто binding?

Real-ортогональность (dot(x,y)=0)

делители нуля или обычный exclusion-примитив?

Дальше перегнали всё: ассоциативную память, group tracking, хоралы Баха, liquid-контроль дрона, детекцию противоречий, варианты attention, автоэнкодеры. По 3–5 сидов, pre-registered kill-критерии.

Результат по исходным восьми задачам: добавление одного только первого контроля сняло заявленное преимущество в 8 из 8.

Наш собственный headline умер так же. Октонионная модель, «доминировавшая» на неабелевых группах, сравнивалась только с диагональной SSM. Против param-matched real-ротации она проиграла всухую — 0.38 против 1.00 на диэдральной группе D₄. Октонион выигрывал только на группах, буквально вложимых в кватернионы (Q₈, Z₈). Это не магия алгебры — это structure-match.

Real против hypercomplex на всех восьми задачах

Real против hypercomplex на всех восьми задачах

Стилмен, который не выстрелил

Может, нашим задачам просто не нужна была неассоциативность? Ладно. Мы построили самую неассоциативную цель, какую смогли найти: ассоциатор [a,b,c] = (ab)c − a(bc) из исключительной йордановой алгебры — объект, тождественно равный нулю для любой ассоциативной алгебры. Если что-то и требует октонионов — то это.

Param-matched real билинейная сеть выучила его так же хорошо, как октонионная (косинус 0.991 против 1.000). Отсюда самый переносимый вывод работы:

Неассоциативность в генераторе данных не требует неассоциативности в обучаемом представлении. Любое фиксированное умножение алгебры — это фиксированный вещественный билинейный тензор; вещественный универсальный аппроксиматор его просто поглощает.

И более умной алгебры не существует: теоремы Гурвица и Фробениуса доказывают, что нормированные алгебры с делением бывают только в размерностях 1, 2, 4, 8, и каждая ступень лестницы обменивает свойство (порядок, коммутативность, ассоциативность, деление). «Best of all worlds» запрещён классификационными теоремами XIX века.

Единственное исключение — и чем оно оказалось

Один результат нас честно удивил. На state tracking по бинарно-тетраэдральной группе кватернионная рекуррентность, обученная на длинах ≤12, экстраполировала на длину 1024:

Конфигурация

Accuracy @ L=1024 (5 сидов)

Кватернион ℍ

0.992

Октонион 𝕆

0.623 (бимодально: 3/5 идеально, 2/5 коллапс)

Cayley SO(8), loose

0.206

Householder-2

0.061

Cayley SO(4), tight

0.055

Householder-4

0.050

Причём tight-контроли валятся уже на train-распределении — это провал обучаемости, не дрейф экстраполяции. Репрезентационная магия? Нет: SO(4) доказуемо содержит точное кватернионное решение, и отдельные real-сиды его иногда находят. Просто SGD надёжно доходит до него только внутри кватернионной параметризации. Преимущество — optimization basin: «трудно найти, легко установить». Не capability moat.

А потом мы сравнили с настоящим SOTA для длинных последовательностей — LRU, диагональной комплексной рекуррентностью. Pre-registered bar: «ℍ должен бить LRU при matched параметрах, и разрыв должен расти с лагом». Оба условия провалились: LRU выигрывает при вдвое меньших параметрах (exact-match 0.834 против 0.140 на лаге 192), и разрыв растёт не в ту сторону.

LRU выигрывает при вдвое меньших параметрах

LRU выигрывает при вдвое меньших параметрах

Ирония: лучшая алгебра во всём исследовании — самая скучная нетривиальная. Комплексные числа. Размерность два.

От «проигрывает» к «не может выиграть»

Последняя треть работы перестаёт спрашивать, выигрывает ли алгебра, и спрашивает — может ли. Ответы с точными константами, а не вайбами:

  • Отражения недостижимы. В любой алгебре Кэли–Диксона умножение на единичный элемент имеет det > 0. Если группа симметрий вашего домена содержит отражение (у музыкальной группы транспозиций/инверсий — содержит), она доказуемо не живёт в умножении алгебры. Добавление размерностей не помогает.

  • Делители нуля не умеют в 3-way exclusion. Трёх взаимно аннигилирующих единичных седенионов не существует: лучший достижимый «worst-pair» для тройки — ровно 0.500, для четвёрки — ровно 1/√3. При этом обычная ортогональность даёт 16-way exclusion в тех же 16 измерениях при нуле параметров. Экзотический примитив строго слабее скучного, который он должен был заменить.

  • Неассоциативность отменяет parallel scan. Современные long-sequence модели получают log-глубину из префиксных сканов, которым нужна ассоциативность. Для 𝕆/𝕊 скан не «приближает» ответ — он вычисляет другую функцию (измеренное расхождение 130–143% против ~1e-16 у ℂ/ℍ).

  • Сгруппироваться и сбежать не выйдет. Тензорные произведения этих алгебр схлопываются в обычные матричные алгебры — мы явно проверили ℍ⊗ℍ ≅ M₄(ℝ) с ошибкой гомоморфизма ровно 0.0. То есть в то, что ваш GPU и так умножает.

Что выжило

Две вещи, и ни одна не алгебра.

Методология. Если вынести из статьи одно: любая работа про структурированные слои, в которой нет param-matched real structured control и shuffled-structure control, ещё ничего не показала. Наш чеклист — пять строк, и он предотвратил бы каждый false positive, за которым мы гонялись. Включая наши собственные.

Точность (exactness). Единственный компонент, который когда-либо давал 1.000 accuracy с нулём галлюцинаций на любой длине — скомпилированная точная таблица. Не обученная, не аппроксимированная. На реальном bAbI точный символьный front-end обошёл обученный end-to-end монолит на +0.5 accuracy, в то время как любая VSA — гиперкомплексная или вещественная — застряла около 0.51. Чем бы ни оказалось будущее нейросимвольных систем, наши данные говорят: moat — это точное вычисление, а не экзотическая арифметика.

Зачем публиковать негативный результат

Потому что мы не смогли найти эту статью, когда она была нам нужна. Два месяца GPU-времени, ~35 контролируемых экспериментов, несколько «побед», растворившихся под одним честным baseline — всё это сэкономила бы чужая версия этого текста. (Справедливости ради, поле сходится: controlled study Clifford-слоёв, опубликованная этим июлем, независимо пришла к тому же выводу тем же методом.)

Мы также вели счёт против себя: в статье есть секция со всеми само-опровержениями, которые поймали наши же контроли — включая одно, найденное при финальной верификации рукописи: седенионный балл, тихо выпавший из таблицы, потому что ломал «красивый» порядок. Он вернулся в таблицу, и клейм стал слабее и честнее.

Если вы работаете со структурированными архитектурами и считаете, что мы где-то ошиблись — весь аудит воспроизводим: каждое число в каждой таблице генерируется закоммиченным скриптом с закоммиченными per-seed JSON. Открывайте issue — ровно за такими комментариями мы это и публиковали.

Препринт: doi.org/10.5281/zenodo.21623615 · Код и данные: github.com/mxkuzn/hypercomplex-placebo-audit.

Автор: Exactor

Источник