TL;DR. Кватернионные, октонионные, седенионные и Clifford-слои регулярно появляются в статьях с обещаниями parameter efficiency и «особой выразительности». Мы два месяца строили их, бенчмаркали — и честно пытались заставить выиграть. Каждый раз, когда в сравнение добавлялся один правильно подобранный real-valued baseline, преимущество испарялось. Все 35 раз. По дороге мы убили собственный headline-результат, нашли единственное настоящее исключение (и объяснили его), доказали несколько потолков невозможности с точными константами и свели всё к правилу в одну строку, которое любой ревьюер может применить за 30 секунд. Препринт: doi:10.5281/zenodo.21623615, код и сырые per-seed результаты: github.com/mxkuzn/hypercomplex-placebo-audit.
Почему в это легко поверить
Лестница Кэли–Диксона действительно красива. Берём вещественные числа. Удваиваем: комплексные. Ещё раз: кватернионы — умножение перестаёт коммутировать, зато 3D-повороты бесплатно. Ещё раз: октонионы — умножение перестаёт быть ассоциативным, что звучит как поломка, но математически глубоко. Ещё раз: седенионы, и у вас появляются делители нуля — ненулевые числа, дающие в произведении ноль.
Каждый этаж выглядит созданным для machine learning. Norm-preserving умножение? Ровно то, что нужно рекуррентным сетям для стабильности. Некоммутативность? Чувствительность к порядку из коробки. Делители нуля? Готовый примитив «взаимного исключения» — идеально для логических противоречий, разве нет?
Литература согласна: quaternion CNN, октонионные knowledge-graph embeddings, parameterized hypercomplex multiplication (PHM), гиперкомплексные адаптеры для LLM — стабильный поток статей с выигрышами, обычно в формулировке «та же точность при 1/n параметров».
Мы тоже купились. Наш проект гонял десятки экспериментов, пытаясь строить reasoning-модули на этих алгебрах. Ранние результаты выглядели отлично. Один из них — «октонионные state-space модели доминируют на неабелевом group tracking» — какое-то время был нашим главным козырем.
Контроль, который поле забыло поставить
Неудобный вопрос, который почти ни одна гиперкомплексная статья не задаёт: matched против чего?
Типичный baseline — плотная сеть или диагональная рекуррентность. Но гиперкомплексный слой это не просто «сеть» — это компактная, структурированная, недиагональная билинейная операция. Если сравнивать его с чем-то бесструктурным, невозможно отличить вклад экзотической алгебры от вклада банальной структуры.
Мы добавили четыре скучных контроля, каждый — param-matched:
|
Контроль |
Что изолирует |
|---|---|
|
Real-ротация (произведение Householder-отражений) |
некоммутативность или просто честный поворот? |
|
Shuffled structure tensor (случайно переставленная таблица умножения) |
конкретная алгебра или любая компактная билинейность? |
|
Real HRR (циркулярная свёртка, технология 1995 года) |
алгебра или просто binding? |
|
Real-ортогональность (dot(x,y)=0) |
делители нуля или обычный exclusion-примитив? |
Дальше перегнали всё: ассоциативную память, group tracking, хоралы Баха, liquid-контроль дрона, детекцию противоречий, варианты attention, автоэнкодеры. По 3–5 сидов, pre-registered kill-критерии.
Результат по исходным восьми задачам: добавление одного только первого контроля сняло заявленное преимущество в 8 из 8.
Наш собственный headline умер так же. Октонионная модель, «доминировавшая» на неабелевых группах, сравнивалась только с диагональной SSM. Против param-matched real-ротации она проиграла всухую — 0.38 против 1.00 на диэдральной группе D₄. Октонион выигрывал только на группах, буквально вложимых в кватернионы (Q₈, Z₈). Это не магия алгебры — это structure-match.
Стилмен, который не выстрелил
Может, нашим задачам просто не нужна была неассоциативность? Ладно. Мы построили самую неассоциативную цель, какую смогли найти: ассоциатор [a,b,c] = (ab)c − a(bc) из исключительной йордановой алгебры — объект, тождественно равный нулю для любой ассоциативной алгебры. Если что-то и требует октонионов — то это.
Param-matched real билинейная сеть выучила его так же хорошо, как октонионная (косинус 0.991 против 1.000). Отсюда самый переносимый вывод работы:
Неассоциативность в генераторе данных не требует неассоциативности в обучаемом представлении. Любое фиксированное умножение алгебры — это фиксированный вещественный билинейный тензор; вещественный универсальный аппроксиматор его просто поглощает.
И более умной алгебры не существует: теоремы Гурвица и Фробениуса доказывают, что нормированные алгебры с делением бывают только в размерностях 1, 2, 4, 8, и каждая ступень лестницы обменивает свойство (порядок, коммутативность, ассоциативность, деление). «Best of all worlds» запрещён классификационными теоремами XIX века.
Единственное исключение — и чем оно оказалось
Один результат нас честно удивил. На state tracking по бинарно-тетраэдральной группе кватернионная рекуррентность, обученная на длинах ≤12, экстраполировала на длину 1024:
|
Конфигурация |
Accuracy @ L=1024 (5 сидов) |
|---|---|
|
Кватернион ℍ |
0.992 |
|
Октонион 𝕆 |
0.623 (бимодально: 3/5 идеально, 2/5 коллапс) |
|
Cayley SO(8), loose |
0.206 |
|
Householder-2 |
0.061 |
|
Cayley SO(4), tight |
0.055 |
|
Householder-4 |
0.050 |
Причём tight-контроли валятся уже на train-распределении — это провал обучаемости, не дрейф экстраполяции. Репрезентационная магия? Нет: SO(4) доказуемо содержит точное кватернионное решение, и отдельные real-сиды его иногда находят. Просто SGD надёжно доходит до него только внутри кватернионной параметризации. Преимущество — optimization basin: «трудно найти, легко установить». Не capability moat.
А потом мы сравнили с настоящим SOTA для длинных последовательностей — LRU, диагональной комплексной рекуррентностью. Pre-registered bar: «ℍ должен бить LRU при matched параметрах, и разрыв должен расти с лагом». Оба условия провалились: LRU выигрывает при вдвое меньших параметрах (exact-match 0.834 против 0.140 на лаге 192), и разрыв растёт не в ту сторону.
Ирония: лучшая алгебра во всём исследовании — самая скучная нетривиальная. Комплексные числа. Размерность два.
От «проигрывает» к «не может выиграть»
Последняя треть работы перестаёт спрашивать, выигрывает ли алгебра, и спрашивает — может ли. Ответы с точными константами, а не вайбами:
-
Отражения недостижимы. В любой алгебре Кэли–Диксона умножение на единичный элемент имеет det > 0. Если группа симметрий вашего домена содержит отражение (у музыкальной группы транспозиций/инверсий — содержит), она доказуемо не живёт в умножении алгебры. Добавление размерностей не помогает.
-
Делители нуля не умеют в 3-way exclusion. Трёх взаимно аннигилирующих единичных седенионов не существует: лучший достижимый «worst-pair» для тройки — ровно 0.500, для четвёрки — ровно 1/√3. При этом обычная ортогональность даёт 16-way exclusion в тех же 16 измерениях при нуле параметров. Экзотический примитив строго слабее скучного, который он должен был заменить.
-
Неассоциативность отменяет parallel scan. Современные long-sequence модели получают log-глубину из префиксных сканов, которым нужна ассоциативность. Для 𝕆/𝕊 скан не «приближает» ответ — он вычисляет другую функцию (измеренное расхождение 130–143% против ~1e-16 у ℂ/ℍ).
-
Сгруппироваться и сбежать не выйдет. Тензорные произведения этих алгебр схлопываются в обычные матричные алгебры — мы явно проверили ℍ⊗ℍ ≅ M₄(ℝ) с ошибкой гомоморфизма ровно 0.0. То есть в то, что ваш GPU и так умножает.
Что выжило
Две вещи, и ни одна не алгебра.
Методология. Если вынести из статьи одно: любая работа про структурированные слои, в которой нет param-matched real structured control и shuffled-structure control, ещё ничего не показала. Наш чеклист — пять строк, и он предотвратил бы каждый false positive, за которым мы гонялись. Включая наши собственные.
Точность (exactness). Единственный компонент, который когда-либо давал 1.000 accuracy с нулём галлюцинаций на любой длине — скомпилированная точная таблица. Не обученная, не аппроксимированная. На реальном bAbI точный символьный front-end обошёл обученный end-to-end монолит на +0.5 accuracy, в то время как любая VSA — гиперкомплексная или вещественная — застряла около 0.51. Чем бы ни оказалось будущее нейросимвольных систем, наши данные говорят: moat — это точное вычисление, а не экзотическая арифметика.
Зачем публиковать негативный результат
Потому что мы не смогли найти эту статью, когда она была нам нужна. Два месяца GPU-времени, ~35 контролируемых экспериментов, несколько «побед», растворившихся под одним честным baseline — всё это сэкономила бы чужая версия этого текста. (Справедливости ради, поле сходится: controlled study Clifford-слоёв, опубликованная этим июлем, независимо пришла к тому же выводу тем же методом.)
Мы также вели счёт против себя: в статье есть секция со всеми само-опровержениями, которые поймали наши же контроли — включая одно, найденное при финальной верификации рукописи: седенионный балл, тихо выпавший из таблицы, потому что ломал «красивый» порядок. Он вернулся в таблицу, и клейм стал слабее и честнее.
Если вы работаете со структурированными архитектурами и считаете, что мы где-то ошиблись — весь аудит воспроизводим: каждое число в каждой таблице генерируется закоммиченным скриптом с закоммиченными per-seed JSON. Открывайте issue — ровно за такими комментариями мы это и публиковали.
Препринт: doi.org/10.5281/zenodo.21623615 · Код и данные: github.com/mxkuzn/hypercomplex-placebo-audit.
Автор: Exactor


