- BrainTools - https://www.braintools.ru -

Квадриллион параметров (1Q) для LLM. Когда нам ждать такую модель?

Согласно закону заголовков Беттериджа [1] («Если заголовок заканчивается вопросительным знаком, на него можно ответить „нет“»), ответом на вопрос в заголовке будет „никогда“. И я попытаюсь вас в этом убедить.

ChatGPT 5.6-Sol, high

ChatGPT 5.6-Sol, high

Совсем недавно число параметров крупнейших языковых моделей выросло с миллиардов (billions, 109) до триллионов (trillions, 1012). Попробуем разобраться, когда был преодолён триллионный рубеж, сколько данных требуется таким моделям для обучения [2] и действительно ли прогресс LLM начал замедляться. Возможно, нам удастся экстраполировать, когда появятся модели с квадриллионом (1 quadrillion, 1Q, 1015) параметров?

Триллион появился раньше, чем кажется

Формально триллионный рубеж был преодолён ещё в начале 2021 года. Switch Transformer [3] от Google масштабировали примерно до 1,6 трлн параметров. Система использовала разреженную архитектуру (MoE), то есть для обработки конкретного токена активировалась только часть модели.

Количество заявленных параметров (B, миллиарды) в зависимости от времени релиза ИИ модели. Сплошная линия показывает среднюю величину. Прерывистая линия - 1Т параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/

Количество заявленных параметров (B, миллиарды) в зависимости от времени релиза ИИ модели. Сплошная линия показывает среднюю величину. Прерывистая линия – 1Т параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/ [4]

Поэтому корректнее говорить не о появлении триллионных моделей в 2024 году, а об их переходе из исследовательских экспериментов в практически применимые системы в 2025–2026 годах.

Теперь немного об активных параметрах, которых всегда меньше у MoE-моделей. Примерно в 20 раз. Например, открытая Kimi K3 имеет 2,8 трлн общих, но только 104 млрд активных параметров. То же самое творится и с флагманскими моделями от Claude: активных параметров там предположительно 150 миллиардов [4].

Активных параметров примерно в 20 раз меньше у MoE-моделей. Прерывистая линия имеет наклон 45 градусов, сплошная линия имеет меньший наклон.

Активных параметров примерно в 20 раз меньше у MoE-моделей. Прерывистая линия имеет наклон 45 градусов, сплошная линия имеет меньший наклон.

То есть, текущие модели уже могут и иметь пару триллионов параметров, активных параметров не бывает более 150 миллиардов. Соответственно наше движение к квадриллионну не такое уже и стремительное.

Сколько Википедий нужно для обучения новой модели?

Чтобы упростить наши вычисления, давайте придумаем искусственную величину Wk (Wikipedia Token Unit).

Ниже я её подробно опишу:

  1. Wikipedia Token Unit (Wk) — условный объём текста, равный приблизительному числу токенов во всех языковых разделах Википедии по состоянию на 1 августа 2026 года. Wk измеряет валовый объём токенов, а не количество уникальной информации. Переводы, дублирование статей и различия токенизации между языками отдельно не учитываются.

  2. По состоянию на 1 августа 2026 года английская Википедия содержит ~5,2 млрд слов [5].

  3. Примем соотношение 1500 слов = 2048 токенов [6] и получим примерно 1,365 токена на слово.

  4. Есть оценка, что английская Википедия составляет 10,61% [7]. Предположим, что Википедии на всех языках вместе содержат в десять раз больше информации.

  5. Суммарно, значит, в Википедии можно поживиться 5244576572*(2048/1500)*(100/10.61) = 6,749e10 токенами.

  6. Естественно, что ежегодно Википедия растёт. Данный рост даже носил экспоненциальный характер. Но только до 2007 года. Сейчас рост составляет 2,5% [7] в год. И мы им можем пренебречь. Или же заботливо пометить, что Wk2026 ≈ 67,49×109 токенов. В дальнейших расчётах я буду использовать Wk, подразумевая под этим Wk2026.

Вот так бы выглядела английская Википедия (0.101 Wk) в вашей домашней библиотеке, если бы вы её распечатали в декабре 2025 года. Можно заметить желтый фрагмент сверху - это пустые полки. (источник)

Вот так бы выглядела английская Википедия (0.101 Wk) в вашей домашней библиотеке, если бы вы её распечатали в декабре 2025 года. Можно заметить желтый фрагмент сверху – это пустые полки. (источник [8])

Если вам нужны качественные данные, помимо Википедии вы можете выудить их и в других местах. Есть мелкие датасеты (<1 Wk):

  • На Хабре была прекрасная статья [9] об обучении ИИ на базе корпуса текстов всех статей самого Хабра. Там автор насчитал 0,0077 Wk в тексте и чуть больше информации в комментариях (0,0089 Wk). Суммарно это нам может дать немного, хоть ты изобретай миллиВики единицы: 0,0077 Wk + 0,0089 Wk = 17 mWk.

  • За 80 лет жизни человек, который читает 1 час в день по 250 слов в минуту, прочитает 8,59 mWk.

  • Еncyclopædia Britannica – 1,1 mWk.

  • Сгоревшая Александрийская библиотека с 0,5 миллионами папирусов – это примерно 0,12 Wk.

  • До эпохи “глобального нейрослопа” в 2022 году ученые напечатали примерно 5,14 миллиона статей. Если принять, что в статье 4’500 слов, то это 0,50 Wk за год. Вот такой примерно годовой “выхлоп” от всех учёных на свете.

Крупные датасеты (>1 Wk):

  • В 2022 году издано примерно 1,75 миллиона книг. Если принять, что в книге 70’000 слов, то это 2,42 Wk за год.

  • Реддит (за всё время) – 13,3 Wk.

  • Российская государственная библиотека (“Ленинка”) – 37,0 Wk.

  • Библиотека Конгресса – 51,9 Wk.

  • Все расшифровки роликов со всего Youtube: 68,9 Wk.

  • Есть готовые крупные датасеты:

    • 2020: The Pile – 4,4 Wk

    • 2023: RedPajama – 17,9 Wk

    • 2024: FineWeb – 222 Wk

Закон Шиншиллы [9] гласит, что при фиксированном вычислительном бюджете число обучающих токенов и размер модели следует увеличивать приблизительно пропорционально. Сама Chinchilla имела 70 млрд параметров и обучалась на 1,4 трлн токенов — ровно 20 токенов на параметр.

Если использовать ориентир 20 токенов на параметр, то модели на 1 трлн параметров (1T) для обучения потребуется: 296 Wk. И если такие данные ещё можно наскребсти из вышеприведенных датасетов, то где взять 296’000 Wk для 1 квадриллионной модели (1Q)? Вопрос – риторический.

  1. Или мы повышаем эффективность обучения в 200 раз и ломаем закон Шиншиллы: довольствуемся 0.1 токена на 1 параметр. Следовательно, потребуется либо радикально более эффективное использование данных, либо принципиально иной подход к обучению.

  2. Ну или же нам нужен прорыв: ИИ генерирует новые тексты с новым уникальным содержанием без нейрослопа. И желательно в больших количествах: >1’000 Wk. На данный момент обучать 1Q модель на синтетике — всё равно что пытаться сделать ксерокопию с ксерокопии. Без притока оригинальных идей новая модель быстро и гарантированно скатывается в деградацию и галлюцинации.

  3. Третьего не дано.

Написать сию статью меня сподвигло то, что в новостях подаётся важной информацией скупка антикварных немецких книг [10], с их последующей дигитализацией и уничтожением. Если 1 книга соответствует примерно 0.0014 mWk, уничтожение по 1’000 книг из 1’000 антикварных магазинов даст нам только 1,4 Wk. Да и что такого могли написать немцы в 19 веке, что является научным фактом, но неизвестно нынешней Википедии и иным современным источникам? Только, поди, детали биографии немецких поэтов-романтиков 19 века. То есть эта новость скорее похожа на информационный шум, чем на создание уникального датасета размером хотя бы в 1’000 Wk.

Хранение данных — не главная проблема

Англоязычную Википедию (без изображений) можно сжать до 11,7 Гб [11], следовательно, полная версия (1 Wk) может занимать 110 Гб, а для хранения 296 Wk необходимых для 1Т модели нам потребуется зарезервировать около 31,9 Тб пространства.

В целом, проблема с пространством для хранения данных для обучения не кажется актуальной. Ведь сегодня один жесткий диск емкостью 28 Тб может стоить всего 400 [12] долларов США.

То есть гипотетическая 1Q модель сможет хранить свой датасет на носителях стоимостью порядка 0.4 миллиона долларов. Я тут проблемы не вижу.

Коррелирует ли число параметров с качеством модели?

Теперь перейдём к результатам, полученным недавно. Наблюдаем ли мы корреляцию между количеством параметров и результатами бенчмарков? Я считаю, что заслуживают внимания [13] только два бенчмарка (источник [14]):

  • GPQA [15]был выпущен в 2023 году. Однако этот тест потерял свою точность либо в марте 2025 года, когда был достигнут результат в 80% (Gemini 2.5 набрал 84%), либо в ноябре 2025 года, когда был достигнут результат в 90% (Gemini 3 Pro набрал 93%).

  • HLE [16]был выпущен в 2025 году. Первоначально ИИ набирали всего ≤8%, но теперь лучший результат составляет 51% (Gemini 3.1 pro). В HLE-Verified результаты моделей в среднем выросли на 7-10 процентных пунктов после проверки и исправления ряда вопросов.

Если логарифмировать число параметров и построить линейную регрессию, можно получить статистически значимый положительный наклон. Как для полного числа параметров, так и для активных параметров:

Зависимость GPQA и HLE от log10-трансформированного числа параметров/активных параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/

Зависимость GPQA и HLE от log10-трансформированного числа параметров/активных параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/ [4]

Ответ очевиден: большие модели обычно показывают более высокие результаты. Соответственно, 1Q модель теоретически должна была бы быть неплохой.

Замедлился ли прогресс в программировании?

Мы также можем отслеживать прогресс ИИ, используя его производительность в задачах программирования. Возьмем исторические модели от OpenAI и три модели, которые в настоящее время являются самыми сильными. Видно, что с 2022 по 2025 год наблюдался рост на 241 Elo баллов (с ChatGPT-3.5 до ChatGPT-5.2).

Но у меня есть стойкое ощущение, что позже рост остановился. С 2025 по 2026 год модели добавили всего 37 Elo баллов (с ChatGPT-5.2 до Claude fable-5). Не стоит забывать [17], что стандартная ошибка [18] измерения (SE) здесь составляет 10-20 баллов Elo (усы погрешности на графике). На фоне двух ошибок в 10-20 Elo баллов каждая, разница в 37 Elo балов кажется ещё менее внушительной.

Динамика coding-рейтингa Elo. Линия на 1400 проведена в качестве референса, и может означать “среднюю” модель в рейтинге.

Динамика coding-рейтингa Elo. Линия на 1400 проведена в качестве референса, и может означать “среднюю” модель в рейтинге.

Конечно, разница в 241 Elo баллов с 2022 по 2025 год существенна. Это означает 80% вероятности выигрыша (1/(1+10^(-241/400) [19]). Это впечатляющее соотношение побед/очков 4:1. Да, это весьма отличается от варианта 50%/50% (1:1). Таким образом, если мы исключим ничьи, и используем уровень значимости 5%, и выберем мощность анализа 80% (power analysis), ориентировочно понадобится 10 игр/сравнений [20], чтобы обнаружить такую ​​разницу.

Но как насчет 37 ± 18 баллов Elo, полученных от лучшей модели, выпущенной в 2025 году, по сравнению с лучшей моделью 2026 года? Это означает победу в 55,3% игр (1,106:1). Сколько игр нам нужно сыграть, чтобы увидеть такую ​​разницу? Я предполагаю, что нам нужно 348 сравнений [20], чтобы с вероятностью 80% обнаружить такую ​​разницу надежным способом. Как говорится, “овчинка не стоит выделки”.

Я признаю, что современные модели сильнее старых. Но мне кажется, это объясняется другим фактором. Назовём его “вниманием” (extended thinking). Модель может “думать” дольше. Так как Работа = Мощность × Время, время это тот параметр, где мы можем подождать в 10 раз дольше для получения лучшего результата. Уже сейчас топовые модели “задумываются” и “застывают” на 5-30 минут.

Но мой тезис в том, что мы не оценим, если машина будет “зависать” в 100-1’000 раз дольше. В сутках всего 24 × 60 = 1’440 минут. Мы не можем ждать ответа от ИИ в 1’000 раз дольше, чем за 1 минуту.

Но это было подмечено ещё до меня:

– Сорок два, – с бесконечным спокойствием сообщил компьютер.
В комнате долго стояла тишина. Краем глаза Пфоук видел за окном море напряженно ожидающих лиц.
– Нас линчуют, – прошептал он.
– Вы задали мне трудную задачку, – кротко пояснил компьютер.
– Сорок два?! – завопил Лункуал. – И это все, что ты можешь нам сказать после семи с половиной миллионов лет работы?
Дуглас Адамс, «Путеводитель для путешествующих автостопом по Галактике»

Выводы

  • Триллион параметров — уже не исторический рубеж. Он был преодолён в исследовательских MoE-моделях от Google ещё в 2021 году. Новое явление — появление практически применимых и открытых триллионных систем. Совершенно нормально, что новые модели ИИ начали использовать 1T параметров. Однажды они обязательно достигнут 20-50 T параметров. Но переход к 1Q (1 квадриллион = 1000 T = 1015) параметров маловероятен из-за отсутствия датасетов для обучения. Для обучения 1Q модели может потребоваться 300’000 Wk, что, как я считаю, сложно где-либо найти в ближайшее время (<10 лет). Обратите внимание что Википедии потребовалось примерно 20 лет, чтобы набрать 1 Wk. Реддит и YouTube, конечно же росли быстрее. Но и их контент во-первых менее ценен, а во-вторых давно перестал регулярно удваиваться.

  • Хранение корпуса необходимого для 1Q модели не является фундаментальной проблемой.

  • Существует много информационного шума, который отвлекает внимание от значимых вещей:

    • отсутствие новых датасетов. Всё сложнее найти, очистить и легально использовать достаточное количество новых высококачественных данных.

    • получение лучшего результата ценой экспоненциального увеличения времени, затраченного на “размышления”, и энергии (кВт·ч), визуально улучшающего ИИ с характеристиками неотличыми от более старых моделей. Закон убывающей отдачи встал во весь рост: каждый новый балл Elo теперь стоит астрономических денег, сотен новых датацентров и миллиардов киловатт-часов.

  • Рейтинги Elo застопорились начиная с 2025 года. Пока мы не увидим модель, которая превзойдёт текущие модели с разницей в рейтинге Elo не менее чем на 100 пунктов (а это всего-лишь 1:1,280 в победах/очках), нет причин беспокоиться о том, что мы что-то случайно упускаем в новостной ленте.

  • Мой основной тезис данного опуса заключается в том, что нынешние громкие выпуски моделей – минорные по своему существу. Закончу опус тремя мемами.

    Феерический слайд из презентации Сэма Альтмана. На слайде кто-то “навайбкодил” непойми что. Готов съесть свою шляпу, если найдется человек, который мне доходчиво и непротиворечиво объяснит смысл сего творения.

    Феерический слайд из презентации Сэма Альтмана. На слайде кто-то “навайбкодил” непойми что. Готов съесть свою шляпу, если найдется человек, который мне доходчиво и непротиворечиво объяснит смысл сего творения.
    Без слов.

    Без слов.
Без слов.

Без слов.

Автор: itrus

Источник [21]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/33860

URLs in this post:

[1] закону заголовков Беттериджа: https://ru.wikipedia.org/wiki/%D0%97%D0%B0%D0%BA%D0%BE%D0%BD_%D0%B7%D0%B0%D0%B3%D0%BE%D0%BB%D0%BE%D0%B2%D0%BA%D0%BE%D0%B2_%D0%91%D0%B5%D1%82%D1%82%D0%B5%D1%80%D0%B8%D0%B4%D0%B6%D0%B0

[2] обучения: http://www.braintools.ru/article/5125

[3] Switch Transformer: https://arxiv.org/pdf/2101.03961

[4] https://lifearchitect.ai/models-table/: https://lifearchitect.ai/models-table/

[5] ~5,2 млрд слов: https://en.wikipedia.org/wiki/Wikipedia:Size_in_volumes

[6] 1500 слов = 2048 токенов: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them

[7] 10,61%: https://en.wikipedia.org/wiki/Wikipedia%3ASize_of_Wikipedia

[8] источник: https://en.wikipedia.org/wiki/Wikipedia%3ASize_of_Wikipedia#/media/File:Size_of_English_Wikipedia_(Printable-version_tool_method).jpg

[9] прекрасная статья: https://habr.com/ru/articles/1054710/

[10] скупка антикварных немецких книг: https://www.theguardian.com/technology/2026/aug/02/australian-book-sellers-alarm-destruction-rare-titles-ai-supply-chain

[11] 11,7 Гб: https://browse.library.kiwix.org/#lang=eng&category=wikipedia

[12] 400: https://www.techradar.com/best/large-hard-drives-and-ssds#section-the-largest-hdd-on-the-market

[13] внимания: http://www.braintools.ru/article/7595

[14] источник: https://epoch.ai/benchmarks?view=graph&tab=benchmarks&benchmark-selection=%7EGPQA+diamond%7Ehle

[15] GPQA : https://arxiv.org/abs/2311.12022

[16] HLE : https://arxiv.org/abs/2501.14249

[17] забывать: http://www.braintools.ru/article/333

[18] ошибка: http://www.braintools.ru/article/4192

[19] 1/(1+10^(-241/400): https://wismuth.com/elo/calculator.html#rating1=1400&rating2=1600&formula=normal&best_of=10

[20] 10 игр/сравнений: https://www.socscistatistics.com/utilities/power/calculator/

[21] Источник: https://habr.com/ru/articles/1065320/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1065320

www.BrainTools.ru

Rambler's Top100