Квадриллион параметров (1Q) для LLM. Когда нам ждать такую модель?. ai.. ai. billion.. ai. billion. chatgpt.. ai. billion. chatgpt. Claude.. ai. billion. chatgpt. Claude. kimi.. ai. billion. chatgpt. Claude. kimi. parameter.. ai. billion. chatgpt. Claude. kimi. parameter. ИИ.. ai. billion. chatgpt. Claude. kimi. parameter. ИИ. ии-агенты.. ai. billion. chatgpt. Claude. kimi. parameter. ИИ. ии-агенты. искусственный интеллект.. ai. billion. chatgpt. Claude. kimi. parameter. ИИ. ии-агенты. искусственный интеллект. Исследования и прогнозы в IT.. ai. billion. chatgpt. Claude. kimi. parameter. ИИ. ии-агенты. искусственный интеллект. Исследования и прогнозы в IT. История IT.

Согласно закону заголовков Беттериджа («Если заголовок заканчивается вопросительным знаком, на него можно ответить „нет“»), ответом на вопрос в заголовке будет „никогда“. И я попытаюсь вас в этом убедить.

ChatGPT 5.6-Sol, high
ChatGPT 5.6-Sol, high

Совсем недавно число параметров крупнейших языковых моделей выросло с миллиардов (billions, 109) до триллионов (trillions, 1012). Попробуем разобраться, когда был преодолён триллионный рубеж, сколько данных требуется таким моделям для обучения и действительно ли прогресс LLM начал замедляться. Возможно, нам удастся экстраполировать, когда появятся модели с квадриллионом (1 quadrillion, 1Q, 1015) параметров?

Триллион появился раньше, чем кажется

Формально триллионный рубеж был преодолён ещё в начале 2021 года. Switch Transformer от Google масштабировали примерно до 1,6 трлн параметров. Система использовала разреженную архитектуру (MoE), то есть для обработки конкретного токена активировалась только часть модели.

Количество заявленных параметров (B, миллиарды) в зависимости от времени релиза ИИ модели. Сплошная линия показывает среднюю величину. Прерывистая линия - 1Т параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/

Количество заявленных параметров (B, миллиарды) в зависимости от времени релиза ИИ модели. Сплошная линия показывает среднюю величину. Прерывистая линия – 1Т параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/

Поэтому корректнее говорить не о появлении триллионных моделей в 2024 году, а об их переходе из исследовательских экспериментов в практически применимые системы в 2025–2026 годах.

Теперь немного об активных параметрах, которых всегда меньше у MoE-моделей. Примерно в 20 раз. Например, открытая Kimi K3 имеет 2,8 трлн общих, но только 104 млрд активных параметров. То же самое творится и с флагманскими моделями от Claude: активных параметров там предположительно 150 миллиардов.

Активных параметров примерно в 20 раз меньше у MoE-моделей. Прерывистая линия имеет наклон 45 градусов, сплошная линия имеет меньший наклон.

Активных параметров примерно в 20 раз меньше у MoE-моделей. Прерывистая линия имеет наклон 45 градусов, сплошная линия имеет меньший наклон.

То есть, текущие модели уже могут и иметь пару триллионов параметров, активных параметров не бывает более 150 миллиардов. Соответственно наше движение к квадриллионну не такое уже и стремительное.

Сколько Википедий нужно для обучения новой модели?

Чтобы упростить наши вычисления, давайте придумаем искусственную величину Wk (Wikipedia Token Unit).

Ниже я её подробно опишу:

  1. Wikipedia Token Unit (Wk) — условный объём текста, равный приблизительному числу токенов во всех языковых разделах Википедии по состоянию на 1 августа 2026 года. Wk измеряет валовый объём токенов, а не количество уникальной информации. Переводы, дублирование статей и различия токенизации между языками отдельно не учитываются.

  2. По состоянию на 1 августа 2026 года английская Википедия содержит ~5,2 млрд слов.

  3. Примем соотношение 1500 слов = 2048 токенов и получим примерно 1,365 токена на слово.

  4. Есть оценка, что английская Википедия составляет 10,61%. Предположим, что Википедии на всех языках вместе содержат в десять раз больше информации.

  5. Суммарно, значит, в Википедии можно поживиться 5244576572*(2048/1500)*(100/10.61) = 6,749e10 токенами.

  6. Естественно, что ежегодно Википедия растёт. Данный рост даже носил экспоненциальный характер. Но только до 2007 года. Сейчас рост составляет 2,5% в год. И мы им можем пренебречь. Или же заботливо пометить, что Wk2026 ≈ 67,49×109 токенов. В дальнейших расчётах я буду использовать Wk, подразумевая под этим Wk2026.

Вот так бы выглядела английская Википедия (0.101 Wk) в вашей домашней библиотеке, если бы вы её распечатали в декабре 2025 года. Можно заметить желтый фрагмент сверху - это пустые полки. (источник)

Вот так бы выглядела английская Википедия (0.101 Wk) в вашей домашней библиотеке, если бы вы её распечатали в декабре 2025 года. Можно заметить желтый фрагмент сверху – это пустые полки. (источник)

Если вам нужны качественные данные, помимо Википедии вы можете выудить их и в других местах. Есть мелкие датасеты (<1 Wk):

  • На Хабре была прекрасная статья об обучении ИИ на базе корпуса текстов всех статей самого Хабра. Там автор насчитал 0,0077 Wk в тексте и чуть больше информации в комментариях (0,0089 Wk). Суммарно это нам может дать немного, хоть ты изобретай миллиВики единицы: 0,0077 Wk + 0,0089 Wk = 17 mWk.

  • За 80 лет жизни человек, который читает 1 час в день по 250 слов в минуту, прочитает 8,59 mWk.

  • Еncyclopædia Britannica – 1,1 mWk.

  • Сгоревшая Александрийская библиотека с 0,5 миллионами папирусов – это примерно 0,12 Wk.

  • До эпохи “глобального нейрослопа” в 2022 году ученые напечатали примерно 5,14 миллиона статей. Если принять, что в статье 4’500 слов, то это 0,50 Wk за год. Вот такой примерно годовой “выхлоп” от всех учёных на свете.

Крупные датасеты (>1 Wk):

  • В 2022 году издано примерно 1,75 миллиона книг. Если принять, что в книге 70’000 слов, то это 2,42 Wk за год.

  • Реддит (за всё время) – 13,3 Wk.

  • Российская государственная библиотека (“Ленинка”) – 37,0 Wk.

  • Библиотека Конгресса – 51,9 Wk.

  • Все расшифровки роликов со всего Youtube: 68,9 Wk.

  • Есть готовые крупные датасеты:

    • 2020: The Pile – 4,4 Wk

    • 2023: RedPajama – 17,9 Wk

    • 2024: FineWeb – 222 Wk

Закон Шиншиллы гласит, что при фиксированном вычислительном бюджете число обучающих токенов и размер модели следует увеличивать приблизительно пропорционально. Сама Chinchilla имела 70 млрд параметров и обучалась на 1,4 трлн токенов — ровно 20 токенов на параметр.

Если использовать ориентир 20 токенов на параметр, то модели на 1 трлн параметров (1T) для обучения потребуется: 296 Wk. И если такие данные ещё можно наскребсти из вышеприведенных датасетов, то где взять 296’000 Wk для 1 квадриллионной модели (1Q)? Вопрос – риторический.

  1. Или мы повышаем эффективность обучения в 200 раз и ломаем закон Шиншиллы: довольствуемся 0.1 токена на 1 параметр. Следовательно, потребуется либо радикально более эффективное использование данных, либо принципиально иной подход к обучению.

  2. Ну или же нам нужен прорыв: ИИ генерирует новые тексты с новым уникальным содержанием без нейрослопа. И желательно в больших количествах: >1’000 Wk. На данный момент обучать 1Q модель на синтетике — всё равно что пытаться сделать ксерокопию с ксерокопии. Без притока оригинальных идей новая модель быстро и гарантированно скатывается в деградацию и галлюцинации.

  3. Третьего не дано.

Написать сию статью меня сподвигло то, что в новостях подаётся важной информацией скупка антикварных немецких книг, с их последующей дигитализацией и уничтожением. Если 1 книга соответствует примерно 0.0014 mWk, уничтожение по 1’000 книг из 1’000 антикварных магазинов даст нам только 1,4 Wk. Да и что такого могли написать немцы в 19 веке, что является научным фактом, но неизвестно нынешней Википедии и иным современным источникам? Только, поди, детали биографии немецких поэтов-романтиков 19 века. То есть эта новость скорее похожа на информационный шум, чем на создание уникального датасета размером хотя бы в 1’000 Wk.

Хранение данных — не главная проблема

Англоязычную Википедию (без изображений) можно сжать до 11,7 Гб, следовательно, полная версия (1 Wk) может занимать 110 Гб, а для хранения 296 Wk необходимых для 1Т модели нам потребуется зарезервировать около 31,9 Тб пространства.

В целом, проблема с пространством для хранения данных для обучения не кажется актуальной. Ведь сегодня один жесткий диск емкостью 28 Тб может стоить всего 400 долларов США.

То есть гипотетическая 1Q модель сможет хранить свой датасет на носителях стоимостью порядка 0.4 миллиона долларов. Я тут проблемы не вижу.

Коррелирует ли число параметров с качеством модели?

Теперь перейдём к результатам, полученным недавно. Наблюдаем ли мы корреляцию между количеством параметров и результатами бенчмарков? Я считаю, что заслуживают внимания только два бенчмарка (источник):

  • GPQA был выпущен в 2023 году. Однако этот тест потерял свою точность либо в марте 2025 года, когда был достигнут результат в 80% (Gemini 2.5 набрал 84%), либо в ноябре 2025 года, когда был достигнут результат в 90% (Gemini 3 Pro набрал 93%).

  • HLE был выпущен в 2025 году. Первоначально ИИ набирали всего ≤8%, но теперь лучший результат составляет 51% (Gemini 3.1 pro). В HLE-Verified результаты моделей в среднем выросли на 7-10 процентных пунктов после проверки и исправления ряда вопросов.

Если логарифмировать число параметров и построить линейную регрессию, можно получить статистически значимый положительный наклон. Как для полного числа параметров, так и для активных параметров:

Зависимость GPQA и HLE от log10-трансформированного числа параметров/активных параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/

Зависимость GPQA и HLE от log10-трансформированного числа параметров/активных параметров. Данные взяты отсюда: https://lifearchitect.ai/models-table/

Ответ очевиден: большие модели обычно показывают более высокие результаты. Соответственно, 1Q модель теоретически должна была бы быть неплохой.

Замедлился ли прогресс в программировании?

Мы также можем отслеживать прогресс ИИ, используя его производительность в задачах программирования. Возьмем исторические модели от OpenAI и три модели, которые в настоящее время являются самыми сильными. Видно, что с 2022 по 2025 год наблюдался рост на 241 Elo баллов (с ChatGPT-3.5 до ChatGPT-5.2).

Но у меня есть стойкое ощущение, что позже рост остановился. С 2025 по 2026 год модели добавили всего 37 Elo баллов (с ChatGPT-5.2 до Claude fable-5). Не стоит забывать, что стандартная ошибка измерения (SE) здесь составляет 10-20 баллов Elo (усы погрешности на графике). На фоне двух ошибок в 10-20 Elo баллов каждая, разница в 37 Elo балов кажется ещё менее внушительной.

Динамика coding-рейтингa Elo. Линия на 1400 проведена в качестве референса, и может означать “среднюю” модель в рейтинге.

Динамика coding-рейтингa Elo. Линия на 1400 проведена в качестве референса, и может означать “среднюю” модель в рейтинге.

Конечно, разница в 241 Elo баллов с 2022 по 2025 год существенна. Это означает 80% вероятности выигрыша (1/(1+10^(-241/400)). Это впечатляющее соотношение побед/очков 4:1. Да, это весьма отличается от варианта 50%/50% (1:1). Таким образом, если мы исключим ничьи, и используем уровень значимости 5%, и выберем мощность анализа 80% (power analysis), ориентировочно понадобится 10 игр/сравнений, чтобы обнаружить такую ​​разницу.

Но как насчет 37 ± 18 баллов Elo, полученных от лучшей модели, выпущенной в 2025 году, по сравнению с лучшей моделью 2026 года? Это означает победу в 55,3% игр (1,106:1). Сколько игр нам нужно сыграть, чтобы увидеть такую ​​разницу? Я предполагаю, что нам нужно 348 сравнений, чтобы с вероятностью 80% обнаружить такую ​​разницу надежным способом. Как говорится, “овчинка не стоит выделки”.

Я признаю, что современные модели сильнее старых. Но мне кажется, это объясняется другим фактором. Назовём его “вниманием” (extended thinking). Модель может “думать” дольше. Так как Работа = Мощность × Время, время это тот параметр, где мы можем подождать в 10 раз дольше для получения лучшего результата. Уже сейчас топовые модели “задумываются” и “застывают” на 5-30 минут.

Но мой тезис в том, что мы не оценим, если машина будет “зависать” в 100-1’000 раз дольше. В сутках всего 24 × 60 = 1’440 минут. Мы не можем ждать ответа от ИИ в 1’000 раз дольше, чем за 1 минуту.

Но это было подмечено ещё до меня:

– Сорок два, – с бесконечным спокойствием сообщил компьютер.
В комнате долго стояла тишина. Краем глаза Пфоук видел за окном море напряженно ожидающих лиц.
– Нас линчуют, – прошептал он.
– Вы задали мне трудную задачку, – кротко пояснил компьютер.
– Сорок два?! – завопил Лункуал. – И это все, что ты можешь нам сказать после семи с половиной миллионов лет работы?
Дуглас Адамс, «Путеводитель для путешествующих автостопом по Галактике»

Выводы

  • Триллион параметров — уже не исторический рубеж. Он был преодолён в исследовательских MoE-моделях от Google ещё в 2021 году. Новое явление — появление практически применимых и открытых триллионных систем. Совершенно нормально, что новые модели ИИ начали использовать 1T параметров. Однажды они обязательно достигнут 20-50 T параметров. Но переход к 1Q (1 квадриллион = 1000 T = 1015) параметров маловероятен из-за отсутствия датасетов для обучения. Для обучения 1Q модели может потребоваться 300’000 Wk, что, как я считаю, сложно где-либо найти в ближайшее время (<10 лет). Обратите внимание что Википедии потребовалось примерно 20 лет, чтобы набрать 1 Wk. Реддит и YouTube, конечно же росли быстрее. Но и их контент во-первых менее ценен, а во-вторых давно перестал регулярно удваиваться.

  • Хранение корпуса необходимого для 1Q модели не является фундаментальной проблемой.

  • Существует много информационного шума, который отвлекает внимание от значимых вещей:

    • отсутствие новых датасетов. Всё сложнее найти, очистить и легально использовать достаточное количество новых высококачественных данных.

    • получение лучшего результата ценой экспоненциального увеличения времени, затраченного на “размышления”, и энергии (кВт·ч), визуально улучшающего ИИ с характеристиками неотличыми от более старых моделей. Закон убывающей отдачи встал во весь рост: каждый новый балл Elo теперь стоит астрономических денег, сотен новых датацентров и миллиардов киловатт-часов.

  • Рейтинги Elo застопорились начиная с 2025 года. Пока мы не увидим модель, которая превзойдёт текущие модели с разницей в рейтинге Elo не менее чем на 100 пунктов (а это всего-лишь 1:1,280 в победах/очках), нет причин беспокоиться о том, что мы что-то случайно упускаем в новостной ленте.

  • Мой основной тезис данного опуса заключается в том, что нынешние громкие выпуски моделей – минорные по своему существу. Закончу опус тремя мемами.

    Феерический слайд из презентации Сэма Альтмана. На слайде кто-то “навайбкодил” непойми что. Готов съесть свою шляпу, если найдется человек, который мне доходчиво и непротиворечиво объяснит смысл сего творения.

    Феерический слайд из презентации Сэма Альтмана. На слайде кто-то “навайбкодил” непойми что. Готов съесть свою шляпу, если найдется человек, который мне доходчиво и непротиворечиво объяснит смысл сего творения.
    Без слов.

    Без слов.
Без слов.

Без слов.

Автор: itrus

Источник