- BrainTools - https://www.braintools.ru -
Согласно закону заголовков Беттериджа [1] («Если заголовок заканчивается вопросительным знаком, на него можно ответить „нет“»), ответом на вопрос в заголовке будет „никогда“. И я попытаюсь вас в этом убедить.
Совсем недавно число параметров крупнейших языковых моделей выросло с миллиардов (billions, 109) до триллионов (trillions, 1012). Попробуем разобраться, когда был преодолён триллионный рубеж, сколько данных требуется таким моделям для обучения [2] и действительно ли прогресс LLM начал замедляться. Возможно, нам удастся экстраполировать, когда появятся модели с квадриллионом (1 quadrillion, 1Q, 1015) параметров?
Формально триллионный рубеж был преодолён ещё в начале 2021 года. Switch Transformer [3] от Google масштабировали примерно до 1,6 трлн параметров. Система использовала разреженную архитектуру (MoE), то есть для обработки конкретного токена активировалась только часть модели.
Поэтому корректнее говорить не о появлении триллионных моделей в 2024 году, а об их переходе из исследовательских экспериментов в практически применимые системы в 2025–2026 годах.
Теперь немного об активных параметрах, которых всегда меньше у MoE-моделей. Примерно в 20 раз. Например, открытая Kimi K3 имеет 2,8 трлн общих, но только 104 млрд активных параметров. То же самое творится и с флагманскими моделями от Claude: активных параметров там предположительно 150 миллиардов [4].
То есть, текущие модели уже могут и иметь пару триллионов параметров, активных параметров не бывает более 150 миллиардов. Соответственно наше движение к квадриллионну не такое уже и стремительное.
Чтобы упростить наши вычисления, давайте придумаем искусственную величину Wk (Wikipedia Token Unit).
Ниже я её подробно опишу:
Wikipedia Token Unit (Wk) — условный объём текста, равный приблизительному числу токенов во всех языковых разделах Википедии по состоянию на 1 августа 2026 года. Wk измеряет валовый объём токенов, а не количество уникальной информации. Переводы, дублирование статей и различия токенизации между языками отдельно не учитываются.
По состоянию на 1 августа 2026 года английская Википедия содержит ~5,2 млрд слов [5].
Примем соотношение 1500 слов = 2048 токенов [6] и получим примерно 1,365 токена на слово.
Есть оценка, что английская Википедия составляет 10,61% [7]. Предположим, что Википедии на всех языках вместе содержат в десять раз больше информации.
Суммарно, значит, в Википедии можно поживиться 5244576572*(2048/1500)*(100/10.61) = 6,749e10 токенами.
Естественно, что ежегодно Википедия растёт. Данный рост даже носил экспоненциальный характер. Но только до 2007 года. Сейчас рост составляет 2,5% [7] в год. И мы им можем пренебречь. Или же заботливо пометить, что Wk2026 ≈ 67,49×109 токенов. В дальнейших расчётах я буду использовать Wk, подразумевая под этим Wk2026.
Если вам нужны качественные данные, помимо Википедии вы можете выудить их и в других местах. Есть мелкие датасеты (<1 Wk):
На Хабре была прекрасная статья [9] об обучении ИИ на базе корпуса текстов всех статей самого Хабра. Там автор насчитал 0,0077 Wk в тексте и чуть больше информации в комментариях (0,0089 Wk). Суммарно это нам может дать немного, хоть ты изобретай миллиВики единицы: 0,0077 Wk + 0,0089 Wk = 17 mWk.
За 80 лет жизни человек, который читает 1 час в день по 250 слов в минуту, прочитает 8,59 mWk.
Еncyclopædia Britannica – 1,1 mWk.
Сгоревшая Александрийская библиотека с 0,5 миллионами папирусов – это примерно 0,12 Wk.
До эпохи “глобального нейрослопа” в 2022 году ученые напечатали примерно 5,14 миллиона статей. Если принять, что в статье 4’500 слов, то это 0,50 Wk за год. Вот такой примерно годовой “выхлоп” от всех учёных на свете.
Крупные датасеты (>1 Wk):
В 2022 году издано примерно 1,75 миллиона книг. Если принять, что в книге 70’000 слов, то это 2,42 Wk за год.
Реддит (за всё время) – 13,3 Wk.
Российская государственная библиотека (“Ленинка”) – 37,0 Wk.
Библиотека Конгресса – 51,9 Wk.
Все расшифровки роликов со всего Youtube: 68,9 Wk.
Есть готовые крупные датасеты:
2020: The Pile – 4,4 Wk
2023: RedPajama – 17,9 Wk
2024: FineWeb – 222 Wk
Закон Шиншиллы [9] гласит, что при фиксированном вычислительном бюджете число обучающих токенов и размер модели следует увеличивать приблизительно пропорционально. Сама Chinchilla имела 70 млрд параметров и обучалась на 1,4 трлн токенов — ровно 20 токенов на параметр.
Если использовать ориентир 20 токенов на параметр, то модели на 1 трлн параметров (1T) для обучения потребуется: 296 Wk. И если такие данные ещё можно наскребсти из вышеприведенных датасетов, то где взять 296’000 Wk для 1 квадриллионной модели (1Q)? Вопрос – риторический.
Или мы повышаем эффективность обучения в 200 раз и ломаем закон Шиншиллы: довольствуемся 0.1 токена на 1 параметр. Следовательно, потребуется либо радикально более эффективное использование данных, либо принципиально иной подход к обучению.
Ну или же нам нужен прорыв: ИИ генерирует новые тексты с новым уникальным содержанием без нейрослопа. И желательно в больших количествах: >1’000 Wk. На данный момент обучать 1Q модель на синтетике — всё равно что пытаться сделать ксерокопию с ксерокопии. Без притока оригинальных идей новая модель быстро и гарантированно скатывается в деградацию и галлюцинации.
Третьего не дано.
Написать сию статью меня сподвигло то, что в новостях подаётся важной информацией скупка антикварных немецких книг [10], с их последующей дигитализацией и уничтожением. Если 1 книга соответствует примерно 0.0014 mWk, уничтожение по 1’000 книг из 1’000 антикварных магазинов даст нам только 1,4 Wk. Да и что такого могли написать немцы в 19 веке, что является научным фактом, но неизвестно нынешней Википедии и иным современным источникам? Только, поди, детали биографии немецких поэтов-романтиков 19 века. То есть эта новость скорее похожа на информационный шум, чем на создание уникального датасета размером хотя бы в 1’000 Wk.
Англоязычную Википедию (без изображений) можно сжать до 11,7 Гб [11], следовательно, полная версия (1 Wk) может занимать 110 Гб, а для хранения 296 Wk необходимых для 1Т модели нам потребуется зарезервировать около 31,9 Тб пространства.
В целом, проблема с пространством для хранения данных для обучения не кажется актуальной. Ведь сегодня один жесткий диск емкостью 28 Тб может стоить всего 400 [12] долларов США.
То есть гипотетическая 1Q модель сможет хранить свой датасет на носителях стоимостью порядка 0.4 миллиона долларов. Я тут проблемы не вижу.
Теперь перейдём к результатам, полученным недавно. Наблюдаем ли мы корреляцию между количеством параметров и результатами бенчмарков? Я считаю, что заслуживают внимания [13] только два бенчмарка (источник [14]):
GPQA [15]был выпущен в 2023 году. Однако этот тест потерял свою точность либо в марте 2025 года, когда был достигнут результат в 80% (Gemini 2.5 набрал 84%), либо в ноябре 2025 года, когда был достигнут результат в 90% (Gemini 3 Pro набрал 93%).
HLE [16]был выпущен в 2025 году. Первоначально ИИ набирали всего ≤8%, но теперь лучший результат составляет 51% (Gemini 3.1 pro). В HLE-Verified результаты моделей в среднем выросли на 7-10 процентных пунктов после проверки и исправления ряда вопросов.
Если логарифмировать число параметров и построить линейную регрессию, можно получить статистически значимый положительный наклон. Как для полного числа параметров, так и для активных параметров:
Ответ очевиден: большие модели обычно показывают более высокие результаты. Соответственно, 1Q модель теоретически должна была бы быть неплохой.
Мы также можем отслеживать прогресс ИИ, используя его производительность в задачах программирования. Возьмем исторические модели от OpenAI и три модели, которые в настоящее время являются самыми сильными. Видно, что с 2022 по 2025 год наблюдался рост на 241 Elo баллов (с ChatGPT-3.5 до ChatGPT-5.2).
Но у меня есть стойкое ощущение, что позже рост остановился. С 2025 по 2026 год модели добавили всего 37 Elo баллов (с ChatGPT-5.2 до Claude fable-5). Не стоит забывать [17], что стандартная ошибка [18] измерения (SE) здесь составляет 10-20 баллов Elo (усы погрешности на графике). На фоне двух ошибок в 10-20 Elo баллов каждая, разница в 37 Elo балов кажется ещё менее внушительной.
Конечно, разница в 241 Elo баллов с 2022 по 2025 год существенна. Это означает 80% вероятности выигрыша (1/(1+10^(-241/400) [19]). Это впечатляющее соотношение побед/очков 4:1. Да, это весьма отличается от варианта 50%/50% (1:1). Таким образом, если мы исключим ничьи, и используем уровень значимости 5%, и выберем мощность анализа 80% (power analysis), ориентировочно понадобится 10 игр/сравнений [20], чтобы обнаружить такую разницу.
Но как насчет 37 ± 18 баллов Elo, полученных от лучшей модели, выпущенной в 2025 году, по сравнению с лучшей моделью 2026 года? Это означает победу в 55,3% игр (1,106:1). Сколько игр нам нужно сыграть, чтобы увидеть такую разницу? Я предполагаю, что нам нужно 348 сравнений [20], чтобы с вероятностью 80% обнаружить такую разницу надежным способом. Как говорится, “овчинка не стоит выделки”.
Я признаю, что современные модели сильнее старых. Но мне кажется, это объясняется другим фактором. Назовём его “вниманием” (extended thinking). Модель может “думать” дольше. Так как Работа = Мощность × Время, время это тот параметр, где мы можем подождать в 10 раз дольше для получения лучшего результата. Уже сейчас топовые модели “задумываются” и “застывают” на 5-30 минут.
Но мой тезис в том, что мы не оценим, если машина будет “зависать” в 100-1’000 раз дольше. В сутках всего 24 × 60 = 1’440 минут. Мы не можем ждать ответа от ИИ в 1’000 раз дольше, чем за 1 минуту.
Но это было подмечено ещё до меня:
– Сорок два, – с бесконечным спокойствием сообщил компьютер.
В комнате долго стояла тишина. Краем глаза Пфоук видел за окном море напряженно ожидающих лиц.
– Нас линчуют, – прошептал он.
– Вы задали мне трудную задачку, – кротко пояснил компьютер.
– Сорок два?! – завопил Лункуал. – И это все, что ты можешь нам сказать после семи с половиной миллионов лет работы?
Дуглас Адамс, «Путеводитель для путешествующих автостопом по Галактике»
Триллион параметров — уже не исторический рубеж. Он был преодолён в исследовательских MoE-моделях от Google ещё в 2021 году. Новое явление — появление практически применимых и открытых триллионных систем. Совершенно нормально, что новые модели ИИ начали использовать 1T параметров. Однажды они обязательно достигнут 20-50 T параметров. Но переход к 1Q (1 квадриллион = 1000 T = 1015) параметров маловероятен из-за отсутствия датасетов для обучения. Для обучения 1Q модели может потребоваться 300’000 Wk, что, как я считаю, сложно где-либо найти в ближайшее время (<10 лет). Обратите внимание что Википедии потребовалось примерно 20 лет, чтобы набрать 1 Wk. Реддит и YouTube, конечно же росли быстрее. Но и их контент во-первых менее ценен, а во-вторых давно перестал регулярно удваиваться.
Хранение корпуса необходимого для 1Q модели не является фундаментальной проблемой.
Существует много информационного шума, который отвлекает внимание от значимых вещей:
отсутствие новых датасетов. Всё сложнее найти, очистить и легально использовать достаточное количество новых высококачественных данных.
получение лучшего результата ценой экспоненциального увеличения времени, затраченного на “размышления”, и энергии (кВт·ч), визуально улучшающего ИИ с характеристиками неотличыми от более старых моделей. Закон убывающей отдачи встал во весь рост: каждый новый балл Elo теперь стоит астрономических денег, сотен новых датацентров и миллиардов киловатт-часов.
Рейтинги Elo застопорились начиная с 2025 года. Пока мы не увидим модель, которая превзойдёт текущие модели с разницей в рейтинге Elo не менее чем на 100 пунктов (а это всего-лишь 1:1,280 в победах/очках), нет причин беспокоиться о том, что мы что-то случайно упускаем в новостной ленте.
Мой основной тезис данного опуса заключается в том, что нынешние громкие выпуски моделей – минорные по своему существу. Закончу опус тремя мемами.
Автор: itrus
Источник [21]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33860
URLs in this post:
[1] закону заголовков Беттериджа: https://ru.wikipedia.org/wiki/%D0%97%D0%B0%D0%BA%D0%BE%D0%BD_%D0%B7%D0%B0%D0%B3%D0%BE%D0%BB%D0%BE%D0%B2%D0%BA%D0%BE%D0%B2_%D0%91%D0%B5%D1%82%D1%82%D0%B5%D1%80%D0%B8%D0%B4%D0%B6%D0%B0
[2] обучения: http://www.braintools.ru/article/5125
[3] Switch Transformer: https://arxiv.org/pdf/2101.03961
[4] https://lifearchitect.ai/models-table/: https://lifearchitect.ai/models-table/
[5] ~5,2 млрд слов: https://en.wikipedia.org/wiki/Wikipedia:Size_in_volumes
[6] 1500 слов = 2048 токенов: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
[7] 10,61%: https://en.wikipedia.org/wiki/Wikipedia%3ASize_of_Wikipedia
[8] источник: https://en.wikipedia.org/wiki/Wikipedia%3ASize_of_Wikipedia#/media/File:Size_of_English_Wikipedia_(Printable-version_tool_method).jpg
[9] прекрасная статья: https://habr.com/ru/articles/1054710/
[10] скупка антикварных немецких книг: https://www.theguardian.com/technology/2026/aug/02/australian-book-sellers-alarm-destruction-rare-titles-ai-supply-chain
[11] 11,7 Гб: https://browse.library.kiwix.org/#lang=eng&category=wikipedia
[12] 400: https://www.techradar.com/best/large-hard-drives-and-ssds#section-the-largest-hdd-on-the-market
[13] внимания: http://www.braintools.ru/article/7595
[14] источник: https://epoch.ai/benchmarks?view=graph&tab=benchmarks&benchmark-selection=%7EGPQA+diamond%7Ehle
[15] GPQA : https://arxiv.org/abs/2311.12022
[16] HLE : https://arxiv.org/abs/2501.14249
[17] забывать: http://www.braintools.ru/article/333
[18] ошибка: http://www.braintools.ru/article/4192
[19] 1/(1+10^(-241/400): https://wismuth.com/elo/calculator.html#rating1=1400&rating2=1600&formula=normal&best_of=10
[20] 10 игр/сравнений: https://www.socscistatistics.com/utilities/power/calculator/
[21] Источник: https://habr.com/ru/articles/1065320/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1065320
Нажмите здесь для печати.