- BrainTools - https://www.braintools.ru -

Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля

В октябре 2025-го Андрей Карпатый выложил nanochat [1] — «лучший ChatGPT, который можно купить за $100»: полный пайплайн от токенизатора до веб-чата, четыре часа на арендованной ноде. Еще в декабре 2024-го DeepSeek опубликовал техотчет V3 [2] с цифрой $5,576 млн за обучение [3]. А в конце января 2025-го, на волне выхода R1, заголовки «китайцы сделали GPT-4 за шесть миллионов» несколько дней трясли и прессу, и биржу. А два дня назад прямо здесь, на Хабре, вышла habrGPT [4] — модель 0.5B, обученная с нуля на статьях Хабра на одной RTX 5090, с претрейном за ~6 часов.

Все три цифры честные. И все три почти ничего не говорят о том, сколько стоит обучить языковую модель — потому что за словами «обучить LLM» прячется лестница в семь порядков: от десятков долларов до миллиарда. На каждой ступени за деньги покупают разное, и путать ступени дорого. Я работаю CTO ML-команды, и выбор «взять открытые веса / дообучить / обучить с нуля» — это расчет, который мы проделываем регулярно. Ниже — вся лестница с числами и первоисточниками: что реально обучить на игровой карте под столом, где начинается аренда кластера, из чего складывается смета фронтир-модели и какие грабли задокументированы на каждом этаже.

Сразу разведу два слова, которые на Хабре постоянно склеиваются. Обучение с нуля (pretraining) — это когда веса инициализируются случайным шумом и модель с чистого листа прогоняют через триллионы токенов текста. Дообучение (fine-tuning, LoRA и прочее) — когда берут готовые веса и дообучают на своих данных; это на два-три порядка дешевле, и половина статей «как я обучил GPT дома» на самом деле про него. Входящие запросы «обучите нам свою модель» после первого созвона тоже почти всегда оказываются про файнтюн. Здесь — только про «с нуля». Если ваша задача звучит как «чтобы модель знала наши документы», вам почти наверняка нужен файнтюн или RAG, и дальше можно читать из чистого любопытства.

Салфетка: как посчитать любую модель

Вся экономика претрейна выводится из одной формулы. Стоимость обучения трансформера в операциях с плавающей точкой:

C ≈ 6 · N · D

где N — число параметров, D — число токенов обучения. Множитель шесть складывается так: примерно 2 FLOP на параметр на токен в forward-проходе, и еще вдвое больше в backward. Формула — из работы Kaplan et al. 2020 [5] (раздел 2.1, оценка без учета embedding и attention-членов), и ее же использует Epoch AI [6] как основной способ оценивать компьют чужих моделей, когда известны параметры и данные. Для MoE-моделей (mixture of experts: на каждом токене работает только часть весов) N — это активные параметры; эмпирически множитель гуляет в диапазоне 5–8, но для сметы на салфетке шестерки достаточно.

Дальше два действия. Делим C на реальную скорость железа, получаем секунды. Умножаем на цену часа, получаем деньги. Реальная скорость — это пиковые TFLOPS карты, умноженные на MFU (model FLOPs utilization) — долю пика, которая идет в полезные вычисления модели; остальное тонет в обменах по сети, пузырях пайплайна, рекомпутации активаций и ожидании отстающих нод. Ориентиры из практики: GPT-3 в 2020-м обучалась с MFU 21,3%, PaLM в 2022-м — 46,2% (таблица из статьи PaLM [7]), MegaScale от ByteDance выжал 55,2% на 12 288 GPU [8], а на одной ноде без сетевых потерь llm.c держит около 60%. Закладывайте 40–50% и не сильно ошибетесь.

Проверим формулу на известном ответе. GPT-2 124M на 10 млрд токенов: 6 × 124e6 × 10e9 ≈ 7,4e18 FLOP. Нода 8×A100 при 60% MFU дает ~1,5e15 FLOP/с — получается ~83 минуты. Фактический результат llm.c — 90 минут и ~$20 [9]; этим же приемом ниже будем проверять чужие пресс-релизы. Эту салфетку я рисую в каждом втором пресейле, когда приходят с «хотим свою LLM»: шесть-эн-дэ, посчитанное маркером прямо при заказчике, отрезвляет быстрее любого слайда про риски.

Второй столп экономики — сколько токенов вообще нужно. Chinchilla [10] (DeepMind, 2022) вывела compute-optimal пропорцию: ~20 токенов на параметр, и модели того времени оказались, по формулировке авторов, «significantly undertrained». С тех пор пропорция уехала на порядки — и осознанно: обучение платится один раз, инференс — миллиарды раз, поэтому выгодно брать модель поменьше и заливать в нее данных сильно больше оптимума. Llama 3 8B обучена на 15+ трлн токенов — ~1875 токенов на параметр [11], в 90 раз дальше Chinchilla, и качество продолжало расти. Формализация этой логики — inference-optimal скейлинг [12]. Цену модели, выходит, задает в основном D — а данные нынче меряют триллионами.

Карта лестницы, по которой пойдем (все цифры разобраны ниже по тексту):

Ярус

Железо

Что получается

Порядок цены

1. Дом

1× RTX 5090

GPT-2-класс, «связный текст»

$30–700 (аренда — от $10)

2. Нода

8× H100, часы–сутки

nanochat-класс, «детсадовец с энциклопедией»

$50–1000

3. Малый кластер

сотни–тысяча GPU, недели–месяцы

продовые 3–30B (SmolLM3, OLMo)

$0,5–3 млн

4. Большой кластер

тысячи GPU, месяцы

DeepSeek-V3-класс

$6–20 млн за ран, миллиарды капекса

5. Фронтир

16К–100К+ GPU

GPT-4/5, Gemini, Grok

$40 млн — $1 млрд+

«лестница ярусов»: логарифмическая ось долларов от $40 до $1B

«лестница ярусов»: логарифмическая ось долларов от $40 до $1B

Голая модель — это Т9

Прежде чем считать деньги дальше, надо ответить на вопрос, что именно получаешь за них сразу после претрейна. Потому что получаешь — Т9. Очень дорогой, очень начитанный Т9. Это разграничение мне приходится проговаривать почти в каждом разговоре, где «обучить свою LLM» и «сделать чат-бота» считают одной задачей, — между ними два-три порядка бюджета.

Базовая модель после претрейна умеет ровно одно: продолжать текст так, как он статистически продолжался бы в ее обучающем корпусе. Напишете ей «Привет» — и вместо ответа получите «— сказала Маша и закрыла дверь»: модель дописывает документ, в который вы, с ее точки зрения [13], попали, а в интернет-текстах после реплики в кавычках обычно идет ремарка из художки, продолжение форумного треда или еще десяток реплик подряд. Карпатый формулирует это одной строкой [14]: «Base models are not assistants, they just want to complete internet documents». Документация HuggingFace говорит то же самое [15] суше: чат-модели — это все еще языковые модели, чат для них — просто особый вид текста.

Классическое демо — из анонса InstructGPT [16] (OpenAI, 2022). Промпт: «Объясни шестилетнему ребенку высадку на Луну в нескольких предложениях». Голая GPT-3 отвечает… еще несколькими похожими заданиями: «Объясни шестилетнему теорию гравитации», «Объясни шестилетнему теорию относительности». Логика [17] та же: в вебе списки упражнений встречаются чаще, чем упражнение с готовым ответом под ним, и модель просто продолжила самый вероятный документ. На этом же свойстве стоит few-shot промптинг из статьи GPT-3 [18]: показываешь три примера «вход → выход», и модель продолжает паттерн, без всякого дообучения.

Ассистентом эту дополнялку делает пост-трейнинг, и его механика проще, чем звучит.

Шаг первый — SFT, supervised fine-tuning. Модели показывают десятки тысяч примеров документов одного специального жанра: «реплика пользователя → реплика вежливого и полезного помощника». Жанр она схватывает так же, как схватила стиль художки и форумов. Теперь на «Привет» она дополняет текст репликой персонажа-ассистента: «Привет! Чем могу помочь?» Под капотом ничего не поменялось — это тот же Т9, просто ему подсунули документ, в котором следующим по сценарию пишет помощник.

Шаг второй — RLHF, обучение с подкреплением [19] на человеческих предпочтениях. SFT задает роль, RL шлифует, какие именно реплики этой роли предпочитать. Люди попарно сравнивают ответы модели, на сравнениях учится reward-модель — функция «насколько такой ответ понравился бы человеку», — и дальше основную модель дообучают подкреплением так, чтобы этот сигнал рос (канонический разбор пайплайна [20]). Модель начинает играть роль ассистента, смещаясь от среднего по датасету к лучшим, по оценкам людей, примерам.

Цифры под этот тезис в статье InstructGPT [21] выписаны прямо. Датасеты пост-трейна: ~13 тыс. промптов на SFT, ~33 тыс. на reward-модель, ~31 тыс. на RL — против сотен миллиардов токенов претрейна. Компьют: SFT для 175B-модели — 4,9 петафлопс-дней, RLHF — 60, претрейн GPT-3 — 3640. Вся «личность» ассистента — менее 2% вычислений, тонкая пленка поверх толщи претрейна. И эффект этой пленки поразительный: ответы InstructGPT со скромными 1,3 млрд параметров люди предпочитали ответам голой GPT-3 со 175 миллиардами — модели, в сто раз большей (оговорка: на распределении реальных запросов к API, где важна полезность ответа; на академических бенчмарках картина скромнее). Почти весь бюджет уходит в знания; «личность» ассистента докупается процентами сверху.

Технически «диалог» так и остается одним сплошным текстом. Переписка с чат-ботом склеивается в документ со служебными токенами — в духе <|im_start|>user … <|im_end|> <|im_start|>assistant (формат ChatML [22]; разметка у всех своя, поэтому HuggingFace завел chat templates), — и модель дополняет его после токена assistant. Ассистент — персонаж сценария, системный промпт — задание этому персонажу, а сама базовая модель — симулятор, умеющий играть кого угодно [23]; по моему опыту [24], эта рамка объясняет поведение [25] LLM в проде лучше любой другой.

У истории есть свежее продолжение — RL с проверяемыми наградами, RLVR. В январе 2025-го DeepSeek показал R1-Zero [26]: подкрепление применили прямо к базовой модели, минуя SFT, с наградой за проверяемо правильный ответ (математика [27], код). Точность на олимпиадной математике AIME выросла с 15,6% до 71%, а по ходу обучения модель спонтанно выучила перепроверять саму себя — в статье приведен момент, когда она посреди решения пишет «Wait, wait. Wait. That’s an aha moment I can flag here» и начинает заново, хотя специально этому ее никто не учил.

Правда, разговаривала R1-Zero как гений [28] с расстройством речи — мешала английский с китайским и писала нечитаемо, поэтому в финальный R1 вернули SFT-фазу [26] с читабельными цепочками рассуждений. Даже когда RL работает на голой базе, человеческий интерфейс модели все равно делает SFT. Цена вопроса — по данным самой DeepSeek в рецензируемой публикации в Nature [29]: финальные прогоны всего R1-пайплайна поверх готовой V3 — около $294 тыс. против ~$5,6 млн за базу (та же бухгалтерия «только финальный ран», что и у цифры V3). Пять процентов сверху — за превращение Т9 в рассуждающего собеседника.

Когда дальше по тексту написано «обучить LLM с нуля стоит X», читайте: X — это цена претрейна, цена базы. Пост-трейн добавит проценты компьюта (и заметные деньги на человеческую разметку, если делать ее как следует). Дешевым «превращением в чат-бота» и пользуется nanochat, к которому мы возвращаемся — уже с калькулятором в руках.

Ярусы 1–2: RTX 5090 под столом и нода в аренду

Начнем с голых спеков. RTX 5090 [30]: 32 ГБ GDDR7 на 512-битной шине, 1792 ГБ/с пропускной способности памяти [31], ~105 TFLOPS в FP32 и порядка 210 TFLOPS плотного BF16 на тензорных ядрах, 575 Вт TDP, рекомендованная цена $1999. Маркетинговые «3352 AI TOPS» с презентаций — это FP4 со sparsity; для претрейна ориентируйтесь на BF16-цифру, она в шестнадцать раз скромнее.

Первый потолок домашнего претрейна — память, и он считается на пальцах. Классический рецепт mixed-precision AdamW требует ~16 байт на параметр [32]: 2 байта на вес в BF16, 2 на градиент, и 12 на состояния оптимизатора (FP32-копия весов плюс два момента Adam). В 32 ГБ таким образом влезает модель на ~2 млрд параметров — и это еще до активаций, которые при длинном контексте съедают память со зверским аппетитом. Планку двигают gradient checkpointing (память в обмен на повторный forward [33] — примерно треть компьюта сверху) и 8-битные оптимизаторы; крайняя точка трюкачества — LLMQ [34], полностью 8-битный претрейн, в котором 7B-модель влезает на одну 16-гиговую игровую карту. Влезть-то влезает, но считаться будет месяцами: трюки памяти всегда платят временем.

Что на этом железе реально обучить, удобно показывать лестницей учебных проектов Карпатого — она вся открыта и повторяема.

nanoGPT [35] — минимальный учебный претрейн-скрипт, по которому разбираются в архитектуре трансформера. Построчные разборы уже есть на Хабре [36], не буду отнимать хлеб.

llm.c [9] — тот же GPT-2, переписанный в ~5 тыс. строк C/CUDA. Репродукция GPT-2 124M: 90 минут на ноде 8×A100 и ~$20 аренды (10 млрд токенов FineWeb, ~60% MFU). Репродукция флагманского GPT-2 1.6B — 24 часа на 8×H100 и $672 [37]. Для одной 5090 масштаб такой: комьюнити-спидран воспроизводит GPT-2 124M за ~90–115 минут на одной RTX 4090 [38]; 5090 по BF16-мощности на четверть-треть быстрее, так что «GPT-2 за вечер на своей карте» — консервативная оценка, без всякой поэтической вольности.

nanochat [1] — полный конвейер ChatGPT-клона в ~8 тыс. строк: свой токенизатор, претрейн на FineWeb-Edu, SFT-диалоги, опциональный RL на школьной математике, инференс с веб-мордой. Тот самый «ChatGPT за $100»: релизный спидран [39] — 3 часа 51 минута на 8×H100 по ~$24/час, итого ~$92. Разбивка времени внутри рана возвращает к прошлому разделу: часы уходят на претрейн базы, стадия «сделать из Т9 собеседника» (midtraining на диалогах + SFT) занимает минуты. Качество за эти деньги Карпатый описывает как «разговор с детсадовцем»: связная речь, зачатки здравого смысла, уверенные галлюцинации. По метрике CORE (агрегат из двух десятков бенчмарков для базовых моделей из проекта DCLM) релизная модель обходила GPT-2 large, но до полного GPT-2 1.6B не дотягивала; к 2026-му спидраны добрались и до него — об этом ниже.

На одной 5090 nanochat тоже живет — README прямо описывает деградацию на gradient accumulation (градиенты мелких батчей копятся в один шаг оптимизатора — эмуляция большого батча на маленькой карте) с «теми же результатами, но в 8 раз дольше». Практика из обсуждений репозитория [40]: полный спидран на одной 5090 экстраполировали в ~17 дней (ран не довели до конца), на двух картах после твиков — оценка ~28 часов, причем device batch size пришлось резать с 32 до 8, а чтобы параллельно жил открытый браузер — до 4. Уменьшенный конфиг d16 на арендованной 5090 за ~$0,35/час оценивают в 10–30 часов [39] до «приличного результата». Быт домашнего претрейна в одной строке коммита: закрой Chrome, освободи VRAM.

Свежая habrGPT [4] на практике выяснила, что TMEM, нужная FlashAttention 3, физически есть только в серверном Blackwell — на потребительской 5090 расчет на FA3 «разрушился». Потребительская и датацентровая карты одного поколения — разные звери. Мы этот класс граблей регулярно ловим с другой стороны, в CV: отлаженное на облачной A100 ведет себя иначе на железке, которая реально поедет в цех, — поэтому тесты гоняем на том железе, где будет жить прод.

Отдельного разговора стоит динамика цен. Обучение GPT-2 в 2019-м оценивали в десятки тысяч долларов (широко цитируемая оценка — ~$43 тыс.; OpenAI официальную цифру не публиковал). Дальше кривая пошла вниз без остановок: $672 за полный 1.6B в llm.c (2024) → $73 за nanochat-модель, побившую GPT-2 по CORE [41] (3 часа на 8×H100, январь 2026) → ~$40–50 к лету 2026-го на FP8 и более плотных датасетах, по комьюнити-лидерборду Time-to-GPT-2 в README nanochat [1]. Сам Карпатый сформулировал эмпирический закон: цена обучения GPT-2 каждый год падает примерно до 40% прошлогодней. А в жанре «124M до фиксированного лосса» параллельный спидран modded-nanogpt [42] дожал время до 1,32 минуты на 8×H100 — сорок центов аренды за то, что в 2019-м было state of the art. Из этого же лидерборда вырос оптимизатор Muon, уехавший потом в серьезные продовые претрейны [43]: гаражные спидраны иногда меняют индустрию.

иллюстрация 2 — график дефляции GPT-2: лог-ось Y в долларах

иллюстрация 2 — график дефляции GPT-2: лог-ось Y в долларах

Остался вопрос, что за модель получается за эти деньги. Связную грамотную речь выдают даже крошечные модели — TinyStories [44] показала это на моделях меньше 10 млн параметров, обученных на узком синтетическом корпусе с детским словарем. Связность — дешевая эмерджентность. Бюджет уходит на другое: широту знаний, устойчивость к формулировкам, следование инструкциям, редкость галлюцинаций. Между «моделью, которая складно пишет» и «моделью, которой можно доверить задачу» лежит разрыв в три-четыре порядка бюджета. И это главный ответ на вопрос «зачем кому-то кластеры, если GPT-2 обучается за вечер».

Почему нельзя собрать кластер из десяти ПК

Идея напрашивается сама — я слышал ее и от джунов, и от заказчиков, у которых после пилота простаивает пара машин с GPU: если одна 5090 — это GPT-2 за вечер, то десять машин у друзей — уже почти нода. Посчитаем, обо что это разбивается.

При data-параллелизме — самом простом способе распределить обучение — каждая карта держит копию модели и считает свой кусок батча, но после каждого шага все карты обязаны обменяться градиентами и усреднить их. Объем обмена — порядка размера модели, у ring all-reduce — стандартной кольцевой схемы такого обмена — примерно двукратный объем градиентов за шаг. Для модели на 1 млрд параметров в BF16 это ~4 ГБ трафика на каждый шаг оптимизатора, а шагов в претрейне — сотни тысяч.

Теперь полки, по которым этот трафик ездит. NVLink 4 внутри серверной ноды H100 — 900 ГБ/с суммарной полосы на GPU [45]. InfiniBand NDR между нодами — 400 Гбит/с ≈ 50 ГБ/с на порт. Домашний гигабитный Ethernet — 0,125 ГБ/с. Между первым и последним — три-четыре порядка. На гигабите обмен четырьмя гигабайтами занимает полминуты, за которые карта успела бы посчитать десятки шагов: GPU в такой схеме простаивают почти все время, и десять машин по сети дают производительность заметно ниже одной. Плюс у потребительских карт NVIDIA срезала NVLink еще на поколении 4090 — две 5090 в одном корпусе общаются только через PCIe, так что даже «мини-DGX на столе» упирается в шину.

Известное исключение — INTELLECT-1 [46]: модель 10B обучили целиком через интернет на 112 H100, раскиданных по трем континентам. Фокус в алгоритме DiLoCo: внутренние шаги локальны, синхронизация редкая, плюс int8-сжатие обменов — суммарно ~400-кратное сокращение трафика против наивного all-reduce, и все равно MFU вышел 36–41% — заметно ниже тех 50–60%, что то же железо выдает в одном машинном зале. Распределенный претрейн через интернет существует — как спецтехника с фундаментально другой математикой; наивный all-reduce по Wi-Fi превращает десять видеокарт в обогреватели с подпиской на роутер.

Для полноты — словарь параллелизмов одним абзацем, потому что дальше он понадобится. Data parallelism: копии модели, синхронизация градиентов. Tensor parallelism: режем сами матрицы между картами — общение на каждом слое, живет только на NVLink. Pipeline parallelism: режем модель по слоям на этапы конвейера — дешевле по трафику, платим «пузырями» в расписании. FSDP/ZeRO: шардируем веса и состояния оптимизатора по картам, чтобы 16 байт на параметр делились на весь кластер (ZeRO [47]). Фронтир-раны комбинируют все сразу — Llama 3 обучалась с 4D-параллелизмом. Дома из этого зоопарка не нужно ничего: ваш параллелизм на одной карте называется gradient accumulation.

Ярус 3: маленькая продовая модель

Между «GPT-2 за вечер» и фронтиром лежит ярус, о котором пишут реже всего, — модели 1–7B, которые реально ставят в продукты. Здесь спидраны сменяются взрослой бухгалтерией, и благодаря двум командам, выложившим ее в открытую, мы знаем эту бухгалтерию в деталях.

Первое, что меняется, — данные. Compute-optimal по Chinchilla для трехмиллиардной модели — ~60 млрд токенов. Реальные продовые модели этого размера обучаются на порядки дальше: SmolLM2 135M — 2 трлн токенов, 1.7B — 11 трлн (техотчет [48]). Причина — та самая inference-optimal логика: маленькую модель, которую будут дергать миллиарды раз, выгодно кормить до упора. 11 трлн токенов на одной 5090 — это годы непрерывного счета; ярус 3B начинается с аренды сотен GPU.

11,2 трлн токенов, 384 H100 и почти месяц — ~276 тыс. GPU-часов основного рана: так выглядит смета SmolLM3-3B [49] от Hugging Face (июль 2025). Самое ценное в их Smol Training Playbook [50] — цифра, которую обычно прячут: абляции (контрольные прогоны, где меняют один фактор — данные, архитектуру, гиперпараметр — и смотрят на эффект), калибровка и дебаг съели еще ~161 тыс. GPU-часов — «больше половины стоимости основного рана», дословно по плейбуку.

Там же задокументирован баг, который я бы вставлял в рамочку в каждом учебнике распределенного обучения. Все GPU внутри tensor-parallel-группы инициализировались одним random seed. Веса получились коррелированными там, где обязаны быть независимыми. На кривой лосса — ничего: она падала как положено, обучение выглядело здоровым. Проблема всплыла на даунстрим-евалах, когда в ран уже влили ~1 трлн токенов. Перезапустили с нуля. Один невинный seed — минус триллион токенов бюджета; дешевая страховка от такого — гонять евалы с первых часов рана, чем команда себя и спасла. Вторая их находка скучнее, но типичнее: кастомный даталоадер с растущим внутренним индексом периодически ронял throughput, и его в итоге откатили на проверенный из прошлого проекта. Правило масштабируется на любой размер: когда у нас проседает скорость обучения, первым подозреваемым идет даталоадер, вторым — сеть до хранилища, и только потом сама модель.

Самый прозрачный претрейн современности выложила Ai2 в ноябре 2025-го: у Olmo 3 [51] открыты веса, данные, код, чекпоинты и логи. По техрепорту [52], полный цикл 32B-модели — 56 дней на кластере 1024 H100, что сама Ai2 конвертирует по ставке $2/H100-час в $2,75 млн (претрейн + мид-трейн + long-context + пост-трейн, включая рестарты). Чистый претрейн — цифры, которые команда назвала отдельно (разбор с арифметикой [53]): 234 тыс. H100-часов у 7B ($0,47 млн) и 1,05 млн у 32B ($2,1 млн). Это конверсия по рыночной ставке аренды, без раннего экспериментирования и зарплат. Ai2 раскрыла и энергетику: ~146 МВт·ч на претрейн 7B и ~681 МВт·ч на 32B — только сами GPU, без учета остальной системы и охлаждения. Продовая модель 3–30B под ключ, выходит, — от полумиллиона до трех миллионов долларов аренды, месяц-два календаря и скрытая половина бюджета на абляции, о которой не пишут в анонсах; данные при этом — бесплатные открытые корпуса.

Ярусы 4–5: большой кластер и фронтир, или как читать чужие сметы

Здесь начинается территория, где цифры публикуют пресс-службы, и главный навык — понимать, что именно в цифру вошло. Сразу зафиксирую позицию: фронтир-раны я видел только в чужих техотчетах — эту часть лестницы считаю со стороны заказчика, с калькулятором и первоисточниками, а не изнутри лаборатории. Потому и ссылок здесь столько: опыт, которого у меня нет, заменяю проверяемыми цифрами.

Эталонный случай — техотчет DeepSeek-V3 [2]: 2,788 млн GPU-часов H800, при ставке $2/час — те самые $5,576 млн. Внутри: 2,664 млн часов претрейна (14,8 трлн токенов, меньше двух месяцев на кластере 2048 H800), 119 тыс. на расширение контекста, 5 тыс. на пост-трейн. А теперь дословная оговорка из того же отчета, которую потеряли все заголовки: цифра покрывает «only the official training of DeepSeek-V3, excluding the costs associated with prior research and ablation experiments on architectures, algorithms, or data». В цифру вошел только финальный ран — без исследований, без абляций (у SmolLM3 это была половина бюджета), без зарплат и без железа. Причем $2/час — это гипотетическая аренда: кластер у компании собственный.

SemiAnalysis оценивал [54] парк DeepSeek/High-Flyer в ~50 тыс. GPU семейства Hopper с серверным капексом ~$1,6 млрд — оценка спорная, но порядок разрыва между «ценой рана» и «ценой возможности его запустить» она передает верно. «Модель за $6 млн» и «компания с миллиардной инфраструктурой» — оба утверждения правдивы одновременно.

Тот же навык чтения применим к любой цифре из новостей. Стоимость обучения GPT-4: ~$40 млн амортизированного железа и энергии по методике Epoch AI [55], ~$63 млн за претрейн по оценке SemiAnalysis (~25 тыс. A100, 90–100 дней), ~$78 млн в пересчете на облачную аренду по Stanford AI Index, «больше ста миллионов» со слов Альтмана. Все четыре цифры об одной модели — просто меряют разное. Когда видите точную цифру стоимости обучения без указания методики, вы видите маркетинг.

Оговорка о периметре: все здесь посчитано в NVIDIA-часах, потому что по ним существует рынок аренды и публичные ставки. TPU Google и Trainium Amazon живут внутри своих облаков, наружных цен у них нет — но салфетка 6·N·D работает и для них.

Llama 3 405B обучалась на до 16 384 H100 одновременно [56] — 15,6 трлн токенов, 3,8×10²⁵ FLOP; по нашей салфетке из первого раздела при $2–4 за H100-час это десятки миллионов долларов только аренды финального рана. ~$490 млн — оценка Epoch AI для Grok 4 [57], с большой оговоркой о неопределенности. Тренд Epoch по всем фронтир-моделям: амортизированная стоимость крупнейших ранов растет ~2,4× в год [58], и при его сохранении раны за миллиард долларов — вопрос 2027 года. Из чего складывается полная стоимость разработки: 47–67% — железо, 29–49% — люди (включая опционы), и лишь 2–6% — электричество. Вопреки интуиции [59] «нейросети жгут деньги в розетку», главные статьи — амортизация ускорителей и зарплатная ведомость исследователей.

Сам кластер на 100 тыс. H100 SemiAnalysis разобрал по косточкам [60]: свыше $4 млрд серверного капекса, больше 150 МВт потребления, ~1,59 ТВт·ч электричества в год — около $124 млн, то есть порядка 3% от капекса серверов. Узкое место фронтира — доступ к железу и мощности подключения, счет за свет на этом фоне погрешность. Темпы стройки задал xAI Colossus: 100 тыс. H100 подняли за 122 дня в бывшем заводе Electrolux, еще столько же — за следующие 92 дня.

И свежий поворот 2026 года, важный для всей этой лестницы: по оценкам Epoch AI [61], GPT-5 обучена на меньшем компьюте, чем GPT-4.5 — ~5×10²⁵ FLOP против >10²⁶. По этим оценкам, впервые флагман вышел «дешевле» предшественника по претрейну: бюджеты поехали из претрейна в RL-пост-трейнинг и данные. Гонка масштабов продолжается, но ее центр тяжести сместился. И это стоит держать в голове, планируя что-то на годы вперед.

Как оно ломается: хроники с больших кластеров

Все, что выше, — бухгалтерия мирного времени; дальше — что происходит на кластере, когда претрейн идет неделями. Мой личный потолок — многосуточные раны RL и CV на куда меньшем железе, но главное оттуда переносится один в один: раны гибнут от диска, драйвера, сети и даталоадера куда чаще, чем от математики. Ниже — та же болезнь в масштабе, где ее не вылечишь перезапуском перед сном [62].

Логбук OPT-175B [63] (Meta, 2021–2022, ~тысяча A100) — сырые вахтенные записи команды, читаются как производственный триллер. По оценке команды, из строя выходило порядка двух машин ежедневно. В статье OPT [64] итог за два месяца: не менее 35 ручных рестартов, свыше сотни хостов отправлено в перезагрузку.

21 декабря 2021-го саппорт облачного провайдера случайно удалил весь кластер — целиком; восстановили в тот же день, но 16 машин не прошли проверки, и буферный пул добирали еще двое суток. Между Рождеством и Новым годом автоматика молча пережила восемь аппаратных сбоев. По ходу запуска команда успела попробовать сменить оптимизатор на SGD (вернулись к Adam) и случайно обновить Megatron посреди обучения, заметно изменив динамику лосса. Претрейн такого масштаба — вахтенная служба, где модель доплывает вопреки.

Спайки лосса — фирменная жуть больших ранов. У PaLM 540B [65] лосс внезапно взлетал ~20 раз за обучение, несмотря на gradient clipping; на меньших моделях с теми же данными эффект не воспроизводился. Рабочее лечение — машина времени: откат на чекпоинт за ~100 шагов до спайка и пропуск 200–500 батчей вокруг. Разгадка тянула на детектив: по отдельности не были виноваты ни данные, ни веса — те же батчи, скормленные с более раннего чекпоинта, спайка не давали; стреляла комбинация конкретных данных с конкретным состоянием модели. Google в статье признал прямым текстом, что принципиальной стратегии против спайков у команды нет. Позже OLMo 2 [66] нашла статистического подозреваемого: спайки коррелируют с документами, содержащими длинные повторы n-грамм, — и такие документы теперь вычищают на этапе данных.

Отказы железа на масштабе лучше всего оцифрованы в статье Llama 3 [56]. За 54-дневный срез претрейна на 16 384 H100 — 466 прерываний джоба, из них 419 внезапных: незапланированный сбой в среднем каждые три часа. Виновники: сбойные GPU — 30,1% случаев, память HBM3 — 17,2%, софт — 12,9%, сеть — 8,4%. CPU за тот же период отказали дважды. При этом effective training time удержали выше 90%, а серьезное ручное вмешательство понадобилось трижды — остальное разгребла автоматика чекпоинтов и рестартов. Физика тоже вмешивается: в жаркие часы дня пропускная способность кластера проседала на 1–2% из-за термотроттлинга GPU, а синхронные старты и остановки шестнадцати тысяч карт качали потребление датацентра на десятки мегаватт.

Железо, которое врет молча. Помимо громких отказов существуют тихие: silent data corruption, когда ядро процессора изредка возвращает неверный результат без единой ошибки [67] в логах. Google описал это в «Cores that don’t count» [68], Meta — в исследовании своего флота [69]; на масштабе в сотни тысяч чипов «фантомные» ядра — статистическая неизбежность; MegaScale, например, вылавливает такое детерминированным перепроигрыванием [8] подозрительных участков. На одной 5090 без ECC на всех путях данных вы SDC не заметите в принципе — модель просто «сойдется не туда», и винить вы будете гиперпараметры. Сколько раз я сам грешил на learning rate там, где стоило грешить на железо, — статистики, по понятным причинам, не существует.

Токены-зомби. История SolidGoldMagikarp [70] (2023): исследователи нашли в словаре GPT-2/GPT-3 токены, на которых модели вели себя неадекватно — не могли повторить слово, уклонялись, выдавали случайные ответы (на просьбу повторить «SolidGoldMagikarp» модель отвечала «distribute»). Токены оказались никами реддиторов из r/counting и артефактами вроде «BuyableInstoreAndOnline». Реконструкция причины: BPE-токенизатор обучали на одном корпусе (со скрейпом Reddit), модель — на другом, вычищенном; токены остались в словаре, но их эмбеддинги не обучились — призраки в словаре. Систематику потом подтвердили на десятках моделей [71]. Урок для DIY-претрейна дословный: обучайте токенизатор на том же корпусе, что и модель, иначе получите личных Магикарпов.

Легальный чит напоследок. Подбор гиперпараметров для большой модели стоит как несколько ее обучений, если подбирать в лоб. µP / µTransfer [72] (Microsoft/OpenAI) позволяет вытюнить learning rate и компанию на крошечной прокси-модели и перенести на большую zero-shot: авторы затюнили GPT-3 6.7B через прокси на 40M, потратив на тюнинг ~7% стоимости одного претрейна. Это тот редкий случай, когда домашняя 5090 напрямую участвует в большом ране: гиперпараметры будущего кластерного запуска дебажатся на карте под столом.

Данные: топливо, за которое уже заплатили

Хорошая новость домашнего и среднего ярусов: претрейн-данные сегодня бесплатны, потому что сообщество один раз скинулось на их очистку.

Основной корпус открытого претрейна — FineWeb [73] от Hugging Face: на релизе в 2024-м — 15 трлн токенов очищенного английского веба из 96 дампов CommonCrawl, к 2026-му — уже ~18,5 трлн, свежие дампы докидываются регулярно. Лицензия ODC-By, готовые parquet-шарды качаются свободно; в абляциях FineWeb обходил C4, The Pile, RedPajama2 и остальную классику. На нем обучаются и nanochat, и SmolLM, и половина открытых моделей.

Поучительно, сколько инженерии в этом «бесплатно». Отчет FineWeb — обязательное чтение про то, как интуиция врет в data-инженерии. Пример с дедупликацией: интуиция подсказывает, что чем агрессивнее чистишь дубли, тем лучше данные. Команда прогнала глобальный MinHash-дедуп — в старых дампах он выкидывал подавляющую часть контента, — и модели на «идеально чистых» данных стали учиться хуже: выброшенное оказалось в среднем качественнее оставшегося. Рабочей оказалась дедупликация внутри отдельных дампов. Единственный надежный компас в таких вопросах — абляции: обучение мелких моделей на каждом варианте корпуса, десятки прогонов, которые и есть скрытая цена «бесплатного» датасета. Подпишусь из собственной практики: в CV- и RAG-проектах интуиция о «хороших данных» ровно так же не стоит ничего, пока не прогнал контрольный эксперимент. Соседний проект DCLM [74] добавил свою контринтуицию: из 240 трлн сырых токенов CommonCrawl после фильтрации выживает ~1,6%, и лучшим фильтром оказался fastText-классификатор на пару мегабайт, обученный на удачно выбранных положительных примерах, — он обошел куда более хитрые пайплайны.

Прикладное правило для тех, у кого данных мало (домашний ярус, узкие домены): Muennighoff et al. [75] на 400+ моделях показали, что гонять один и тот же датасет до ~4 эпох (полных проходов по нему) почти так же полезно, как иметь свежие данные. Дальше отдача быстро падает: заметный выигрыш тянется примерно до ~16 эпох и к ~40 практически сходит на нет.

Растущая ветка — синтетика. Серия phi от Microsoft начиналась с «Textbooks Are All You Need» [76]: 1,3B-модель на семи миллиардах «учебниковых» токенов обходила на кодовых бенчмарках модели на порядок больше. Открытый аналог — Cosmopedia [77]: 25 млрд синтетических токенов, сгенерированных большой моделью; генерация заняла 10+ тыс. GPU-часов — по грубой прикидке порядка $1 за миллион токенов, тогда как веб-корпус бесплатен. Синтетика стоит денег, зато позволяет прицельно закрывать дыры, которых в вебе мало: учебные объяснения, пошаговые решения, редкие языки.

Есть и юридический счет — на фронтире он уже сравним со стоимостью железа. По иску авторов книг Anthropic согласилась выплатить $1,5 млрд [78] — около $3000 за каждую из ~482 тыс. книг, скачанных из пиратских библиотек LibGen и PiLiMi. Тонкость, важная для всей индустрии: тот же судья признал само обучение на легально купленных книгах fair use — полтора миллиарда платятся за пиратское скачивание, факт обучения тут ни при чем (финальное одобрение сделки на момент написания еще в процессе). Параллельно данные становятся строкой закупок: Reddit продает доступ Google — сделку оценивали примерно в $60 млн [79], сделку News Corp с OpenAI СМИ оценивали в $250+ млн за пять лет. Эпоха бесплатных данных заканчивается, но пока только для тех, кто играет на фронтире. Домашнему ярусу FineWeb хватит надолго.

Считаем в рублях

Все выше было в долларах; теперь то же самое в рублях. Цены — снимок на 10 июля 2026-го, источники по ссылкам, волатильность высокая.

Купить карту. RTX 5090 в рознице РФ прошла путь от ~240 тыс. ₽ летом 2025-го до 393–490 тыс. ₽ к весне 2026-го [80]; на сегодня живые позиции — от ~345 тыс. (Palit) до ~510 тыс. (топовые ASUS). Обидная деталь: винить «наценку параллельного импорта» не выйдет — в США стрит-цены 5090 к началу 2026-го доходили до ~$5000 при MSRP $1999, глобальный ИИ-спрос и дефицит памяти уравняли всех. NVIDIA официально не поставляет и не поддерживает GPU в РФ с 2022-го, так что гарантия — только от продавца.

Арендовать. Российские облака (цены — за VM целиком): immers.cloud [81] — RTX 5090 за 130,76 ₽/час, RTX 4090 за 82,76 ₽/час, A100 80GB за 211,77 ₽/час, H100 за 341,77 ₽/час; Интелион [82] — H100 за 299,11 ₽/час или ~201 тыс. ₽/мес. Нода 8×H100 у Cloud.ru [83] — от ~5,36 млн ₽/мес, то есть ~7400 ₽/час; за рубежом аналогичная нода у Lambda стоит ~$32/час ≈ 2600 ₽ (год назад было ~$24 — аренда дорожает) — РФ-премия за большое железо примерно тройная (санкционная логистика в цене чувствуется именно на серверных картах, у игровых ее почти нет). Для справки о мировом рынке: H100 у специализированных провайдеров — $2–4 за GPU-час [84], причем контрактные цены в 2026-м впервые за годы пошли вверх [85] на волне инференс-бума — рассчитывать на вечную дешевизну аренды я бы не стал.

Розетка. Самая переоцененная статья расходов. Месяц круглосуточного обучения на 5090 при ее полных 575 Вт — 414 кВт·ч, по московскому тарифу ~8 ₽/кВт·ч это ~3300 ₽; со всем системником — ~4900 ₽. На фоне цены самой карты — статистическая погрешность; та же картина, что на фронтире с его 2–6% на электричество. Любителям оптимизации: ночной тариф вдвое ниже.

Купить или арендовать. Простая арифметика: 5090 за ~400 тыс. ₽ против аренды за ~94 тыс. ₽/мес (130,76 ₽ × 720 ч) — карта отбивается за 4–5 месяцев непрерывной загрузки. Для месячного эксперимента с претрейном аренда выигрывает без вариантов; покупка имеет смысл, когда карта нужна еще и для инференса, игр и всего остального, что заполнит простой. И еще: спот-цены на маркетплейсах вроде Vast.ai [86] на 4090/5090 регулярно опускаются ниже 40 ₽/час (та самая 5090 за ~$0,35/час [39] из nanochat-обсуждений — оттуда) — за цену месяца российской аренды там можно прогнать весь nanochat-спидран несколько раз.

Что

Где

Цена

RTX 5090 своя

розница РФ

345–510 тыс. ₽ разово + ~4900 ₽/мес розетка

RTX 5090 аренда

immers.cloud [81]

~94 тыс. ₽/мес (130,76 ₽/ч)

RTX 5090/4090 спот

Vast.ai [86] и аналоги

от ~25–40 ₽/ч

H100 аренда

Интелион / immers

~200–246 тыс. ₽/мес

Нода 8×H100

Cloud.ru [83]

от ~5,36 млн ₽/мес

Нода 8×H100

Lambda (не РФ)

~$32/ч ≈ 1,9 млн ₽/мес

Про стоимость обучения GigaChat и YandexGPT спросят в комментариях — публичных смет нет: Сбер и Яндекс цифр не раскрывают, и любая точная сумма здесь была бы маркетингом (см. раздел про чтение чужих смет).

Моя ставка

Дальше — мнение, отделяю его от фактов.

Кому в 2026-м реально нужен претрейн с нуля. Почти никому — к этому сводится вся лестница выше. Открытые веса плюс файнтюн плюс RAG закрывают, по моей практике, девять задач из десяти за проценты стоимости претрейна. Реальные исключения, где «с нуля» оправдан: свой язык предметной области, которого мало в вебе (специализированный код, биопоследовательности, low-resource языки); жесткие edge-ограничения, под которые выгоднее вырастить маленькую специализированную модель, чем ужимать общую; и суверенитет данных, когда в контур нельзя занести ничьи чужие веса по регуляторике. Если подрядчик предлагает вам «обучить модель с нуля под ваш бизнес» без одного из этих трех оснований — он предлагает вам оплатить его обучение, в обоих смыслах. Говорю как тот самый подрядчик: нам тоже выгоднее продать «свою LLM», чем файнтюн, так что считайте этот абзац показанием против собственного интереса [87].

Куда едет кривая. Ножницы будут расходиться. Нижний край дешевеет в ~2,5 раза в год (кривая Карпатого), верхний дорожает в ~2,4 раза (кривая Epoch) — редкий рынок, где оба конца движутся так быстро и в противоположные стороны. Между ними растет средний класс открытых моделей — и для инженеров это отличная новость: воспроизводимый претрейн 3–30B за понятные деньги означает, что компетенция перестала быть монополией пяти лабораторий.

Три проверяемых прогноза, по которым меня можно будет поймать за язык:

  1. GPT-2-класс будет стоить дешевле $10 к концу 2028-го. Сигнал для проверки: лидерборд Time-to-GPT-2 в репозитории nanochat.

  2. Контрактная цена H100 не вернется ниже $2/час в 2026-м. Инференс-бум съедает мощности быстрее, чем строятся датацентры. Здесь я могу ошибиться — если предложение Blackwell хлынет на рынок быстрее прогнозов, — но ставлю на дефицит.

  3. Первый публично подтвержденный ран дороже $1 млрд — до конца 2027-го. Тренд 2,4×/год дотягивается до миллиарда ровно к этому сроку.

Что делать лично вам, если руки чешутся. Прогнать nanochat d16 на арендованной 5090 за десять-тридцать долларов — лучшая инвестиция в понимание LLM, которую я могу назвать: за выходные вы руками пройдете весь путь от токенизатора до чат-бота и телом почувствуете, где в этом конвейере деньги. А вот тащить претрейн в продукт стоит только после того, как посчитана салфетка из первого раздела — и сравнена лоб в лоб с файнтюном.

Это моя вторая статья здесь — в первой [88] разбирал, почему роботы за двадцать минут машинного времени учатся ходить — и что мешает им научиться думать. Такие разборы — что почем в ИИ-проектах и где они ломаются — мы с командой пишем в телеграм-канале morana.log [89]; заходите, если жанр по душе.

Автор: 0xReality

Источник [90]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/33276

URLs in this post:

[1] nanochat: https://github.com/karpathy/nanochat

[2] техотчет V3: https://arxiv.org/html/2412.19437v2

[3] обучение: http://www.braintools.ru/article/5125

[4] habrGPT: https://habr.com/ru/articles/1054710/

[5] работы Kaplan et al. 2020: https://arxiv.org/abs/2001.08361

[6] использует Epoch AI: https://epoch.ai/data/ai-models-documentation/estimation

[7] таблица из статьи PaLM: https://ar5iv.labs.arxiv.org/html/2204.02311

[8] 55,2% на 12 288 GPU: https://arxiv.org/abs/2402.15627

[9] 90 минут и ~$20: https://github.com/karpathy/llm.c/discussions/481

[10] Chinchilla: https://arxiv.org/abs/2203.15556

[11] ~1875 токенов на параметр: https://ai.meta.com/blog/meta-llama-3/

[12] inference-optimal скейлинг: https://arxiv.org/abs/2401.00448

[13] зрения: http://www.braintools.ru/article/6238

[14] одной строкой: https://karpathy.ai/stateofgpt.pdf

[15] говорит то же самое: https://huggingface.co/docs/transformers/main/en/chat_template_basics

[16] анонса InstructGPT: https://openai.com/research/instruction-following

[17] Логика: http://www.braintools.ru/article/7640

[18] статьи GPT-3: https://arxiv.org/abs/2005.14165

[19] подкреплением: http://www.braintools.ru/article/5528

[20] канонический разбор пайплайна: https://huggingface.co/blog/rlhf

[21] статье InstructGPT: https://arxiv.org/abs/2203.02155

[22] формат ChatML: https://github.com/openai/openai-python/blob/release-v0.28.0/chatml.md

[23] симулятор, умеющий играть кого угодно: https://www.lesswrong.com/posts/vJFdjigzmcXMhNTsx/simulators

[24] опыту: http://www.braintools.ru/article/6952

[25] поведение: http://www.braintools.ru/article/9372

[26] R1-Zero: https://arxiv.org/abs/2501.12948

[27] математика: http://www.braintools.ru/article/7620

[28] гений: http://www.braintools.ru/article/4566

[29] рецензируемой публикации в Nature: https://www.nature.com/articles/s41586-025-09422-z

[30] RTX 5090: https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/

[31] памяти: http://www.braintools.ru/article/4140

[32] ~16 байт на параметр: https://blog.eleuther.ai/transformer-math/

[33] память в обмен на повторный forward: https://arxiv.org/abs/1604.06174

[34] LLMQ: https://arxiv.org/abs/2512.15306

[35] nanoGPT: https://github.com/karpathy/nanoGPT

[36] на Хабре: https://habr.com/ru/articles/996404/

[37] GPT-2 1.6B — 24 часа на 8×H100 и $672: https://github.com/karpathy/llm.c/discussions/677

[38] воспроизводит GPT-2 124M за ~90–115 минут на одной RTX 4090: https://github.com/Deveraux-Parker/nanoGPT_1GPU_SPEEDRUN

[39] релизный спидран: https://github.com/karpathy/nanochat/discussions/1

[40] обсуждений репозитория: https://github.com/karpathy/nanochat/discussions/215

[41] $73 за nanochat-модель, побившую GPT-2 по CORE: https://github.com/karpathy/nanochat/discussions/481

[42] modded-nanogpt: https://github.com/KellerJordan/modded-nanogpt

[43] уехавший потом в серьезные продовые претрейны: https://arxiv.org/abs/2502.16982

[44] TinyStories: https://arxiv.org/abs/2305.07759

[45] 900 ГБ/с суммарной полосы на GPU: https://developer.nvidia.com/blog/nvidia-hopper-architecture-in-depth/

[46] INTELLECT-1: https://arxiv.org/abs/2412.01152

[47] ZeRO: https://arxiv.org/abs/1910.02054

[48] техотчет: https://arxiv.org/abs/2502.02737

[49] SmolLM3-3B: https://huggingface.co/blog/smollm3

[50] Smol Training Playbook: https://huggingfacetb-smol-training-playbook.hf.space/

[51] Olmo 3: https://allenai.org/blog/olmo3

[52] техрепорту: https://arxiv.org/abs/2512.13961

[53] разбор с арифметикой: https://muxup.com/2025q4/minipost-olmo3-training-cost

[54] SemiAnalysis оценивал: https://newsletter.semianalysis.com/p/deepseek-debates

[55] по методике Epoch AI: https://epoch.ai/blog/how-much-does-it-cost-to-train-frontier-ai-models

[56] до 16 384 H100 одновременно: https://arxiv.org/abs/2407.21783

[57] оценка Epoch AI для Grok 4: https://epoch.ai/data-insights/grok-4-training-resources

[58] ~2,4× в год: https://arxiv.org/abs/2405.21015

[59] интуиции: http://www.braintools.ru/article/6929

[60] SemiAnalysis разобрал по косточкам: https://newsletter.semianalysis.com/p/100000-h100-clusters-power-network

[61] оценкам Epoch AI: https://epoch.ai/gradient-updates/why-gpt5-used-less-training-compute-than-gpt45-but-gpt6-probably-wont

[62] сном: http://www.braintools.ru/article/9809

[63] Логбук OPT-175B: https://github.com/facebookresearch/metaseq/blob/main/projects/OPT/chronicles/final_update.md

[64] статье OPT: https://arxiv.org/abs/2205.01068

[65] PaLM 540B: https://arxiv.org/abs/2204.02311

[66] OLMo 2: https://arxiv.org/abs/2501.00656

[67] ошибки: http://www.braintools.ru/article/4192

[68] «Cores that don’t count»: https://research.google/pubs/cores-that-dont-count/

[69] в исследовании своего флота: https://arxiv.org/abs/2102.11245

[70] SolidGoldMagikarp: https://www.lesswrong.com/posts/aPeJE8bSo6rAFoLqg/solidgoldmagikarp-plus-prompt-generation

[71] на десятках моделей: https://arxiv.org/abs/2405.05417

[72] µP / µTransfer: https://arxiv.org/abs/2203.03466

[73] FineWeb: https://huggingface.co/datasets/HuggingFaceFW/fineweb

[74] DCLM: https://arxiv.org/abs/2406.11794

[75] Muennighoff et al.: https://arxiv.org/abs/2305.16264

[76] «Textbooks Are All You Need»: https://arxiv.org/abs/2306.11644

[77] Cosmopedia: https://huggingface.co/blog/cosmopedia

[78] $1,5 млрд: https://authorsguild.org/news/anthropic-settlement-key-updates/

[79] оценивали примерно в $60 млн: https://www.cbsnews.com/news/google-reddit-60-million-deal-ai-training/

[80] 393–490 тыс. ₽ к весне 2026-го: https://digital-razor.ru/media/news/hardware/rtx-5090-price-up/

[81] immers.cloud: http://immers.cloud

[82] Интелион: https://intelion.cloud/prices/

[83] Cloud.ru: http://Cloud.ru

[84] $2–4 за GPU-час: https://lambda.ai/pricing

[85] пошли вверх: https://newsletter.semianalysis.com/p/the-great-gpu-shortage-rental-capacity

[86] Vast.ai: http://Vast.ai

[87] интереса: http://www.braintools.ru/article/4220

[88] первой: https://habr.com/ru/articles/1057816/

[89] morana.log: https://t.me/moranalog

[90] Источник: https://habr.com/ru/articles/1060916/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1060916

www.BrainTools.ru

Rambler's Top100