- BrainTools - https://www.braintools.ru -
Еще несколько лет назад NVIDIA Tesla V100 ассоциировалась прежде всего с дата‑центрами и суперкомпьютерами. Сегодня эти списанные ускорители V100 SXM2 на 16 ГБ массово попадают на вторичный рынок, и для энтузиаста локального ИИ они выглядят неожиданно интересно. Особенно это касается версии V100 SXM2 на 32 ГБ.

У меня возникла простая идея: а почему бы вместо одной современной и дорогой игровой видеокарты собрать сервер на двух или четырех бывших серверных ускорителях. В результате получается от 64 до 128 ГБ видеопамяти, высокая пропускная способность и возможность использовать NVLink (попарно). При этом сами модули V100 сейчас можно найти по цене, несопоставимой с современными топовыми GPU. Например, актуальные предложения на V100 SXM2 16 ГБ на маркетплейсах встречаются примерно от $100–150 за модуль, хотя цена сильно зависит от состояния и года выпуска.

Важная оговорка: V100 — это архитектура Volta 2017 года. Такая видеокарта не будет быстрее современных RTX во всех задачах. Игровая производительность примерно как у Radeon 6800XT или 5060Ti. Правда эта видеркарта лишена ряда новых возможностей, например,не поддерживает трассировку, не поддерживает Frame Generation (DLSS 3/4).

Но в локальном инференсе LLM ситуация интереснее: здесь огромное значение имеют объем и пропускная способность памяти [1], а не только поколение Tensor‑ядер. Поэтому современный сервер на базе NVIDIA V100 SXM2 в ряде нейросетевых сценариев действительно способен конкурировать с гораздо более дорогими видеокартами, стоя при этом в несколько раз дешевле. В ряде задач, такая видеокарта остается на уровне RTX 3090Ti. Конечно, многое зависит от конкретной сборки и версии платы (те же NVIDIA V100 SXM2 с памятью 32 ГБ будут эффективнее работать с маленькими моделями, такими как Qwen3.8–27B, которые полностью помещаются в VRAM). А если использовать четыре V100 по 32 ГБ, получаем конфигурацию с 128 ГБ HBM2, что уже открывает возможность запуска моделей, которые на одной потребительской видеокарте просто не помещаются, хотя и стомость в таком случае начинает «кусаться».

NVIDIA Tesla V100 построена на архитектуре Volta и оснащена 5120 CUDA‑ядер и 640 Tensor‑ядер. Версия SXM2 получила 32 ГБ HBM2 с пропускной способностью 900 ГБ/с. Заявленная производительность Tensor‑операций достигает 125 TFLOPS, а максимальное энергопотребление составляет 300 Вт. Для связи нескольких ускорителей используется NVLink с пропускной способностью до 300 ГБ/с. Для сравнения, GeForce RTX 3090 имеет 24 ГБ GDDR6X и пропускную способность памяти около 936 ГБ/с, а RTX 5070 — 12 ГБ GDDR7 и 672 ГБ/с. RTX 4070 Ti располагает 12 ГБ GDDR6X. То есть V100 выглядит устаревшей по архитектуре, но ее 32 ГБ HBM2 остаются весьма серьезным ресурсом для локальных нейросетей.

У V100 существовали две основные версии: PCIe и SXM2. Для домашней сборки логичнее смотреть именно на SXM2. При сборке и настройке стоит уделить внимание [2] установке драйверов и приложений. Так, Например, в актуальной ветке PyTorch начиная с 2.11 готовые CUDA 12.8/12.9-бинарники больше не включают поддержку Volta; для V100 рекомендуется использовать сборки с CUDA 12.6 либо собирать PyTorch самостоятельно с поддержкой sm_70. Это один из главных минусов V100 в 2026 году: железо дешевое, но программная совместимость уже требует внимания. Если говорить про специальный мезонинный разъём SXM2, то у Tesla V100 их сразу два: один требуется для обмена по PCIe, а второй используется для стыковки с другими видеокартами по шине. При выборе адаптера обращайте внимание на возможность подключение NVLink — далеко не у всех таких адаптеров второй разъём SXM2 распаивается/вводится на край платы для подстыковки NVLink Bridge. Это еще один важный момент, на который стоит обратить внимание при подборке конфигурации будущего ИИ‑сервера.

Сам модуль SXM2 не вставляется в стандартный PCIe‑разъем. Нужна переходная плата. На текущий день таких плат достаточно много, встречаются как в конфигурации на одну, две и даже четыре Tesla V100. Как правило, в стандартный PCIe‑разъем эти платы подключаются через различные райзеры и PCIe‑адаптеры. Отмечу, что такие адаптеры вполне могут «резать шину» — мне встречались варианты не только для PCIe х16, но и для PCIe х8. Такие конфигурации накладывают ограничения на используемые материнские платы, так что и этот момент не оставляем без внимания.

Самый простой, на мой взгляд, вариант — это использование адаптеров под NVIDIA Tesla V100 SXM2 для прямой установки в PCIe‑разъем, например, с воздушным охлаждением. На фотографии как раз такой вариант, с «кулерами» от RTX 4090. Кстати, на фотографии видно еще и установленный NVLink мост, объединяющий видеокарты. Вот только стоимость переходников сейчас может оказаться сопоставимой с ценой самой V100.

На мой взгляд, воздушное охлаждение — это достаточно экстримальное решение. У серверной V100 нет привычного игрового кулера. NVIDIA рассчитывала на установку таких модулей в сервер с мощным теплообменником‑радиатором и направленным воздушным потоком. При TDP 300 Вт одна карта выделяет столько тепла, сколько достаточно производительная игровая видеокарта. Две V100 — уже 600 Вт только на GPU. Четыре — 1200 Вт. У меня еще и пара Xeon Е5-2680 с TDP 120 Вт на каждый. Поэтому вариант «поставлю маленький радиатор и вентилятор от процессора» подходит далеко не всегда. Для эффективного охлаждения в таких случаях используются массивные медные или алюминиевые радиаторы с тепловыми трубками и отдельными вентиляторами, с посадочными размерами как у серверных решений.

И если для тестовой сборки воздушное охлаждение может быть оправданным, то для работы сборки из двух или четырех карт наиболее разумный вариант охлаждения — это СЖО (системы жидкостного охлаждения), особенно в случае, если сервер должен будет работать круглосуточно рядом с человеком. На фотографи пример NVIDIA Tesla V100 с установленным водоблоком под СЖО.

V100 имеет ровную поверхность кристалла и выпускаются решения с водоблоками, рассчитанными на SXM2. Вот пример тестовой сборки с типовой системой СЖО на две секции и с креплением аля LGA 115х. Такое решение не только тише по сравнению с «турбинкой» воздушного охлаждения, но и позволяет отвести ~ 300 Вт тепла при работе видеокарты.

Для домашнего использования я бы начинал именно с двух ускорителей. Получаем: 2 × 16 ГБ = 32 ГБ VRAM для запуска таких локальных моделей, как Qwen3.8–27B и Gemma4-26b. В случае со старшей версией V100 получаем 2 × 32 ГБ = 64 ГБ VRAM и теоретически: 2 × 900 = 1800 ГБ/с суммарной пропускной способности памяти при использовании NVLink. Не забываем [3] и про оперативную память самого ПК. Да и про вопросы с питанием не забываем — тестовая сборка. как на фото, потребляет около 1 кВт.

Теперь самое интересное — экономика. По текущим предложениям V100 SXM2 32 ГБ можно найти примерно за $100–150 за модуль. Переходник SXM2→PCIe может стоить около $220. Для RTX 5070 ориентир сейчас составляет около $550–570 за карту. RTX 4070 Ti на вторичном рынке и в актуальных предложениях находится примерно от $680. RTX 3090 на текущем рынке заметно дороже исторических цен: «заточенная» под ИИ карта с памятью 24 Гю на вторичном рынке может стоить и более $1000. Конечно, все это весьма условно — цены зависят не только от валютного курса, но и от спроса/предложения. Для расчета возьмем не только GPU, но полноценную систему с учетом корпуса, систем охлаждения, материнской платы, CPU и памяти:
|
Конфигурация |
GPU |
Переходники |
Платформа и охлаждение |
Итого |
|
2× V100 16 ГБ |
~$240 |
~$240 |
~$900 |
~$1400 |
|
2× V100 32 ГБ |
~$460 |
~$240 |
~$900 |
~$1600 |
|
4× V100 32 ГБ |
~$920 |
~$480 |
~$1300 |
~$2700 |
|
4× RTX 5070 |
~$2240 |
— |
~$1250 |
~$3490 |
|
4× RTX 4070 Ti |
~$2730 |
— |
~$1250 |
~$3980 |
|
4× RTX 3090 |
~$6000 |
— |
~$1500 |
~$6700 |
Это оценочная стоимость, но она позволяет сравнить варианты конфигураций и сделать вывод. Я для себя вывод сделал и собираю домашний сервер на базе V100. К слову, в этой таблице не учтены доставка, таможенные платежи, возможный ремонт бывших в употреблении V100, а также затраты на сборку и расходники (термопаста и прочее). Для грубой оценки можно поделить условный агрегированный throughput на стоимость системы (очень условно):
|
Конфигурация |
Условный throughput |
Стоимость |
Токенов/с на $1000 |
|
2× V100 |
144 |
$1600 |
90 |
|
4× V100 |
288 |
$2700 |
107 |
|
4× RTX 5070 |
320 |
$3490 |
92 |
|
4× RTX 4070 Ti |
308 |
$3980 |
77 |
|
4× RTX 3090 |
200 |
$6700 |
30 |
Отдельный интерес [4] представляют локальные LLM типа Qwen3.8–27B и Gemma4-26b (и аналогичные им). Для V100 32 ГБ можно достичь результата около 36,6 токена/с при Q4_K_M. При этом модель требует примерно 24 ГБ VRAM и может полностью размещаться на V100 32 ГБ. К слову, современные LLM‑фреймворки умеют распределять модель между несколькими ускорителями. При этом NVLink существенно уменьшает стоимость обмена данными между GPU по сравнению с обычным PCIe. То есть, если у вас нет необходимости запускать более тяжеловесные модели и Qwen3.8–27B/Gemma4-26b вам будет достаточно, то вполне можно остановиться на сервере с парой V100 16 ГБ. Я использую связку Qwen3.8 + Ollama + OpenCode. В зависимости от ситуации, далее в связке идет MCP и целевое приложение. Например, можно генерировать 3D модели с помощью Blender MCP или создавать скетчи в Arduino CLI.

Если смотреть на такую систему глазами пользователя, который не занимается промышленным обучением [5] нейросетей, а запускает локальные LLM, ретушь и генеративные задачи для бытовых вопросов, то впечатление [6] получается необычным. Две V100 на 32 ГБ позволяют не думать о том, хватит ли 12 или 16 ГБ памяти. Модель можно загрузить на один GPU либо распределить между двумя. А две V100 на 16 ГБ пока остаются самым бюджетным вариантом для домашнего ИИ сервера. Стоит отметить ряд моментов, которые могут остановить пользователей от подобной экономии:
Эти карты б/у, в основной своей массе 2017–2018 года (это версии, которые подешевле, а если более свежие, но там стоимость быстро приближается к современным видеокартам), то есть можно вполне получить «убитую» и «попасть» на ремонт.
Для работы эти карты требуют модифицированный драйвер Nvidia. Далеко не на всех системах удается настроить без конфликтов и без «костылей». На Linux‑системах, к слову, похожая ситуация.
Высокое потребление: система с четырьмя V100 по потреблению может превышать 1.5 кВт, а система с двумя V100 — приближается к 1 кВт.
Соответственно, высокое тепловыделение. Это приводит к сложностям с установкой системы охлаждения, к высокому шуму при работе, определенным рискам с перегревом системы.
Две карты по 16 Гб с NVLink — это не то же самое, что одна карта на 32 Гб. Соответственно, две карты по 32Гб с NVLink — это не то же самое, что одна карта на 64 Гб. Современные нейросети поддерживают разделение памяти: если модель Qwen3.8–27B целиком не помещается в видеопамять вашей видеокарты V100 16 ГБ, то Ollama автоматически загружает часть слоев в VRAM одной видеокарты, а часть — в VRAM второй видеокарты. То же самое касается больших моделей, когда остальные слои загружаются в системную RAM. Но от такого страдает скорость генерации. Это также нужно учитывать.
Играть на таких картах можно, но большого смысла нет — они «заточены» именно под ИИ: обучение и генерация. Ну и в целом RTX 5070, RTX 4070 Ti, RTX 4090 и RTX 3090 обладают преимуществами в разных современных вычислительных задачах.

Вот только Tesla V100 дает для энтузиаста то, что сложно получить дешево: можно получить максимум GPU‑памяти и нейросетевой производительности за ограниченный бюджет, это один из самых интересных вариантов вторичного рынка. Несколько Tesla V100 + NVLink позволяют собрать систему, по объему GPU‑памяти и возможностям многокарточной работы приближающуюся к гораздо более дорогим решениям. Для домашней ИИ‑станции это уже достаточно интересная конфигурация: можно запускать модели, которые требуют больше 24–32 ГБ памяти, не покупая профессиональный ускоритель стоимостью в несколько тысяч долларов. Именно поэтому четыре V100 могут оказаться заметно более мощной платформой для больших моделей, несмотря на более старую архитектуру. Особенно приятно, что после покупки базовой платформы можно постепенно наращивать систему: у меня в планах после тестирования пары V100 добавить еще одну (получается третью по счету V100 32 Гб). Возможно, при наличии подходящей материнской платы — получится перейти и к сборке из четырех таких видеокарт. Планирую выкладывать тесты и результаты работы в связке с OpenCode/Android Studio/ArduinoCLI/Blender и так далее, тем более сейчас есть с чем сравнить. Если интересно — напишите, могу подробнее рассказать про настройку драйверов и связок Qwen3.8 + Ollama + OpenCode или Gemma4-26b + Ollama + OpenCode. Также приглашаю обсудить ваш опыт [7] по созданию домашних ИИ‑станций и по оптимизации генераций с большими моделями. Статья большая, если заметили опечатку, просто напишите мне, и я исправлю.
Автор: Lexus08
Источник [8]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35735
URLs in this post:
[1] памяти: http://www.braintools.ru/article/4140
[2] внимание: http://www.braintools.ru/article/7595
[3] забываем: http://www.braintools.ru/article/333
[4] интерес: http://www.braintools.ru/article/4220
[5] обучением: http://www.braintools.ru/article/5125
[6] впечатление: http://www.braintools.ru/article/2012
[7] опыт: http://www.braintools.ru/article/6952
[8] Источник: https://habr.com/ru/articles/1084234/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1084234
Нажмите здесь для печати.