Кремниевый король: Как NVIDIA заложила фундамент нейросетевой революции
1. Введение: Аппаратный фундамент ИИ-революцииСовременный ландшафт генеративного искусственного интеллекта невозможно представить без колоссальных вычислительных мощностей. Бум больших языковых моделей (LLM), начавшийся с триумфального шествия ChatGPT, и интеграция ИИ-инструментов в продукты IT-гигантов вроде Microsoft, Google и Amazon спровоцировали беспрецедентный спрос на специализированное железо. В центре этой аппаратной лихорадки оказалась компания, чья капитализация пробила исторические потолки, обойдя и Apple, и Microsoft. Речь, разумеется, о NVIDIA.
Глава Nvidia: не нужно искать профессии, «устойчивые к ИИ»
Родителям не следует зацикливаться на том, что изучают их дети в эпоху искусственного интеллекта, заявил генеральный директор Nvidia Дженсен Хуанг. Вместо попыток выбрать «устойчивые к ИИ» дисциплины Хуанг
Обзор серверного ускорителя NVIDIA Tesla V100 16 Gb в корпусе от RTX 4090: Часть 3 — Запуск локальных моделей ИИ
В третьей части обзора посмотрим на что способна Tesla V100 в работе с современными локальными моделями ИИ. Сравним ее с более современными серверными ускорителями и видеокартами по вычислительной мощности. Проверим какие модели ИИ она способна запустить в LM Studio и протестируем их.Сравнение производительности Tesla V100 с современными серверными ускорителями и видеокартами
Великий парадокс VRAM: почему мы платим миллионы за память, чтобы делать всё, лишь бы ей не пользоваться
Если вы посмотрите на эволюцию видеокарт для машинного обучения, вы увидите одну тенденцию: гонку за объемом видеопамяти. Размеры LLM пухнут, KV кэш сжирает терабайты, батчи становятся всё больше. Нам нужно больше VRAM. Еще больше VRAM.Но если вы когда-нибудь писали собственные ядра на triton, вы знаете одну жестокую тайну, о которой не задумываются дата саентисты высокоуровневых фреймворков.Самая дорогая часть вашей видеокарты это самое медленное, узкое и отвратительное место во всей системе. И вся современная ML оптимизация (Kernel Fusion, FlashAttention, PagedAttention) сводится к одному правилу:

