gpu.
Как устроены LLM: разбираем на примере 3-уровневой абстракции
Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением
Может ли дата-центр вообще отказаться от воды?
Немного экспериментальный формат, который надеюсь, вам зайдет. Мне лично очень нравится изучать разные темы вне статистики, аналитики и прикладных к ним темам, поэтому иногда для того, чтобы лучше разобраться с какой-то темой лучше всего ее попробовать объяснить или описать самостоятельно.В данном материале речь пойдет про ИИ, но немного с непривычного формата - попробуем разобраться, зачем охлаждают и чем сейчас охлаждаются дата-центры
Запустить LLM локально: что считать до покупки видеокарты?
Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса
Кто остановит AGI: законы или мегаватты?
В последние месяцы снова активизировались призывы притормозить развитие наиболее мощных AI-систем. Причём теперь они исходят уже не только от политиков и сторонних экспертов. Руководители крупнейших AI-компаний сами обсуждают необходимость замедлить гонку, ввести независимый контроль и договориться о правилах, которые позволили бы остановиться, если дальнейшее развитие станет слишком опасным.
Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК
Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье
Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же
Я прогнал топ выдачи Google по «llm vram calculator» — от самого навороченного до однокнопочных. Все ошибаются в одном и том же: ни один не моделирует, что движок резервирует почти всю память под пул заранее, а не раздаёт её под KV по мере запросов. Ответ «сколько запросов влезет» из-за этого всегда мимо.Наивное большинство спотыкается ещё и о геометрию KV: на DeepSeek-V2-Lite обычная формула завышает память почти на порядок (в 7–11 раз). Разбираю обе ловушки и сверяю числа с живым vLLM.Ошибка №1: движок забирает память заранееПишете две строки:from vllm import LLM llm = LLM("meta-llama/Meta-Llama-3-8B-Instruct")
Perfscale news #9. GPU, LLM, Docker images
Приветствую, любители нагрузки. Для истории прошлые выпуски:Новости Perfscale № 1Perfscale news #2: Fix Protocol, Magic metrics и MCPperfscale news #3 Websocket, Inference, NPMPerfscale news #4. GRPC, Fixed Triggers, Child ProcessPerfscale news #5. SQL, Thresholds, неработающие Linked AccountsPerfscale news #6. GraphQL, поддержка Import, и метрикиPerfscale news #7. Fix Import, SOAP, and more HTTP metrics
ИИ потребляет энергию рывками. Энергосеть к такому не готова
Стремительный рост ИИ-инфраструктуры почти всегда описывают как проблему энергии. Дата-центры будут потреблять всё большую долю мирового электричества: по оценке Международного энергетического агентства (МЭА), в пределах этого десятилетия на них придётся 3–4% глобального потребления. Энергокомпании уже переписывают долгосрочные прогнозы под рост сверхкрупных дата-центров (гиперскейл) и плотных вычислительных кластеров.Такой взгляд верно передаёт масштаб. И полностью упускает поведение.Проблема не в том, сколько энергии потребляют большие вычислительные системы, а в том, как
Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс
Предыдущая главаНу и наконец рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки, потому что теперь приходится учитывать еще один фактор - задержку. Так что давайте разбираться, как устроен инференс LLM и как его правильно масштабировать.Основы инференсаИтак, мы натренировали трансофрмер и теперь хотим использовать его по назначению - принимать на вход промпт и генерировать в ответ всякие разные новые последовательности токенов/букв.

