gpu.

gpu.

Как устроены LLM: разбираем на примере 3-уровневой абстракции

Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением

продолжить чтение

Может ли дата-центр вообще отказаться от воды?

Немного экспериментальный формат, который надеюсь, вам зайдет. Мне лично очень нравится изучать разные темы вне статистики, аналитики и прикладных к ним темам, поэтому иногда для того, чтобы лучше разобраться с какой-то темой лучше всего ее попробовать объяснить или описать самостоятельно.В данном материале речь пойдет про ИИ, но немного с непривычного формата - попробуем разобраться, зачем охлаждают и чем сейчас охлаждаются дата-центры

продолжить чтение

Запустить LLM локально: что считать до покупки видеокарты?

Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса

продолжить чтение

Кто остановит AGI: законы или мегаватты?

В последние месяцы снова активизировались призывы притормозить развитие наиболее мощных AI-систем. Причём теперь они исходят уже не только от политиков и сторонних экспертов. Руководители крупнейших AI-компаний сами обсуждают необходимость замедлить гонку, ввести независимый контроль и договориться о правилах, которые позволили бы остановиться, если дальнейшее развитие станет слишком опасным.

продолжить чтение

Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК

Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье

продолжить чтение

Два года, один человек, 66 контейнеров: как я построил AI‑платформу на железе под столом

продолжить чтение

Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же

Я прогнал топ выдачи Google по «llm vram calculator» — от самого навороченного до однокнопочных. Все ошибаются в одном и том же: ни один не моделирует, что движок резервирует почти всю память под пул заранее, а не раздаёт её под KV по мере запросов. Ответ «сколько запросов влезет» из-за этого всегда мимо.Наивное большинство спотыкается ещё и о геометрию KV: на DeepSeek-V2-Lite обычная формула завышает память почти на порядок (в 7–11 раз). Разбираю обе ловушки и сверяю числа с живым vLLM.Ошибка №1: движок забирает память заранееПишете две строки:from vllm import LLM llm = LLM("meta-llama/Meta-Llama-3-8B-Instruct")

продолжить чтение

Perfscale news #9. GPU, LLM, Docker images

Приветствую, любители нагрузки. Для истории прошлые выпуски:Новости Perfscale № 1Perfscale news #2: Fix Protocol, Magic metrics и MCPperfscale news #3 Websocket, Inference, NPMPerfscale news #4. GRPC, Fixed Triggers, Child ProcessPerfscale news #5. SQL, Thresholds, неработающие Linked AccountsPerfscale news #6. GraphQL, поддержка Import, и метрикиPerfscale news #7. Fix Import, SOAP, and more HTTP metrics

продолжить чтение

ИИ потребляет энергию рывками. Энергосеть к такому не готова

Стремительный рост ИИ-инфраструктуры почти всегда описывают как проблему энергии. Дата-центры будут потреблять всё большую долю мирового электричества: по оценке Международного энергетического агентства (МЭА), в пределах этого десятилетия на них придётся 3–4% глобального потребления. Энергокомпании уже переписывают долгосрочные прогнозы под рост сверхкрупных дата-центров (гиперскейл) и плотных вычислительных кластеров.Такой взгляд верно передаёт масштаб. И полностью упускает поведение.Проблема не в том, сколько энергии потребляют большие вычислительные системы, а в том, как

продолжить чтение

Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс

Предыдущая главаНу и наконец рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки, потому что теперь приходится учитывать еще один фактор - задержку. Так что давайте разбираться, как устроен инференс LLM и как его правильно масштабировать.Основы инференсаИтак, мы натренировали трансофрмер и теперь хотим использовать его по назначению - принимать на вход промпт и генерировать в ответ всякие разные новые последовательности токенов/букв.

продолжить чтение

123456...1020...21