gpu.
Локальный запуск LLM для SOC: сколько GPU действительно нужно?
Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R-Vision.Когда речь заходит о локальном запуске больших языковых моделей, обычно первым возникает вопрос стоимости инфраструктуры: «Self-hosted LLM — это десятки или сотни GPU?». Для обучения foundation-моделей или публичных сервисов с миллионами пользователей это действительно так. Но применение LLM внутри SOC устроено иначе.
Коробка с нейросетями: готовая ИИ-инфраструктура, которая просто работает
Коробка с нейросетями: готовая ИИ-инфраструктура, которая просто работает
Как мы вынесли семантический поиск на обычный сервер без видеокарты, облака и выделенной поисковой системы
Когда мы занялись поисковым слоем AI-ассистента в «Первой Форме», договорились на входе: языковую модель, которая отвечает пользователю, не трогаем. Вся эта история — о том, что происходит на шаг раньше: как система решает, что именно показать модели, прежде чем та начнёт отвечать.Планку себе поставили простую на словах и сложную на деле: семантический поиск промышленного уровня, но без специализированной инфраструктуры, целиком внутри изолированной сети, на том же оборудовании, что и само приложение.
Перенёс ByteTrack на GPU и ускорил мульти-камерный трекинг в 6 раз
Как я взял самый популярный трекинг-алгоритм, заставил его считать математику всех камер одним GPU-батчем — и по дороге трижды наступил на грабли, о которых стоит знать каждому, кто пишет real-time пайплайны на PyTorch.
Всё, что вы хотели знать про локальные LLM, но боялись заинференсить
Хардкорный NIAH или почему у Gemma 26B память рыбки, какой Qwen лучше, и что показали 8 моделей на RTX 5090Привет, Хабр.Меня зовут Артём Хакимов, я работаю в команде GPUGO.Большая часть наших пользователей, которая не создаёт ИИ-подружек, работает с LLM — кто-то дообучает, кто-то гоняет инференс. И у всех одни и те же вопросы: «что быстрее?», «сколько контекста влезет?», «какой квант брать?».
AI ready: почему дата-центр для ИИ сложнее обычного модульного ЦОДа
В первой статье я рассказал, как мы пришли к идее AI ready — локального контура, который собирает инженерную базу, вычисления и прикладной ИИ в одну систему. Теперь подробнее про первый «железный» уровень ИИ-контура — AI Base.Идеи есть у многих, до пилота добираются единицы. Мы думали: возьмём концепцию модульного ЦОДа, немного подобьём её под стойки с GPU, и наш пилот полетит. В МЦОДе уже решены базовые задачи по компоновке, комплектации и автоматике — так зачем изобретать велосипед? Но первая гипотеза провалилась, как только мы начали считать нагрузку.
Запускаем LLM локально на майнинг ферме из 4 GPU
В последнее время становится все более популярным локальный запуск LLM. У каждогг свои причины, но основные это: проблемы с западными сервисами, нестабильный интернет и утечка данных в открытый доступ (преценденты уже были).В этой статье я расскажу как запускал LLM локально на майнинговом железе, какие тонкости есть при запуске. Расскажу архитектуру моей сборки и примерную стоимость железа. Также протестирую скорость работы с некоторыми наиболее популярными MoE LLM, включая модели от гугла и ChatGPT. По поводу целесообразности подобных сборок решение каждый примет сам исходя из своих задач и финансовых ресурсов.
Полез в исходники vLLM, чтобы понять, почему один символ убивает prompt caching
В первой части я вывел одно правило и предложил жить по нему: стабильное в начало, изменчивое в хвост
Нейро сети для самых маленьких. Часть первая (которая после нулевой). Удобство в прокрустовом ложе оптимизации
Это первая (после нулевой) статья из серии Нейро сети для самых маленьких, в которой мы разбираем инфраструктуру для запуска нейронных сетей.Для обучения и инференса нейросетей и для любых видов High Performance Computing используются специализированные технологии: GPU/TPU, RDMA, Kernel bypass, NVLink, InfiniBand, RoCE и другие. Про некоторые из них большинство только что-то слышали, но сталкиваться с ними не приходилось.Нельзя просто взять ванильный стек Linux, воткнуть в него 400 Gb Ethernet+IP и получить рабочее решение. Почему?

