Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2
Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R‑Vision.В первой части эксперимента мы выяснили, как на производительность локальной LLM влияют длина контекста, количество параллельных запросов и объем генерируемого ответа. Стресс‑тесты позволили определить границы конфигурации Qwen3.5–122B‑A10B‑GPTQ, vLLM и NVIDIA RTX PRO 6000 Blackwell Max‑Q с 96 GB видеопамяти.
Локальный запуск LLM для SOC: сколько GPU действительно нужно?
Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R-Vision.Когда речь заходит о локальном запуске больших языковых моделей, обычно первым возникает вопрос стоимости инфраструктуры: «Self-hosted LLM — это десятки или сотни GPU?». Для обучения foundation-моделей или публичных сервисов с миллионами пользователей это действительно так. Но применение LLM внутри SOC устроено иначе.

