NVIDIA выпустила PAIR — виртуальный маршрутизатор локального инференса для домашних ПК
NVIDIA представила
Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле
Разговор повторяется примерно раз в месяц, с небольшими вариациями.— Мы за API платим уже прилично. Может, купим карту и будем гонять у себя? — Может. Сколько токенов в месяц жжете? — Ну... много.Вот на этом месте всегда наступает пауза. Потому что «много» никто не считал, а без этой цифры весь разговор превращается в обмен ощущениями.
Пора переезжать на локальные LLM. Или нет?
Нет большой разницы в инструментах, когда речь идет о создании простеньких чат-ботов. Но когда вы работаете над продуктом посерьезнее, например создаете сложного AI-агента или работаете с чувствительными данными, облачные LLM начинают выставлять счета. И не только финансовые.Что если переход на локальную инфраструктуру (вроде Ollama) это решение, которое не просто поможет сэкономить, но изменит саму динамику разработки?Налог на итерацию

