LiteLLM.

Маршрутизация ИИ-моделей: когда одной модели недостаточно

продолжить чтение

От десятка подписок к единому шлюзу LiteLLM: что пошло не по плану

Привет! Я Владимир Мокроусов, сисадмин в группе компаний «Синтека». Мы создаем софт для строительной отрасли и активно используем в работе ИИ-модели. 

продолжить чтение

Свой инференс для 25 разработчиков: 452:1, KV‑пул и почему это не экономит денег

Все цифры сняты с работающего стенда: потребление токенов — за календарную неделю по данным шлюза, метрики движка — кумулятивно за период аптайма (11 426 обработанных запросов). Продолжение — про выбор модели по замерам, а не по бенчмаркам — будет отдельной статьёй.Для кого эта статьяДля тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не введение в трансформеры.

продолжить чтение

Как собрать AI-контур на VPS: подписки ChatGPT и Claude, OmniRoute, LiteLLM и разработка без VPN

Думаю, практически каждый разработчик из России рано или поздно задавался вопросом: можно ли наконец перестать плясать с VPN и прокси, чтобы просто пользоваться нейросетями — и в собственных проектах, и непосредственно во время разработки?

продолжить чтение

Что такое LiteLLM и для чего его едят

Если вы или ваша команда уже используете LLM или планируете интегрировать их в проект, то наверняка у вас возникал вопрос, как лучше и красивее написать такой интерфейс, который мог бы общаться с разными моделями. И на такой вопрос уже есть ответ.

продолжить чтение

Завод ИИ-агентов в одном терминале через оркестрацию

С детства я смотрел фильмы, где люди разговаривают с компьютерами, и каждый раз думал — ну когда уже. Когда можно будет сказать машине что делать, а она сделает.

продолжить чтение

Как мы построили корпоративную LLM-платформу: архитектура, грабли и выводы

Привет! Меня зовут Артём, я руковожу группой цифровой трансформации в Sminex. Последние два года моя команда занимается внедрением AI в компанию. В реальности это куда менее гламурная история, чем звучит: про прокси-слои, отладку промптов в Langfuse и бесконечные «Почему модель опять ответила не то?».В этой статье расскажу, как мы с самого начала пошли в LLM-платформу — а не в «одного бота», почему это было правильным решением и какие грабли мы всё равно собрали по дороге.Почему мы сразу пошли в платформу

продолжить чтение

Auto AI Router: высокопроизводительный прокси-роутер для LLM API на Go

Если вы работаете с LLM-провайдерами, то наверняка сталкивались с одной и той же проблемой: у OpenAI лимит 100 RPM на ключ, у Vertex AI — свои квоты на проект, у Anthropic — отдельные ограничения. В итоге приходится держать несколько ключей, балансировать нагрузку вручную, следить, чтобы один заблокированный доступ не уронил всё приложение, и при этом хочется сохранить единый OpenAI-совсместимый эндпоинт для клиентского кода.Именно для этого и создан Auto AI Router

продолжить чтение

Как подключить Langfuse к LLM через JWT?

Langfuse, помимо трассирования запросов, удобно использовать для prompt management и LLM‑as‑a-judge. Но в корпоративной среде он упирается в простую вещь: LF работает со статическим API key, а ваш inference gateway — нет. Если gateway требует короткоживущий JWT, Langfuse не умеет его получать. И в этот момент интеграция ломается.Мы столкнулись именно с такой ситуацией. Модели self‑hosted, OpenAI подобный API, но для доступа к нему на каждый запрос нужен JWT, который выдаётся централизованным провайдером. Langfuse в LLM Connection умеет передать API key и заголовки, но не сможет сам сходить в auth‑сервис, получить временный токен и подставить его в запрос.

продолжить чтение

Маленький LLM-чат на Python с Ollama и LiteLLM. Часть 3: добавляем историю сообщений и контекст

Во второй части у нас получился уже не одноразовый скрипт, а маленький консольный чат: программа принимает вопрос, отправляет его модели, печатает ответ и ждёт следующего ввода.Но пока у этого чата есть важное ограничение: каждый новый запрос для модели почти независим.Если сначала спросить:Составь простой план изучения Python на 2 недели.а потом написать:Сделай его короче и оставь только самое важное.модель может ответить нормально. А может и не понять, к чему относится слово «его». Потому что для неё второй запрос — это просто новый отдельный вызов.

продолжить чтение

12