llm.
Неделя OCR для LLM — в Telegram-канале Smart Engines
неделя OCR для LLMПривет, Хабр!Объявляем тематическую неделю, посвященную OCR для LLM и интеллектуальной обработки документов без галлюцинаций и «додумывания» данных. Расскажем, как устроено полнотекстовое распознавание Smart Engines
Сколько инструментов показывать языковой модели: гипотеза, которую перечеркнул замер
У нашего ИИ-оркестратора более девяноста инструментов: работа с таблицами, документами, почтой, задачами, веб-страницами, презентациями и т.д.При обработке запросов модель на каждом шаге выбирает, какой из них вызвать. Вопрос, который периодически всплывает: сколько из них ей показывать за раз — все или только те, что подходят к запросу?Наш оркестратор умеет работать как с большими облачными моделями, так и с маленькими, которые помещаются на бытовой видеокарте. Минимальный рабочий вариант: RTX 3090 24Gb + Qwen3.6 27B.
Cached input растёт квадратично
TL;DRВ типичных агентских сценариях объем cached input токенов растет квадратично относительно количества ходов. Хорошая модель — модель которая решает задачу за минимальное количество ходов. Цена кэшированного чтения — определяющая характеристика стоимости инференса.Вместо введенияЕдинственная причина, по которой современные авторегрессионные трансформеры вообще пригодны для инференса — это использование KV кэша, без которого каждый следующий токен требовал бы
Запускаем множество ИИ на телефоне без интернета в новом формате CMF
Cortiq Mobile — приложение для Android и iOS (пока нет в Appstore, проходит проверку) с открытым кодом, которое запускает модели формата CMF прямо на телефоне. Сейчас производительность телефонов в некоторых случаях превышает производительность ПК поэтому небольшие LLM модели вполне можно использовать для работы. В самолёте без сети оно отвечает на вопрос, переводит письмо и разбирает текстовый файл. Дома, в доверенной сети, тот же телефон отдаёт ноутбуку локальный API или возвращает программе структурированное решение вместо чат-реплики.
Claude забанил: AI‑сервисы с подпиской, работающие из России
Всем привет! Нет, я не навайбкодил очередную обёртку над OpenRouter и не буду продавать её в этой статье. Повод не случайный: очередная массовая волна банов от Anthropic — на этот раз банят даже давно живущие, трастовые личные аккаунты.Кто я: Лёша Жиряков, амбассадор агентной AI‑разработки, веду воркшопы, делюсь опытом. Меня на них часто спрашивают, на чём жить, если основные инструменты отвалились. Код писать надо вчера, а что вообще пускает с российского IP, толком никто не знал. Я взял curl и прошёлся по 25 сервисам.TL;DR: с домашнего IP, без VPN и прокси, по 25 сервисам: живых 9
FAIRouter. Мы научили ИИ выбирать лучшую LLM модель для каждой задачи
Привет, Хабр! Мы выложили в открытый доступ библиотеку FAIRouter, которая выбирает LLM-исполнителя под задачу, а после ответа принимает у него работу.В мире, где количество больших языковых моделей (LLM) растет в геометрической прогрессии, а их возможности и стоимость сильно варьируются, встает вопрос: как выбрать именно ту модель, которая идеально подойдет для конкретной задачи, обеспечит наилучшее качество и при этом будет экономически эффективной? Для решение вышеописанной проблемы мы разработали обучаемую систему автоматической маршрутизации запросов FAIRouter.
Зачем Авито нужна своя Inference-платформа для ML-LLM-сервисов: PaaS vs отдельное решение
Привет, Хабр! Меня зовут Антон Алексеев, я ML Ops-инженер в Авито.В этой статье я разберу, почему существующий PaaS — отличный инструмент для веб-сервисов, но плохо подходит для ML/LLM-Inference, и с какими похожими проблемами сталкиваются крупные компании, у которых те же задачи.Также расскажу, почему было принято решение не дорабатывать PaaS под Inference, а строить отдельную Inference-платформу на базе готового open-source ядра, и почему этот путь оказался предпочтительнее.
ИИ-ревью, или как я себя чуть не уволил
AI-ревьюер для GitLab, который проверяет не отдельный merge request, а всю задачу сразу, во всех сервисах, которые она задела. И почему для этого понадобился агент, а не анализ diff через API.

