- BrainTools - https://www.braintools.ru -
В каталоге кейсов внедрения искусственного интеллекта [1] набралось 1352 проекта в российских компаниях и госорганах: от антифрода Сбера до распознавания сорняков с дронов у «Русагро». Каталог ведём мы в АНО «Цифровые платформы», кейсы в него добавляют сами компании и наша команда. Когда смотришь на внедрения 2025-2026 годов не по одному, а разом, видны закономерности: что повторяется из проекта в проект, где ломается и где приносит деньги. О них эта статья.
Главный вывод умещается в одну фразу. В кейсах, которые дошли до продакшена и до цифры, качество модели почти никогда не является решающим фактором. Решает обвязка: семантический слой, пороги уверенности, детерминированный код вокруг LLM, человек на границе. Ниже шесть паттернов с примерами.
Самые спокойные кейсы 2026 года устроены одинаково: LLM не подпускают к данным напрямую. В Первой Грузовой Компании ИИ-агент операционной аналитики [2] отвечает логистам на вопросы про выгрузку вагонов и выполнение плана. Но модель не пишет SQL. Между ней и хранилищем стоит семантический слой с описанными метриками и измерениями, а параметризованный запрос собирает конструктор. У агента нет прав на запись. Сводка по 150 объектам собирается за минуты вместо часа.
В Яндексе робот-документатор витрин данных на LLM [3] описал 15 000 таблиц за полгода против 500 за предыдущий год. Секрет не в модели: сначала робот собирает объективный контекст (схемы, глоссарий, связанные таблицы через граф), и LLM только дописывает поверх него. Вторая модель независимо оценивает результат. Итог: 92 процента семантического совпадения с проверкой человека и около пяти человеко-лет аналитиков.
В Альфа-Банке автономный агент на локальной Qwen 3.6-35B стал предсказуемым только после того, как всю детерминированную обработку данных вынесли в отдельные сервисы на Go, а модели оставили потребление результата. В ДОМ.РФ платформа интеллектуальной обработки документов на LLM и RAG держит классический ML на классификации и извлечении сущностей, а LLM включает только там, где нужен ответ в свободной форме. Это и есть рабочее определение корпоративного ИИ-агента сегодня: детерминированный код думает, модель говорит.
Ни один из крупных кейсов с деньгами не построен на полной автоматизации. Система CV-модерации фотоотчётов «Иваныч» в X5 [4] проверяет 10 млн фотоотчётов в месяц из 27 тысяч магазинов «Пятёрочки» и «Перекрёстка». Это 26 моделей и 62 типа проверок: классификаторы чистоты, детекция зон, VLM-проверки ценников, YOLO плюс OCR для сроков годности. На пороговых значениях уверенности подключается человек. Точность выросла с 79 до 92 процентов, операционные расходы на модерацию снизились вдвое, а большую часть жизни система работала на 4 vCPU и 16 ГБ памяти [5].
В VK Видео первая попытка заменить асессоров VLM-разметкой [6] провалилась. Сработал гибрид: дообученная Qwen3-VL-4B размечает поток, человек проверяет пограничные случаи, а качество контролирует Golden Set. Стоимость точки разметки упала в 60 раз, 4,5 млн примеров собрали за пять дней.
Самый честный кейс в этой группе у AGIMA: детектор промпт-инъекций [7] дообучали пять раз, в продакшен ушёл один раунд, три откатили из-за деградации. Ложные блокировки упали со 140 до 1 на 179 безопасных текстов. Пять раундов на один успешный это нормальная цена, просто о ней редко пишут.
Про длину надёжной цепочки инструментов в 2026 году есть уже не мнения, а измерения. Петрович-Тех сравнил облачные и локальные модели в агентной обвязке [8]: три модели (облачная Claude Sonnet, облачная Qwen3-235B и локальная Qwen3.5-9B на одной видеокарте) по трём сценариям, 27 запусков. Двухшаговая задача: успех во всех девяти прогонах, локальная 9B ничем не хуже. Трёхшаговая: локальная модель дала 100 процентов точности, облачные отклонились от инструкции. Пятнадцатишаговая: ни одного полного успеха из 27, и хуже всего то, что модели рапортовали о завершении, которого не было.
VK Tech с локальным ИИ-агентом на Ollama в закрытом контуре на арендованной A30 с двумя моделями (gpt-oss:20b и qwen3-vl:8b) получил ту же границу с другой стороны: надёжная работа до примерно шести последовательных вызовов инструментов.
Ответ на это ограничение тоже виден в кейсах, и он снова про обвязку. Команда GigaChain сделала профиль GigaChat для агентного фреймворка Deep Agents: десять промпт-блоков под классы отказов плюс middleware на уровне кода (LoopBreaker, ShellSafety, PathNormalizer). Точность GigaChat на 391 задаче выросла с 77 до 87 процентов, расход токенов упал почти вдвое. Модель не менялась.
Отсюда же рост MCP как корпоративного стандарта интеграции: платформа агентной разработки с mcp-hub в Авито, MCP-сервер дизайн-системы для агентов вёрстки в X5, MCP-сервер банковских операций для ИИ-агентов в Сбере. Агенту дают не «доступ к системам», а шесть-семь проверенных инструментов с контрактами.
Здесь два ряда цифр, и они противоречат друг другу только на первый взгляд. Узкие задачи. X5 подключил агенту вёрстки знание реальной дизайн-системы через MCP: экран стал занимать 2-3 часа вместо 8, команда из трёх человек делает 10 экранов в день вместо трёх. КОРУС Консалтинг сгенерировал моделями утилиту для выгрузки метаданных Qlik Sense, около тысячи строк, за шесть часов и 15 промптов.
Широкая задача. Пилот агентной разработки в Авито на 100 инженерах [9] с платформой из skills-hub, mcp-hub и Spec-Driven Development не дал статистически значимых изменений объективных метрик разработки. Качество не упало, удовлетворённость высокая, эффект в метриках отсутствует. Авито объясняет это J-кривой обучения [10] и считает окупаемость так: при зарплате 2500 долларов и подписке за 100 достаточно ускорения на 4 процента, то есть 6,4 часа в месяц.
Вывод для тех, кто это покупает: измерять надо конкретный процесс (вёрстка экрана, ревью, разбор инцидента), а не «производительность разработчиков». В MWS так и сделали: агент разбора инцидентов закрывает 45 процентов задач полностью, 40 частично, 15 требуют проверки.
Кейсы с подтверждённым рублём группируются вокруг процессов, где потери уже считали. ЕвроХим: ИИ-рекомендательная система на производстве удобрений [11] одного цеха на «Невинномысском Азоте» дала 270 млн рублей за 2024 год. Что изменилось физически: качество продукции проверяли раз в четыре часа, стали каждую минуту. Нижнекамскнефтехим после ухода Aspen и Honeywell меньше чем за год запустил отечественную систему усовершенствованного управления и получил 61 млн рублей за первые три месяца промышленной эксплуатации. ИИ-антифрод «Нейрощит» Т-Банка предотвратил потери на 170 млн за полгода, ИИ-антифрод Сбера сохранил клиентам 360 млрд за 2025 год. Авито Подработка заменила ручные правила субсидий ML-моделью: связка CatBoost и линейного программирования на A/B-тесте снизила расходы на надбавки на 9,3 процента.
У LLM-проектов деньги тоже есть, но масштаб другой. RAG-помощник для сотрудников отделений ВТБ [12]: поиск информации в 9 раз быстрее, 12 тысяч сотрудников, 75 млн рублей за 2025 год. ЦИАН перевёл модерацию объявлений на LLM: 2,2 млн объявлений в месяц, эффект 20-25 млн рублей в год. Это десятки миллионов, не миллиарды.
А вот у корпоративных LLM-платформ денег в кейсах пока нет, хотя охват впечатляет. Совкомбанк вывел LLM-платформу [13] на 34 тысячи сотрудников, 4000 инициатив за год, 30 проектов агентов, финансовый результат не раскрыт. Северсталь на платформе генеративного ИИ «Да Винчи» подтвердила 40 гипотез из 80, PnL-эффект планирует показать в 2026 году. Корпоративная платформа доступа к ИИ-моделям «Нейрошлюз» Ростелекома обрабатывает 470 тысяч запросов в месяц от 40 тысяч сотрудников, экономия 100 млн в год по внутренней оценке. Платформа даёт охват. Рубль даёт цех.
Параллельно с гонкой больших моделей в кейсах живёт другая линия, и она чаще доходит до устройства в руках. Яндекс распознаёт быстрые голосовые команды в колонках сетью весом 0,5-1,5 МБ: ложные срабатывания минус 60 процентов, потребление памяти минус 50. YADRO делает нейросетевую цветокоррекцию камеры планшета сетью на 8000 параметров: снимок 12 Мп за 0,45 секунды. Smart Engines определяет ориентацию документа для OCR детектором на 110 тысяч параметров за 15 миллисекунд, быстрее PaddleOCR в четыре раза при той же точности.
Там, где без больших моделей нельзя, экономия стала инженерной дисциплиной. SberDevices в контекстной ИИ-справке для телевизоров семантическим кэшем на Qdrant снизили расход токенов на два порядка. VK Cloud описал в разборе деградации продакшен-инференса LLM [14], как PagedAttention и FP8-квантизация KV-кэша поднимают пропускную способность в 2-4 раза, а tail-aware планирование режет p99 на 35-50 процентов. Wildberries через AIOps-платформу управления GPU поднял утилизацию GPU на 62 процента на одном кластере. Если у вас в бюджете GPU это заметная строка, эти три кейса стоят прочтения целиком.
ИТ-директору: спрашивать у вендора не «какая модель», а «что стоит между моделью и моими данными» и «где порог, за которым человек». Кейсы с подтверждённым рублём в каталоге можно отобрать фильтром по экономическому эффекту, их там около сотни на две с лишним тысячи проектов.
Внедренцу: начинать с процесса, где потери уже измерены (брак, фрод, расход сырья, модерация), закладывать пять раундов дообучения на один успешный и не обещать цепочки длиннее шести шагов.
Считаю, что через год спор о том, чья модель лучше, уйдёт из корпоративных кейсов совсем. Останется спор об обвязке: чей семантический слой, чьи guardrails, чей MCP-хаб. В 2026 году в этом споре уже есть измеренные ответы, и они в кейсах выше.
Автор: scheltsin
Источник [15]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35858
URLs in this post:
[1] кейсов внедрения искусственного интеллекта: https://platforms.su/projects/ai
[2] ИИ-агент операционной аналитики: https://platforms.su/project/4060
[3] робот-документатор витрин данных на LLM: https://platforms.su/project/4055
[4] CV-модерации фотоотчётов «Иваныч» в X5: https://platforms.su/project/4070
[5] памяти: http://www.braintools.ru/article/4140
[6] заменить асессоров VLM-разметкой: https://platforms.su/project/4054
[7] детектор промпт-инъекций: https://platforms.su/project/4068
[8] сравнил облачные и локальные модели в агентной обвязке: https://platforms.su/project/4085
[9] Пилот агентной разработки в Авито на 100 инженерах: https://platforms.su/project/4083
[10] обучения: http://www.braintools.ru/article/5125
[11] ИИ-рекомендательная система на производстве удобрений: https://platforms.su/project/2368
[12] RAG-помощник для сотрудников отделений ВТБ: https://platforms.su/project/2466
[13] вывел LLM-платформу: https://platforms.su/project/2476
[14] разборе деградации продакшен-инференса LLM: https://platforms.su/project/4086
[15] Источник: https://habr.com/ru/articles/1085314/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1085314
Нажмите здесь для печати.