Откройте бэклог любого крупного магазина и найдите там задачу «поправить сортировку в блоке „с этим товаром покупают“». Обычная задача, полдня работы, идёт в общей очереди. Двадцать лет назад ровно эта штука была темой статей в IEEE, а до того темой диссертаций. Сейчас это один из блоков задач. Владельца у него нет, есть компонент в джире.
Ещё в том же бэклоге почти наверняка лежит «включить AI‑поиск», с приоритетом выше. Хотя поиск с исправлением опечаток и синонимами у вас работает с 2015 года и называется просто «поиск».
Вот про этот зазор я и хочу написать.
Эффект и его название
Наблюдение старое: как только задача решена, она немедленно перестаёт казаться требующей интеллекта. У него есть имя, AI effect, и есть каноническая формулировка, приписываемая Ларри Теслеру: интеллект это то, чего машины ещё не умеют. Хофштадтер вставил её в «Гёделя, Эшера, Баха» как «теорему Теслера», оттуда фраза и разошлась.
Но лучше всех это описал Тьюринг, за тридцать лет до того, как эффект заметили. В статье 1950 года у него есть раздел, который он называет «аргумент от неспособностей»: туда он складывает все возражения вида «машина никогда не сможет X». Тьюринг перечисляет десяток таких X (шутить, ошибаться, влюбляться, быть предметом собственной мысли) и замечает, что список этот основан не на анализе, а на индукции по прошлому опыту, и потому будет сокращаться. Что список сократится, а структура возражения останется, он понимал тоже. Читается как хроника следующих семидесяти лет.
Механизмов у эффекта несколько, и они не конкурируют.
Первый, самый простой: «интеллект» у нас определён через незнание. Пока механизма нет, есть загадка. Появился механизм, и это уже «просто BM25», “просто ALS”, «просто градиентный бустинг».
Второй, парадокс Моравека: наш список «требующего интеллекта» изначально был не про интеллект, а про редкость среди человеческих умений. Шахматы туда попали потому, что трудны для людей. Узнавание лиц не попало потому, что достаётся бесплатно.
Третий, и для практики самый важный: удачные куски отваливаются от ИИ и получают собственные имена. Причём в e‑commerce они отваливаются не в отдельную научную дисциплину, а в конкретный сервис, который поддерживает конкретная команда, а через два года не поддерживает никто.
Теперь по стеку
Дальше я просто пройду по типичному магазину и покажу, где внутри лежат бывшие темы исследований. Смысл упражнения не в ностальгии. Смысл в том, что от того, как вещь называется, зависит, кто за неё отвечает.
Поиск
Исправление опечаток. Soundex запатентован в 1918 году, работа Дамерау про типы опечаток вышла в 1964, метрика Левенштейна в 1965. К концу девяностых это ещё было темой для статей, в начале двухтысячных Google повесил «возможно, вы имели в виду», и всё закончилось. Сейчас у вас это плагин к Elastic или встроенная фича, и правит её тот, кто последним трогал маппинг.
Расширение запроса синонимами, лемматизация, разбор запроса на атрибуты («красные кроссовки 42 размера дешевле 5000» превращается в набор фильтров). Это information retrieval и NLP в чистом виде, десятки лет работы. В джире называется «поиск не находит».
Ранжирование. Learning to rank, RankNet и LambdaMART середины двухтысячных, всё это было на конференциях. Сейчас: «почему на первом месте выдачи какая‑то ерунда».
Поиск по фото. Вот он пока ещё называется ИИ, потому что не везде работает. Дайте ему три года.
Каталог
Категоризация товаров из фида поставщика. Классификация текста по дереву на десять тысяч листьев, задача, на которой в двухтысячных писали диссертации. Сейчас это «мэппинг фида», и в половине магазинов её делает человек руками, а в другой половине модель, которую никто не переобучал с момента запуска.
Извлечение атрибутов из описаний. Named entity recognition плюс нормализация значений. Называется «обогащение карточки».
Матчинг товарных предложений между собой, чтобы понять, что «Samsung Galaxy S24 8/256 черный» у трёх поставщиков это один SKU. Это entity resolution, ей больше пятидесяти лет (Феллеги и Сантер, 1969, изначально из статистики записей о населении). В маркетплейсе называется «склейка офферов» и является постоянным источником инцидентов: склеили неправильно, и цена показывается от одного продавца, а товар отгружает другой.
Дедупликация картинок и удаление фона. Computer vision, ещё в 2015 году это была бы отдельная гордая строчка в презентации. Называется «подготовка контента».
Рекомендации
Термин collaborative filtering появился в проекте Tapestry в Xerox PARC в 1992 году, дальше GroupLens в 1994. Amazon получил патент на item‑to‑item коллаборативную фильтрацию в конце девяностых и в 2003 опубликовал статью в IEEE Internet Computing, которая до сих пор самая цитируемая в области. Netflix Prize шёл с 2006 по 2009 год: миллион долларов, три года работы сотен команд, и матричные разложения оттуда вышли в мейнстрим.
Всё это сегодня называется «блок рекомендаций». Причём в самом характерном варианте: блок стоит на карточке товара, приносит несколько процентов оборота, и на вопрос «когда его последний раз мерили» ответа нет.
Отдельно про цифры. Есть широко цитируемое утверждение, что 35 процентов покупок в Amazon идут через рекомендации. Оно ходит по презентациям с 2013 года, восходит к отчёту McKinsey, и первоисточника, где эту цифру считали бы, я не нашёл. Если вставляете её в свою презентацию, знайте, что это фольклор. Прочнее цифра Netflix: в статье Гомеса‑Урибе и Ханта 2015 года авторы, сотрудники компании, пишут, что около 80 процентов просмотренных часов приходит из рекомендаций. Это тоже не независимое измерение, но хотя бы известно, кто считал.
Цена
Перепрайсинг под конкурента: парсинг чужих цен, эластичность, ограничения на маржу, оптимизация. В экономике это старая теория, в проде это «репрайсер». Кто‑то из аналитиков ставит ему правила, и правила эти обычно нигде не описаны.
Оптимизация скидок и промо, прогноз каннибализации между акциями. Называется «маркетинговый календарь».
Персональные цены. Тот случай, когда переименование пошло в обратную сторону: пока это называлось словом «оптимизация», проблем не было, а как только публика поняла, что разным людям показывают разные цены, появились регуляторы. Про это ниже.
Антифрод и платежи
Скоринг заказов на мошенничество. В восьмидесятых это были экспертные системы, гордость направления ИИ. Потом логистическая регрессия, потом бустинг, потом графовые модели на связях устройств, карт и адресов. Сейчас это «антифрод», он либо свой, либо покупной, и в обоих случаях его правила целиком знает один человек в компании.
Скоринг в рассрочках и BNPL: та же история, только последствия ошибки денежные и сразу.
Risk‑based authentication в 3DS, когда систему просят решить, гонять ли пользователя через подтверждение. Формально это модель, принимающая решение, которое напрямую влияет на конверсию. Называется «настройки эквайринга».
Логистика и склад
Маршрутизация курьеров. Задача о маршрутах транспорта, одна из центральных в комбинаторной оптимизации, ставится с 1959 года, литературы необъятно. Называется «планировщик доставки».
Прогноз спроса и автозаказ. В восьмидесятых был знаменитый XCON в DEC, экспертная система, конфигурировавшая заказы на VAX; тогда это был флагманский пример прикладного ИИ, про который писали книги и считали экономию в миллионах. Сейчас прогноз спроса это модуль ERP с названием вида «пополнение», и настраивает его закупщик, у которого нет ни валидации, ни бэктеста.
Раскладка товара по складу под минимизацию пути сборщика. Amazon купил Kiva Systems в 2012 году примерно за 775 миллионов, и это было большое событие в робототехнике. На складе это теперь просто «как система говорит».
Прогноз даты доставки, который вы показываете на карточке. Регрессия на исторических данных перевозчиков. Называется «срок доставки», и когда он врёт, тикет уходит в поддержку, а не к тому, кто владеет моделью. Хотя врёт именно модель.
Клиент
Прогноз оттока, LTV, склонность к покупке категории. Сейчас это «сегмент в CDP», который маркетолог собирает мышкой в интерфейсе, не подозревая, что под мышкой модель.
Триггерные цепочки на брошенную корзину: правила плюс модель выбора времени отправки.
Модерация отзывов, детект накрутки, детект отзывов от конкурентов. Text classification и графовый анализ. Называется «модерация».
Рекомендация размера, чтобы снизить возвраты. Эта задача до сих пор наполовину в рубрике «ИИ», потому что до сих пор плохо работает. Хороший индикатор: рубрика следует за качеством, а не за сложностью.
Поддержка. Маршрутизация тикетов и автоответы были ИИ, стали «виджетом», а потом вернулись обратно в рубрику ИИ вместе с LLM. Что как раз показывает: процесс не односторонний.
Сводно
|
Было (и когда было исследованием) |
Как называется у вас в джире |
|---|---|
|
Spelling correction, IR (1960-е, 1990-е) |
Поиск |
|
Learning to rank (2005–2010) |
Сортировка выдачи |
|
Text classification (1990-е, 2000-е) |
Мэппинг фида |
|
Entity resolution (с 1969) |
Склейка офферов |
|
Collaborative filtering (1992–2009) |
Блок рекомендаций |
|
Экспертные системы, прогноз спроса (1980-е) |
Пополнение в ERP |
|
Vehicle routing (с 1959) |
Планировщик доставки |
|
Fraud detection (1990-е) |
Антифрод |
|
Churn prediction (2000-е) |
Сегмент в CDP |
|
Computer vision (2012–2018) |
Подготовка контента |
Обратный эффект
Схема была бы красивой, если бы работала в одну сторону. Но последние года три идёт и обратный процесс: «AI» приклеивают ко всему подряд, потому что это влияет на оценку компании и на конверсию лендинга. Причём приклеивают, в том числе, к вещам, которые как раз успели стать скучными: генерация описаний товаров, «AI‑поиск» вместо того же самого поиска, «AI‑персонализация» вместо коллаборативной фильтрации 2003 года.
То есть термин ходит туда‑сюда не только по мере решения задач. Он ходит ещё и по мере денег. В конкретном разговоре о конкретной фиче полезно понимать, какая из двух сил на неё сейчас действует, потому что от этого зависит, дадут вам людей или нет.
Почему это не филологическое наблюдение
Теперь то, из‑за чего вообще стоило всё перечислять.
Пока штука называется ИИ, у неё есть отдельная команда, отдельный дашборд, отдельный owner, и её результаты кому‑то показывают. Как только она стала «функцией», всё это уезжает. Уезжает предсказуемым образом.
Нет владельца. У блока рекомендаций нет владельца, потому что владельцы бывают у продуктов, а не у блоков. На вопрос «чья это метрика» отвечают «ну, общая конверсия».
Нет мониторинга качества, только мониторинг доступности. Сервис отдаёт 200, значит, работает. То, что он полгода отдаёт один и тот же товар всем, не увидит никто: алерт на 200 стоит, на распределение выдачи не стоит. А дрейф в e‑commerce быстрый. Сменился сезон, ушёл крупный поставщик, перетряхнули дерево категорий, и модель, обученная в марте, в октябре предсказывает не то. Модель, которая называется ИИ, переобучается по расписанию. Модель, которая называется функцией, переобучается когда вспомнят.
Нет постмортемов. Инцидент, где виноват отказ сервиса, разбирают. Инцидент, где сервис отработал и просто дал плохой результат, не разбирают, потому что формально инцидента не было. Классика жанра: репрайсер уронил цену почти до нуля из‑за битого фида конкурента, и всё раскупили за час. Такие истории пересказывают в курилке, а не в базе знаний.
Нет ответственности за отказ. Антифрод отклонил хорошего клиента, тот ушёл. Метрики ложных отклонений у вас, скорее всего, нет вообще, потому что она не попадает в воронку: человек, которого не пустили, покупателем не стал, а значит, в отчётах его нет.
Регуляторика приходит позже, чем переименование. Пока персонализация была технической деталью, никто не спрашивал. Потом в ЕС появились требования к прозрачности рекомендательных систем и к возможности отключить профилирование, вопросы к персональным ценам, требования к автоматизированным решениям в GDPR. И выяснилось, что объяснять регулятору логику блока, у которого нет владельца, некому. Актуальные формулировки прошу проверить самостоятельно, эта область меняется быстрее, чем пишутся статьи.
Отсюда мой основной тезис. Из AI effect обычно делают меланхоличный вывод: через пять лет половина сегодняшних чудес будет называться скучным словом, и обсуждать станет некому. С первой половиной я согласен. Со второй нет.
Рекомендательные алгоритмы стали «просто функцией» ровно тогда, когда начали решать, что смотрит и покупает полмиллиарда человек. Не до и не после. Скучное имя не значит, что вещь перестала быть важной. Оно значит, что её перестали рассматривать отдельно: она больше не тема, а фон, а с фона отчёта не требуют.
То есть переименование это не потеря значимости, а потеря надзора. И практический вывод получается неожиданно приземлённый. Составьте список того, что у вас в проде принимает решения и при этом называется не моделью, а функцией. У каждого пункта найдите четыре вещи: владельца, метрику качества (не аптайм), дату последнего переобучения и правило откатки. Скорее всего, у половины пунктов чего‑то из четырёх не окажется, и это будет самая полезная страница в вашей документации за год.
Оговорка
AI effect слишком удобная фигура. Ей легко отбивать любую критику: вы просто передвигаете ворота. Иногда правда передвигают. А иногда возражение по делу.
Deep Blue не понимал шахматы в том смысле, в каком это себе представляли до 1997 года, и отказ называть его интеллектом был отчасти уточнением понятия, а не защитной реакцией. Точно так же, когда кто‑то говорит «ваша персонализация это не ИИ, это три правила и сортировка по популярности», он вполне может быть прав по факту. Снаружи оба случая выглядят одинаково, и общего способа их различать я не знаю. Если у кого‑то есть, напишите в комментариях, мне правда интересно.
Автор: IvanBudnik


