Почему ML-модель в андеррайтинге находит только то, что вы и так знали. data lake.. data lake. feature store.. data lake. feature store. glm.. data lake. feature store. glm. ML в бизнесе.. data lake. feature store. glm. ML в бизнесе. uplift-моделирование.. data lake. feature store. glm. ML в бизнесе. uplift-моделирование. андеррайтинг.. data lake. feature store. glm. ML в бизнесе. uplift-моделирование. андеррайтинг. инженерия данных.. data lake. feature store. glm. ML в бизнесе. uplift-моделирование. андеррайтинг. инженерия данных. Машинное обучение.. data lake. feature store. glm. ML в бизнесе. uplift-моделирование. андеррайтинг. инженерия данных. Машинное обучение. страхование.. data lake. feature store. glm. ML в бизнесе. uplift-моделирование. андеррайтинг. инженерия данных. Машинное обучение. страхование. тарификация.

В кулуарах страховых форумов приходится слышать «технологии ИИ сильно переоценены», «мы поставили модель, но результата нет». Хотите об этом поговорить?

Возьмем стандартный случай. Начальство одобряет проект: внедряем машинное обучение в андеррайтинг массовых видов. Нанимают дата-сайентистов, покупают лицензии, обучают градиентный бустинг на исторических данных. Проходит полгода. Сравнивают с действующей тарифной моделью — и прирост точности оказывается в пределах погрешности. И начинается поиск виноватых.

Двадцать лет я занимаюсь аналитикой в страховании, из них большую часть — в ДМС и андеррайтинге в том числе. И кажется, мне есть что сказать по вопросу: что на самом деле отличает ML от привычного GLM; и что стоит за модной темой каузальных моделей, которые сейчас показывают на каждом демо.

Речь пойдёт про массовые виды: ОСАГО, каско, розничный ДМС, имущество физлиц.

Откуда взялся тариф, который работает до сих пор (небольшой исторический экскурс)

Обобщённые линейные модели придумали Джон Нелдер и Роберт Веддербёрн в 1972 году. Актуарии на них смотрели долго и настороженно: в тарификацию массовых видов GLM пришли только к концу 1990-х. Зато пришли надолго — до сих пор это основной инструмент ценообразования в non-life по всему миру, и в России тоже.

Механика такая. Берёте историю убытков, задаёте набор факторов, и модель для каждого фактора выдаёт коэффициент: насколько он двигает частоту убытка или его размер. Возраст, стаж, регион, мощность двигателя, семейное положение. Итоговая премия собирается из базовой ставки, перемноженной на эти коэффициенты.

Почему GLM пережил три волны технологической моды и никуда не делся? Потому что его можно объяснить. На любой вопрос — от регулятора, от клиента, от суда — есть конкретный ответ. Вот фактор, вот его коэффициент, вот статистика, из которой он получен. Для отрасли, где тариф проверяют, оспаривают и иногда отменяют, это важно.

Здесь хочу остановиться, потому что в разговорах «традиционные методы против ИИ» часто рисуют как что-то примитивное. Это несправедливо. GLM — полноценная статистическая модель: с проверкой значимости факторов, с оценкой качества подгонки, с распределением, подобранным под характер убытков. Люди, которые двадцать лет строили на этом тарифы, знают про свои данные больше, чем любая модель, обученная за неделю.

Что машинное обучение реально добавляет

Между GLM и градиентным бустингом нет разрыва в математике. И линейная регрессия, и бустинг, и нейросеть стоят на одном фундаменте — теория вероятностей плюс матстатистика. Никакой новой науки под тарификацию за тридцать лет не подвели. Отличия в другом.

GLM — параметрическая модель. Вы заранее объявляете, какой формы зависимость и из какого семейства распределение, а дальше метод максимального правдоподобия подбирает коэффициенты. Если в данных сидит нелинейность или взаимодействие факторов, о нём надо догадаться самому и вписать руками. Добавить квадрат возраста. Завести отдельный фактор «молодой водитель на мощной машине». Актуарии так и делают, и хороший актуарий половину таких взаимодействий знает наизусть.

Бустинг и случайный лес форму зависимости заранее не спрашивают. Они выучивают её из данных и подхватывают взаимодействия, которые никто явно не задавал. В том числе такие, до которых человек бы не додумался — сочетание из десятка факторов, каждый из которых по отдельности выглядит безобидно.

Вот это и есть настоящее преимущество: способность работать в широком пространстве признаков и вытаскивать оттуда сочетания, которые аналитик не выпишет вручную.

Запомните формулировку, дальше она понадобится.

Шесть полей анкеты

Шесть признаков в модели против двухсот необходимых

Шесть признаков в модели против двухсот необходимых

А теперь посмотрим, что в типичном проекте реально попадает в модель.

Пол. Возраст. Стаж. Регион. Мощность. Семейное положение. Плюс еще несколько полей из заявления. В сумме — от шести до пятнадцати признаков, и все они взяты из той же анкеты, на которой стоит действующий тариф.

Вопрос: что нового модель должна найти в этих данных?

Вы серьезно думаете, что наши актуарии и андеррайтеры — недалекие люди, которые не выжали из этого руками все, что было можно? Что молодые бьются чаще, а стаж снижает частоту? Что женщины ходят в поликлиники чаще мужчин, а при близости медучреждения к офису растет частота обращений? Взаимодействия второго порядка внутри такого набора актуарии тоже перебрали, потому что их немного и они на виду.

Бустинг отрабатывает и находит примерно то же самое. Иногда чуть точнее за счёт нелинейностей, которые в GLM не заложили. Но прирост точности тарификации получается такой, что его съедает стоимость поддержки модели, мониторинга дрейфа и объяснений регулятору.

Мне нравится сравнение с мотором. Вы поставили мощный двигатель в телегу, а она не стала болидом формулы 1.

Чего не хватает

Для хорошей жирной работы ML нужны сотни признаков. Тонкие закономерности живут в данных, которых в анкете нет и никогда не было.

Что можно было бы подать в модель, будь эти данные собраны и связаны между собой (ключевое!).

Поведение при покупке. Сколько раз человек заходил на расчет, прежде чем оформить. Менял ли параметры в калькуляторе и в какую сторону — увеличивал франшизу или убирал. Сколько прошло от первого расчёта до оплаты. Купил в последний день действия старого полиса или за месяц.

История отношений с компанией. Сколько лет клиент. Были ли перерывы. Как быстро платит. Менял ли условия посреди срока. Звонил ли в поддержку и по какому поводу.

Убытки в деталях, а не просто «был / не был». Заявил сразу или через две недели. Принес полный комплект документов или доносил частями. Оспаривал ли решение.

Внешние источники: бюро, сведения по транспортному средству, региональная статистика, погода и дорожная обстановка по месту эксплуатации.

Телематика, где она есть.

Проблема в том, что у большинства компаний это либо не собирается вообще, либо лежит в несвязанных системах. Учётная система — одна. Мобильное приложение — другая. Колл-центр — третья. Веб-аналитика живет где-то в маркетинге и никому за пределами маркетинга не видна. Клиент во всех этих системах не сшит единым идентификатором: в одной он по паспорту, в другой по id пользователя личного кабинета, в третьей по номеру полиса.

И это только по одному виду. Но ведь он же еще и страхователь по ипотеке и застрахованный по ДМС, и много чего еще!

В данных по ДМС эта картина особенно наглядна, потому что источников еще больше, чем в моторных видах: клиники программы, реестры услуг, звонки в медпульт, телемедицина, ЛК, crm, сайт. Каждый источник по отдельности — сокровище. Вместе они или не сшиты или сшиты криво, и это первое, во что утыкается любой ML-проект.

Чтобы модели было что перебирать, нужны две вещи.

Единое хранилище, куда данные из всех систем стекаются в сыром виде с общими ключами связывания. Обычно его называют data lake. Очень многие вместо lake делают свалку данных и говорят, что у них есть хранилище. Но его по-прежнему нет. Если есть единый идентификатор в статистике одного вида страхования — это хорошо, но не достаточно. Но часто нет даже этого, и внутри одного вида страхования система не склеивает кейсы, когда в одном договоре человек — страхователь, а в другом — застрахованный, допущенный к управлению водитель или выгодоприобретатель.

Но если и когда все это, наконец, разложить в общее и богатое озеро данных, тогда у нас появляется слой готовых признаков — feature store, витрина признаков. Место, где на каждого клиента лежат уже посчитанные переменные: с механикой обновления, с версиями, и главное — с одинаковой логикой расчёта для обучения и для боевого применения. На последнем стоит остановиться отдельно. Расхождение между тем, как признак считался при обучении и как он считается в проде, — одна из самых частых причин, по которой модель на тестах показывает одно, а в бою другое. Причём заметить это трудно: модель работает, ошибок не выдаёт, просто качество несопоставимо хуже.

Схема ML-проекта: источники данных, Data Lake, витрина признаков, модель

Схема ML-проекта: источники данных, Data Lake, витрина признаков, модель

Основные сроки уходят на два средних блока. Модель подключается последней

Но как такое продать? Равзе это проект? Долгий, скучный, не выглядит инновацией на слайде. Поэтому продают ML-модель. ML-модель на 10 признаках. И — ой, она не посчитала точнее нашего старого калькулятора на коленке. На многострадальной коленке андеррайтера, актуария, или обоих. Деньги потрачены зря, весь ваш ИИ — сплошная профанация. Или?

Каузальные модели

Все чаще в ответ на разочарование ML страховщик слышит: «Погодите-погодите, ML-модели себя не оправдали, но вот каузальные модели сейчас дадут жару».

Обычная ML-модель отвечает на вопрос «что произойдёт». Каузальные модели обещают ответить на вопрос «что произойдёт, если мы вмешаемся». Разница принципиальная, и для андеррайтинга выглядит очень соблазнительно.

Пример. Модель показывает: клиенты с франшизой реже заявляют убытки. Дальше управленческий вопрос: если предложить франшизу всем, убыточность упадет? Обычная модель на это не отвечает. Она видит связь и не знает, франшиза ли дисциплинирует поведение — или франшизу выбирают те, кто и так уверен в своей аккуратности и просто хочет заплатить меньше.

Или телематика. Полисы с телематикой показывают лучшую убыточность. Устройство меняет манеру вождения? Или его ставят люди, которые и без него ездили осторожно и охотно взяли скидку?

Разница между этими объяснениями — деньги. В первом случае программу надо масштабировать на всех. Во втором вы просто нашли способ отбирать аккуратных клиентов, и при массовом внедрении эффект растворится, потому что аккуратные закончатся, а телематику начнут брать все подряд ради скидки.

Схема конфаундера: аккуратность водителя влияет и на установку телематики, и на убыточность

Схема конфаундера: аккуратность водителя влияет и на установку телематики, и на убыточность

Классический конфаундер: общая причина у обеих переменных, а прямой связи может не быть вовсе

Аппарат для таких вопросов есть: causal trees и causal forests, uplift-моделирование, double machine learning, x-learner. В страховании его применяют больше десяти лет. Работы по uplift-моделированию удержания клиентов выходили ещё в 2012 году, причинностный подход к оценке ценовой эластичности в автостраховании публиковался в 2014-м. Но новостей о прорывных подходах к тарификации не слышно. Так что это не хайп прошлого сезона. Хайп — это то, что сейчас эти красивые англицизмы достали из рукава и выставили на витрину прорывных технологий.

Корреляция, причинность и во что обходится их путаница

Небольшое отступление, зачем вообще вся эта каузальность.

Хрестоматийный пример ложной корреляции — рост продаж мороженого и число нападений акул. Общая причина лето, все понимают и смеются. Для лекции пример хорош, для практики бесполезен: связь абсурдна, ошибиться на ней невозможно. Он к тому же вымышленный — я как-то полезла искать первоисточник и не нашла. Реальные числа под такую корреляцию не годятся: в 2000 году американские пляжи приняли 118 миллионов посещений при 41 нападении акул за год. Десятки событий против миллионов порций, никто не станет строить по ним график.

Но настоящие ошибки правдоподобны.

В апреле 1902 года французская администрация Ханоя боролась с крысами и назначила награду за каждый сданный хвост. Метрика выглядела безупречно: хвост в отчёте не нарисуешь. 12 июня отчитались о 20 114 крысах за сутки. А потом по городу побежали бесхвостые крысы. Местные ловили животное, отрезали хвост, сдавали за деньги, а крысу отпускали размножаться. Самые предприимчивые наладили разведение за городом. История задокументирована в архивах колониальной администрации.

Никто не подделывал метрику. Хвосты были настоящие. Просто цель и мера разошлись, и люди стали оптимизировать то, за что платят. Через семьдесят с лишним лет Чарльз Гудхарт сформулирует это в общем виде: статистическая закономерность разрушается, как только на неё начинают давить с целью управления.

Для андеррайтинга это значит следующее. Модель, обученная на крысах, ой, простите, на корреляциях, описывает мир, в котором ничего не менялось. Как только вы начинаете действовать на основе её выводов — менять тариф, вводить скидку, отбирать клиентов, — вы меняете сам мир. И связи, найденные в прошлых данных, могут вашего вмешательства не пережить.

Что каузальные модели могут и чего не могут

Инструмент настоящий. Ограничения тоже, но на демо про них не рассказывают.

Чтобы вытащить причинный эффект из наблюдательных данных — тех, что у вас накопились сами, без эксперимента, — нужно допущение об отсутствии неучтённых конфаундеров. Что все переменные, которые влияют одновременно и на «вмешательство», и на результат, вы наблюдаете. В литературе это допущение называют ахиллесовой пятой неэкспериментальных исследований, и оно принципиально не проверяется из самих данных. Вы либо обосновываете его содержательно, либо принимаете на веру.

Вернёмся к телематике. Если аккуратность водителя вы не измеряете, а она влияет и на решение поставить устройство, и на убыточность, — никакая математика не отделит эффект устройства от эффекта самоотбора. Модель выдаст число. Число будет смещенным. А выглядеть будет очень убедительно, с доверительным интервалом и p-value.

Смещение от скрытых конфаундеров не уменьшается с ростом выборки. Обычная статистическая погрешность падает, когда данных становится больше, — это мы все усвоили на первом курсе. Смещение от неучтенного фактора не падает вообще. Миллион полисов вместо ста тысяч даст более узкий доверительный интервал вокруг неверного значения. Аргумент «дайте больше данных, модель разберётся» здесь не сработает.

График: статистическая погрешность падает с ростом выборки, смещение от скрытого фактора остается

График: статистическая погрешность падает с ростом выборки, смещение от скрытого фактора остается

Единственное, что дает рост выборки в этом случае — более узкий доверительный интервал вокруг неверного значения

Ещё один момент — переобучение, и оно у каузальных методов замороченнее, чем у обычных. В одном исследовании на канадском страховом наборе данных causal forest показал на обучающей выборке метрику качества около 5,9, а на валидации и вне выборки — около нуля. Модель прекрасно объясняла то, на чем училась, и совершенно не переносила это на новые данные. Метод не плохой. Просто он требует очень аккуратной валидации.

Коэффициент Qini causal forest: 5,89 на обучении и около нуля на валидации и вне выборки

Коэффициент Qini causal forest: 5,89 на обучении и около нуля на валидации и вне выборки

Данные из работы Belbahri, Gandouet, Kazma (2020), arXiv:2011.00041

Конечно, это крайний пример. Но предупрежден — значит вооружен, поэтому он здесь.

И последнее. Чистый ответ на причинный вопрос даёт эксперимент. Все каузальное моделирование на наблюдательных данных — попытка приблизиться к тому, что дает рандомизация. Если у вас есть возможность назначить условие случайно — например, протестировать скидку на случайной подвыборке клиентов, — оценки становятся гораздо надёжнее. Uplift-моделирование лучше всего и работает поверх данных проведённых экспериментов, а не поверх истории.

Если сложить все вместе, картина такая. Каузальные модели — рабочий инструмент для задач, где вы можете либо провести эксперимент, либо содержательно обосновать, что все важные факторы у вас наблюдаются. Тарифная оптимизация с экспериментальным дизайном, оценка эластичности, удержание клиентов — реалистичные применения. А обещание «модель сама разберётся, где причина, прямо в ваших исторических данных» — это презентация, не ведитесь.

С чего начинать

Если свести к порядку действий, у меня получается так.

Сначала посчитать признаки. Сколько переменных на клиента доступно сегодня, сколько можем добавить малой кровью. Эта цифра определяет, есть ли смысл менять алгоритм.

Потом собирать данные. Единое хранилище, сквозные ключи, витрина признаков с одной логикой расчёта на обучение и прод. Это долго и не продается красиво, зато именно здесь основной эффект.

Только после этого выбирать алгоритм. На широком признаковом пространстве ML окупается. На десяти полях — нет, и никакой тюнинг гиперпараметров это не изменит.

Заранее решить вопрос с объяснимостью. В регулируемых видах модель, которая не умеет обосновать решение, может получить вопросики от регулятора, тк ни ст.11 Закона об организации страхового дела ни ст.10 293-ФЗ об актуарной деятельности никто не отменял.

И для причинных вопросов планировать эксперимент. Если по итогам вы собираетесь принимать управленческое решение — вводить скидку, менять условие, — заложите возможность случайного назначения хотя бы на подвыборке. Это лучше, чем потом гадать над смещёнными оценками.

Итог

Ценность самих ML-моделей минимальна в отрыве от качества датасета, с которым она работает. Преимущество ML-модели над GLM без расширения пространства признаков ничтожно, если ваши андеррайтеры и актуарии не лаптем щи хлебали последние 20 лет.

Компания с единым хранилищем данных и витриной признаков получит выигрыш от ML, если научится хорошо ее калибровать и строить умные гипотезы. Компания без них получит более дорогую версию того, что уже знала, и, возможно, разочаруется в технологии, которая ни в чём не виновата.

Каузальные модели — годный инструмент с четко очерченной областью применимости. Она шире нуля, но уже, чем обещают вендоры.

Интересно услышать в комментариях, у кого как: удалось ли собрать витрину признаков в страховой или банке, и сколько это заняло, если да. Возможно, я сгущаю краски, тк опираюсь на отзывы коллег с рынка, которые могут просто любить поныть, как у них все плохо. А в реале все хорошо и скора на Марс полетим.

Автор: Mamalytic

Источник