- BrainTools - https://www.braintools.ru -

Человек, которого никогда не было. Как ИИ создаёт синтетические личности?

палка, палка, огуречик..

палка, палка, огуречик..

Ещё недавно у фальшивой личности обязательно был настоящий владелец.

Мошеннику требовался чужой паспорт, фотография, номер телефона или хотя бы несколько строк из утёкшей базы. Дальше начиналась ручная работа: заменить снимок, исправить дату рождения, подобрать похожее лицо, придумать объяснение для оператора.

Человек мог не знать, что от его имени берут кредит, но он существовал.

Мы Михаил Никитин и Карина Саркисян из команды Tevian. На всякий случай уточним: мы настоящие. А вот с героями этой статьи всё не так однозначно..

Генеративный ИИ сильно упростил создание таких профилей. Теперь мошенническую анкету можно собирать с пустого листа. Нейросеть придумает биографию, нарисует лицо, исправит документ, оживит портрет для видеозвонка и поможет отвечать на вопросы службы поддержки. Реальными останутся только отдельные детали: адрес, телефон, номер документа или данные из утечки.

Получится человек, у которого есть паспорт, селфи и цифровой след. Нет только прошлого.

Такие конструкции называют синтетическими личностями.

Анатомия синтетической личности

Обычная кража личности устроена довольно прямолинейно. Есть реальный Иван Петров, есть его данные и есть мошенник, который пытается выдать себя за Ивана Петрова.

С синтетической личностью всё сложнее. Имя может быть вымышленным. Адрес – настоящим. Номер телефона зарегистрирован на подставного человека. Часть реквизитов взята из утечки, фотография создана генератором, а историю работы написала языковая модель.

Федеральная резервная система США определяет synthetic identity fraud как создание вымышленного человека или организации из комбинации персональных данных. Одни элементы могут принадлежать реальным людям, другие – быть полностью выдуманными. Затем собранную личность используют для открытия счетов, получения кредитов и других мошеннических операций. Определение и материалы по теме собраны в Synthetic Identity Fraud Mitigation Toolkit [1].

Сама схема появилась не вчера. Мошенники давно смешивали настоящие и выдуманные данные, постепенно наращивали кредитную историю и только потом забирали деньги.

ИИ же изменил экономику процесса. Раньше одну убедительную легенду приходилось долго собирать. Теперь можно выпускать сотни вариантов, отправлять их в разные организации и смотреть, какие сочетания проходят проверку.Согласно Identity Fraud Report 2026 [2] компании Entrust, за 2025 год число попыток пройти проверку с помощью deepfake-селфи выросло на 58%, а количество injection-атак – на 40%. На дипфейки приходилась каждая пятая попытка биометрического мошенничества. Отчёт основан более чем на миллиарде проверок в 195 странах и более чем 30 отраслях.

Генеративные инструменты уже применяются на разных этапах такой схемы: для создания документов и подтверждений адреса, заполнения заявок, прохождения распознавания лица и liveness-проверок, а затем для имитации нормальной активности открытых счетов.В России для таких схем тоже используют понятия «комбинированных» или «синтетических» персональных данных. Банк России описывает случаи, когда злоумышленники собирают новый профиль клиента из настоящих и вымышленных сведений и с его помощью пытаются пройти идентификацию. (см., например, обзор Банка России:https://cbr.ru/analytics/ib/operations_survey/2025/ [3] ).

Получился почти обычный производственный конвейер. 

Сначала нейросеть рисует лицо

Создать портрет человека, которого никогда не существовало, сегодня проще, чем подобрать подходящую фотографию из интернета.

У такого лица нет владельца, который однажды обнаружит свой снимок в чужой анкете. Его можно поворачивать, старить, менять причёску и выражение. Из одного исходного портрета можно сделать фотографию для документа, селфи в комнате и кадр для профиля.

Следующая задача: связать лицо с документом.

Здесь необязательно генерировать паспорт целиком. Часто достаточно взять изображение настоящего документа и изменить несколько областей: фотографию, фамилию, номер или дату рождения.

С Photoshop такая работа оставляла характерные следы. Вставленный фрагмент мог отличаться по резкости, шуму, сжатию или освещению. Если мошенник копировал цифру или другой фрагмент из одной части документа в другую, алгоритм мог обнаружить повторяющийся участок.

Генеративное редактирование работает иначе. Модель не вклеивает готовую цифру, а перерисовывает область вместе с текстурой бумаги и окружающим фоном. Шва в привычном смысле может не быть.

Мы в Tevian [4] сейчас как раз исследуем, какие следы генеративного вмешательства можно устойчиво находить в антифрод-сценариях. Однозначного ответа пока нет: признак может хорошо работать на изображениях с одного генератора, но исчезать после JPEG-сжатия или не переноситься на другой. Поэтому практическая задача сегодня не найти один универсальный «отпечаток ИИ», а понять, какие признаки переживают реальные каналы получения документов и как их сочетать.

В 2026 году исследователи опубликовали препринт AIForge-Doc [5]. Они взяли реальные чеки и формы на девяти языках и при помощи генеративного inpainting изменили в них числовые значения. Так появился набор из 4061 поддельного изображения с точной разметкой изменённых областей.

Результаты оказались неприятными для существующих детекторов.

На знакомых данных детектор DocTamper показывал ROC AUC* 0,98. На генеративных подделках результат упал до 0,563. Качество локализации изменённой области оказалось почти нулевым. GPT-4o, которому предложили определить подделку без дополнительного обучения [6], набрал 0,509 – практически случайное угадывание.

Это не означает, что нейросеть уже способна нарисовать безупречный паспорт любой страны. В AIForge-Doc менялись небольшие числовые поля в чеках и формах. Авторы отдельно указывают, что не исследовали полную генерацию удостоверений личности.

Но для атаки безупречный паспорт и не всегда нужен.

*для ориентира: AUC = 1.0 означал бы идеальную разделимость, а AUC = 0.5 случайное угадывание

Подделку будут рассматривать не под лупой

Есть ещё одна причина, почему даже заметный человеку дефект не обязательно остановит проверку. В реальном KYC документ обычно не изучает один универсальный алгоритм, который смотрит на изображение целиком и решает: настоящее оно или нет. Проверка устроена как конвейер из нескольких специализированных модулей. Один разбирается с документом и текстом, второй сравнивает лицо с фотографией, третий проверяет живость. Каждый отвечает на свой вопрос, поэтому посмотрим отдельно, что именно они видят.

  1. Начнём с документа. OCR-модулю прежде всего нужно прочитать поля: имя, дату рождения, номер документа и другие данные. Если текст выглядит достаточно правдоподобно для распознавания, сам факт того, что изображение было синтетически отредактировано, ещё не мешает получить корректный результат OCR. Модуль проверки документа может искать отдельные признаки вмешательства, но это уже другая задача.

  2. С лицом похожая ситуация. Face matching не обязан определять, настоящее перед ним фото или сгенерированное. Его задача гораздо уже: получить два представления лиц и оценить, принадлежат ли они одному человеку. Если мошеннику удалось сделать фотографию в документе достаточно похожей на лицо, которое затем будет показано камере, для алгоритма сравнения лиц это может оказаться убедительной парой.

  3. Третий участник конвейера – liveness. Здесь система уже пытается понять, находится ли перед камерой живой человек, а не фотография или заранее записанное видео. Но и этот модуль обычно не отвечает на вопрос, существует ли проверяемая личность в реальном мире и действительно ли ей принадлежит показанный документ. Его задача  убедиться, что в момент проверки перед камерой есть подходящий источник биометрических данных.

Ввиду этого мошеннику необязательно делать паспорт, который выдержит экспертизу под увеличением. Ему достаточно пройти конкретную проверку: чтобы OCR прочитал поля, face matching увидел совпадение, а liveness не остановил сессию. 

Поэтому в удалённом KYC вопрос о том, заметит ли подделку оператор, лишь часть задачи. Документ до человека может вообще не дойти. Сначала его разберут несколько алгоритмов, и каждый увидит только свой кусок картины.

Генераторы пока плохо знают, как устроен паспорт

Коллеги, хорошая новость!

Модели прекрасно выучили внешний вид документов: прямоугольную карточку, портрет, строки текста, узоры и печати. С внутренним устройством всё хуже.

В отдельном исследовании [7]2026 года автор проверил несколько доступных генеративных моделей на создании удостоверений личности. Вывод получился менее апокалипсическим, чем можно ожидать: модели правдоподобно имитировали общий стиль, но ошибались в структуре, типографике и элементах, важных для криминалистической проверки.

То есть генератор уже умеет нарисовать «что-то похожее на паспорт». Воспроизвести конкретный документ со всеми правилами конкретной страны ему заметно труднее.

Где-то поплывёт шрифт. Где-то неправильно расположится защитный элемент. Машиночитаемая строка не совпадёт с основными полями. Дата окажется допустимой сама по себе, но невозможной в сочетании с другими реквизитами.Для этого система должна знать документ лучше, чем генератор.

Проблема в переносимости. Детектор, обученный на одном типе подделок, не обязательно узнает другой. В препринте DOCFORGE-BENCH [8] четырнадцать методов проверили сразу на восьми наборах документов. Ни один не оказался надёжным решением «из коробки» для разных типов подделок. Авторы обнаружили ещё и проблему калибровки: алгоритм мог отличать подозрительные пиксели от обычных, но стандартный порог превращал это преимущество почти в нулевой практический результат.

Свежий обзор [9] атак на удостоверения личности приходит к похожему выводу. Он объединяет три класса угроз:

  • предъявление физической подделки камере;

  • внедрение подготовленного изображения или видео в цифровой канал;

  • генерацию или редактирование документа при помощи ИИ.

Даже сильнейшие публичные модели на ранее не встречавшихся синтетических ID-картах пропускали более четверти атак при настройках, ориентированных на безопасность. Авторы называют это reality gap: лабораторные датасеты плохо отражают реальные документы, устройства и способы предъявления. 

Антифрод, который один раз обучили и поставили в прод, быстро превращается в музейный экспонат.

Зелёные галочки не складываются автоматически

доказательство №1

доказательство №1

Типичный удалённый онбординг состоит из нескольких проверок:

  • документ найден и распознан;

  • реквизиты соответствуют формату;

  • лицо на селфи похоже на портрет;

  • проверка живости пройдена;

  • данные анкеты не противоречат друг другу.

У каждой проверки появляется зелёная галочка. Возникает естественное ощущение: пять подтверждений надёжнее одного. Это верно, только если проверки связаны между собой.

Представим документ с синтетическим портретом. Распознавание текста сработало правильно. Сравнение лиц тоже: на селфи изображён тот же сгенерированный человек. Видео содержит необходимые движения. Анкета составлена без очевидных ошибок. Ни один модуль не соврал. Не был задан только главный вопрос: относятся ли все эти данные к человеку, который существует вне текущей сессии?

У настоящей личности есть глубина. Телефон используется годами. Почтовый адрес встречается в разных независимых источниках. Документы появлялись не одновременно. История действий не начинается за неделю до заявки.

У синтетической личности биография может быть гладкой, но короткой. Она напоминает декорацию: фасад убедительный, за дверью ничего нет.

Искать приходится не один артефакт генерации, а слабые связи между сигналами.

Почему документ впервые появился вчера? Почему одно лицо встречается с разными реквизитами? Почему фотография выглядит старой, но следы её цифрового создания новые? Почему защитные элементы не меняются при повороте документа? Почему история телефона и почты не соответствует возрасту клиента?

На каждый вопрос может найтись невинный ответ. Подозрение возникает из их сочетания.

Что теперь приходится проверять в KYC

Один большой детектор с кнопкой «найти ИИ» здесь не поможет.

Проверка начинается ещё до распознавания текста. Нужно определить, действительно ли перед камерой физический документ, оценить качество изображения, найти экран, распечатку или цифровую вставку.

Затем проверяется сам документ: геометрия, расположение элементов, форматы и связи реквизитов, фотография, подпись, печать, признаки редактирования и генерации. Отдельный слой работает с лицом: качество кадра, сравнение с портретом, liveness, признаки deepfake и внедрения подготовленного потока.

Результаты этих проверок недостаточно просто собрать в одном интерфейсе. Их нужно сопоставить и определить, поддерживают ли они одну версию происходящего.

В Tevian KYC [10] этот подход тоже разбит на несколько отдельных модулей: контроль качества фотографий, распознавание полей документа, извлечение фотографий, подписей и печатей, сравнение лиц, liveness и антифрод-проверки документа. Систему можно разворачивать в закрытом контуре заказчика.

Перечень модулей сам по себе ничего не гарантирует. Важнее то, что происходит на стыках:

  • Фотография в документе прошла сравнение с селфи, но оба изображения выглядят синтетическими, совпадение нельзя считать подтверждение;

  • OCR уверенно прочитал номер, но область номера отличается от остального изображения, распознанное значение становится уликой, а не фактом;

  • liveness пройден, но видеопоток пришёл не от камеры, движение головы теряет смысл.

И ещё системе нужен нормальный третий ответ. Не только «пропустить» и «заблокировать», но и «недостаточно данных». Попросить переснять документ, изменить угол, показать его в видеопотоке или передать случай оператору.

Такой ответ плохо выглядит в демонстрации. Зато хорошо работает там, где цена одной зелёной галочки измеряется деньгами.

Человек больше не входит в комплект

Генеративный ИИ пока не научился делать криминалистически безупречные документы по одному запросу. Зато он резко снизил стоимость достаточно хороших подделок.

Мошеннику больше не обязательно искать подходящего человека и присваивать его историю. Несколько настоящих деталей можно дополнить сгенерированными и собрать новую личность. Она не обязана пройти все проверки. Достаточно, чтобы производство ста вариантов стоило дешевле успешной атаки. Поэтому задача KYC постепенно меняется.

Мало прочитать паспорт. Мало сравнить два лица. Мало увидеть моргание в видеопотоке. Мало получить пять зелёных галочек.

Нужно доказать, что документ, лицо, видео, контакты и цифровая история относятся к одному реальному человеку и появились не специально ради текущей заявки. Иначе система может безошибочно распознать все данные человека. Кроме одного: существовал ли он вообще.

Автор: DFA-14

Источник [11]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34657

URLs in this post:

[1] Synthetic Identity Fraud Mitigation Toolkit: https://fedpaymentsimprovement.org/resources/synthetic-identity-fraud-mitigation-toolkit/

[2] Identity Fraud Report 2026: https://www.entrust.com/resources/reports/identity-fraud-report

[3] https://cbr.ru/analytics/ib/operations_survey/2025/: https://cbr.ru/analytics/ib/operations_survey/2025/

[4] Tevian: https://tevian.ai

[5] AIForge-Doc: https://arxiv.org/abs/2602.20569

[6] обучения: http://www.braintools.ru/article/5125

[7] отдельном исследовании : https://arxiv.org/abs/2601.00829

[8] DOCFORGE-BENCH: https://arxiv.org/abs/2603.01433

[9] Свежий обзор: https://arxiv.org/abs/2607.01442

[10] Tevian KYC: https://tevian.ai/products/kyc

[11] Источник: https://habr.com/ru/companies/tevian/articles/1072174/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1072174

www.BrainTools.ru

Rambler's Top100