ПДн, 152-ФЗ и LLM
«Сделай мне аналитику по этим пяти резюме, вот они» — с такого сообщения могла начаться история, из-за которой я вообще стал бы разбираться в обезличивании. Думаю некоторые HR-специалисты крупных компаний смело вставляют в ChatGPT пять резюме целиком: с паспортами, адресами, СНИЛС. Для него это была рутина, экономия часа работы. Для компании — передача персональных данных пяти человек неизвестно куда, без основания, без уведомления, в сервис, чьи серверы стоят за пределами России. Формально — сразу несколько нарушений 152-ФЗ. Все чуть сложнее или проще но в целом посыл был примерно такой.
Как мы измеряем точность детекции ПДн: pii-bench, golden-выборка и честные метрики
Когда вендор защиты данных пишет на сайте «точность детекции 99%», возникает ровно один вопрос: как это измерено? Без методики цифра не значит ничего — «99%» может означать честный span-level F1 на внешнем бенчмарке, а может — «в 99 из 100 сообщений сканер что-то нашёл». Это разные вещи, и разница между ними — это пропущенные паспорта в проде.

