Как работают текстовые ИИ-вотермарки и как их обходить. ai.. ai. llm.. ai. llm. llm-приложения.. ai. llm. llm-приложения. Natural Language Processing.. ai. llm. llm-приложения. Natural Language Processing. python.. ai. llm. llm-приложения. Natural Language Processing. python. watermark.. ai. llm. llm-приложения. Natural Language Processing. python. watermark. watermarking.. ai. llm. llm-приложения. Natural Language Processing. python. watermark. watermarking. искусственный интеллект.. ai. llm. llm-приложения. Natural Language Processing. python. watermark. watermarking. искусственный интеллект. Машинное обучение.. ai. llm. llm-приложения. Natural Language Processing. python. watermark. watermarking. искусственный интеллект. Машинное обучение. машинное+обучение.

Наверное уже многие знают, что в силу недавно вступивших в ЕС законов, регулирующих использование ИИ, провайдеры LLM обязаны помечать ИИ-сгенерированные тексты. Та же Claude недавно обновила справочную информацию о работе своей помечалки сгенерированного ИИ контента, в том числе и текста. Но в подробности его работы почему-то вдаваться не стала, как и размещать в публичном доступе средства добавления и обнаружения этих самых вотермарок.

Как работают текстовые ИИ-вотермарки и как их обходить - 1

Не то чтобы я часто балуюсь текстовым нейрослопом, но сама идея того, что твой текст могут им объявить чисто случайно или в следствии того, что ты отредактировал иишкой его часть, меня не сильно радует. Поэтому в этой статье мы разберемся, как собственно эти метки работают, и как с ними бороться.

Как работают текстовые ИИ-вотермарки

Поначалу, когда я впервые услышал о текстовых вотермарках, я подумал, что LLM просто вставляет в текст всякие скрытые символы или там длинные тире, но этот метод донельзя дубовый и очевидно, что обходится на раз-два. На самом деле это работает так.

LLM это авторегрессионная вероятностная модель. На каждом шаге она выбирает следующий токен из своего большого словаря (обычно от десятков до сотен тысяч токенов) опираясь на изначальный промпт и предыдущие сгенерированные ею токены. Сначала модель отбирает топ-K наиболее вероятных токенов, а затем выбирает среди них один единственный с учетом его вероятности. Вотермаркинг же смещает распределение вероятностей токенов: слова, которые обычно редко встречаются в тексте, начинают появляться чаще, и наоборот.

Как работают текстовые ИИ-вотермарки и как их обходить - 2

Для человека заметить разницу практически невозможно, но для машины, знающей реальное распределение слов/токенов, это не составит труда.

Как работают текстовые ИИ-вотермарки и как их обходить - 3

Собственно вот видео, в котором объясняется, как работает вотермаркинг в Gemini. Claude работает точно так же.

Как их обходить

Вполне очевидно, что придется либо жестко редактировать либо переписывать текст другими словами. Что предлагаю я.

Для начала предобработать исходный текст, чтобы удалить самые очевидные признаки сгенерированного ИИ контента: длинные тире, символы нулевой ширины, нестандартные пробелы и т. д.

Следующие три шага направлены на борьбу с самой сутью вотермаркинга – специфическим распределением токенов. Вот как это работает:

  • Отправить текст в переводчик (например, Google Переводчик) и перевести его на промежуточный язык

  • Перевести текст обратно с промежуточного языка на исходный

  • При необходимости переписать текст с помощью LLM, которая гарантированно не добавляет водяные знаки в свои ответы (например, модели с открытыми весами вроде DeepSeek-v4). Это поможет сделать итоговый текст более читаемым (если его качество снизилось в результате двойного перевода) и удалить оставшиеся следы вотермаркинга, если они каким-то образом сохранились

Вдохновившись этой идеей, я разработал простое приложение, которое автоматизирует этот процесс. В нём можно выбрать, какие именно шаги использовать, и настроить каждый из них отдельно (например, выбрать конкретный переводчик или модель LLM для перефразирования).

Оно создано на основе Streamlit и LangChain, GUI выглядит вот так:

Как работают текстовые ИИ-вотермарки и как их обходить - 4

Просто задаешь нужные настройки, вставляешь текст в поле и нажимаешь кнопочку “Process”. Дальше она все сделает сама. Дополнительно напишет, какие символы были удалены из текста, а также покажет промежуточные результаты перевода.

Как работают текстовые ИИ-вотермарки и как их обходить - 5

Проект есть на гитхабе, лежит по этой ссылке. И как всегда, предложения по доработке и исправлению багов приветствуются.

Автор: beatwad

Источник