- BrainTools - https://www.braintools.ru -

Возможно, водяной знак на всех текстах Клода, причина, по которой с ним невозможно работать

Коротко

Новость о том, что Anthropic объявила о внесении во все тексты водяного знака, слышали и обсудили уже все. С 2 августа во все тексты, которые пишет Claude, встраивается невидимая метка, и она не на уровне невидимых символов, что легко удаляются через сторонний редактор, или метаданных рядом с файлом. Это статистический сигнал внутри самих слов. И подобное переживает копирование, вставку и даже часть редактуры. Убить такое можно только через серьёзный рерайт.

Механику не раскрыли. Параметров нет, детектора нет, технической документации тоже. Есть заявление компании, и даже в нём частично признают, что это влияет на смысл, качество и стиль текстов.

Параллельно с этим Opus 5, флагман, лучшая модель по бенчмаркам, стал таким, что с ним стало физически тяжело работать. И это заметили все, и, возможно, два этих события связаны.

Что именно сломалось

Многие жалуются на длину текста, излишние обороты, детали, замечания и ненужные подробности. Но главная проблема в том, что его ответы перестали складываться в понятный смысл.

Читаешь саммари после выполненной задачи и не можешь понять, что сделано, а что нет. Слова написаны, а ничего не понятно. Клод стал использовать лексику с редкими словами, ненужные громкие фразы, выражения, которые кроме пустого пафоса ничего не несут. Обороты не к месту и драматизм в каждом слове. Ощущение, будто собеседник изо всех сил демонстрирует интеллект [1] и раз за разом промахивается.

Но это ещё не всё. Просишь его объяснить проще и получаешь хуже. Не короче и не яснее, а плотнее и запутаннее. Нужно прилагать множество усилий, чтобы разобраться в этом спагетти слов, и никакие инструкции, специальные промпты и записи в CLAUDE.md не помогают. Чтобы разобрать одну вещь, нужно пять, а то и более итераций, там, где ранее было достаточно одного.

При этом с моей стороны ничего не изменилось, всё та же тема, над которой работаю уже давно, и точно я не стал глупее за неделю. Изменились лишь две вещи: новая модель Opus 5 и наложенный сверху алгоритм создания узора из слов, по которому проверяющий может опознать текст, сгенерированный ИИ.

Иерархия поломки

Сама деградация распределена по продуктам неравномерно. Хуже всего в Клод Код. В десктопном и мобильном приложении заметно лучше. Модель при этом одна и та же.

С кодом как таковым Opus 5 справляется. Находит баги, видит уязвимости, пишет рабочее. Хотя и здесь у многих есть большие претензии, в том, что Клод Код начинает делать больше, чем его просят, и, если его не останавливать, может наворотить дел. При этом очевидно, что способность объяснить и нормально обсуждать сломана полностью.

Многое в качестве работы агента определяется не моделью, а обвязкой вокруг неё. Разница между Клод Код и мобильным приложением при одних и тех же весах это ровно тот случай. Так отчасти за поломку может отвечать сам Клод Код CLI.

Но при этом статистический шифр из слов может быть сильнее заметен как раз-таки при работе с кодом. И дело тут в пропорции. В чате приложения текст это почти весь контекст. В Клод Код два абзаца инпута и десять абзацев саммари тонут в ста килобайтах диффов, трейсбеков, имён функций и логов. Доля реального текста на фоне кода стремится к нулю.

Когда контекст на девяносто девять процентов состоит из кода, проза подтягивается туда же. Отсюда плотность без воздуха, терминология вместо объяснения, отсутствие пауз. И обратная связь здесь не помогает. Каждый, кто вёл долгую сессию в Клод Код, замечал это: чем дальше, тем техничнее и суше становятся ответы, пока разбирать их не станет дороже, чем сделать самому.

Версия

Здесь я изложу свою версию, вполне возможно, лишь частично верную, но буду рад услышать критику и ваши замечания. Метка водяного знака встраивается в ответ за счёт того, что модель берёт не самое вероятное слово. Работает это только там, где выбор есть. В коде выбора почти нет: следующий токен задан синтаксисом, и сигналу негде сесть. В свободной прозе выбора много.

Отсюда естественное предположение: чем больше в выводе свободы и пространства, тем незаметнее будет метка. В приложении это разговор, растянутый на много слов, меткам есть где расположиться в ответах. В большой статье такая метка может быть вообще мало заметна. Но в ответах Клод Код свободного текста мало, саммари и комментарии, и именно они читаются как бред. Ровно поэтому модуль водяного знака переиначивает ответы модели, формируя из них полубред.

Симптом при этом ровно тот, который механизм и должен давать. Редкая лексика. Странные конструкции. Есть работы, показывающие, что возмущение от метки приводит к неоптимальному выбору токенов и ошибкам в содержании, которые стандартная метрика качества не ловит. То есть «формально читается, а смысл не собирается» это в точности тот класс дефекта, который проверками не видно.

И даты объявления тут ничего не доказывают. Anthropic пишет, что маркировка началась 2 августа, а Opus 5 вышел 24 июля. Но любой, кто выкатывал фичи, знает, как это устроено: сначала месяцы разработки, потом частичное развёртывание, потом объявление. Дата в блоге это дата пресс-релиза, а не дата включения. Верить компании на слово в вопросе, где у неё есть интерес [2], оснований нет. Тем более когда компания уже вводила в заблуждение своими заявлениями, что их продукт не использовался в военных целях.

Контраргумент

С другой стороны, многое из симптомов указывает и на ошибку [3] в пост-тренинге, то есть на то, как модель дообучили. Что для Anthropic даже худшее развитие событий.

Метка работает вслепую, у неё нет ни памяти [4], ни прицела. А слом идёт по вполне конкретным местам, больше объём слов и меньше смысла. Это похоже на выученное предпочтение, когда модель обучили, что развёрнутый ответ лучше краткого.

Дальше голос. Метка локальна и контекста не помнит. Она может подсунуть странное слово, но не может держать узнаваемый стиль через весь ответ. А он держится, абзац за абзацем. Такая согласованность на уровне целого ответа берётся только из пост-тренинга. Хотя тут возможен и некий гибридный слой, который учитывает необходимость установки водяного знака и дополнительно полирует текст под его установку.

Так что вполне возможно, что Anthropic сильно просчитались на моменте дообучения. Модель настроили под развёрнутый, уверенный, «наполненный» вывод, а в Клод Код это ещё усилено обвязкой и длинным контекстом. Но всё это делает ситуацию ещё хуже: фичу можно просто откатить, а исправить ошибки в обучении [5] долго и дорого. И, как правило, часть из них мигрирует в новую модель. Так деградация смысловых ответов Клода и увеличение их длины происходили со времён версии 4.5. Росли только метрики выполнения бенч-тестов.

Почему проще уйти на китайскую модель

Модель Opus стала работать так плохо, что стоимость понимания её ответов выросла в разы. Каждое саммари надо разбирать. Каждый вывод перечитывать. Инструмент, который покупают ради экономии сил, начал их отнимать. Это перечёркивает весь смысл покупки.

Прямая инструкция по форме ответа не выполняется. Это потеря управляемости, а не вопрос стиля. При этом про регресс говорят неохотно и урывками. Оценки качества публикуют сторонние исследователи. Anthropic же разбрасывается пресс-релизами с бенчмарками, на которых всё прекрасно. Водяной знак вкачен без документации, без параметров и без детектора, с обещанием, что на качество он не влияет. Уже видно, что это не сработало.

Но у нас, пользователей, есть выбор, и он очевиден. И странно, что Anthropic всеми силами делает вид, что его нет. Они даже в попытке широкого жеста снижают и фиксируют цену на Sonnet, преподнеся это как долгожданный подарок. Как будто не замечая, что никому это уже не нужно.

Kimi K3 идёт вровень с Opus 5 и Fable на независимом индексе Artificial Analysis, занимает первое место на Frontend Code Arena, обходя Клода, и стоит в разы дешевле за задачу. И это открытая модель, которую запустить может каждый, и не обязательно гонять инференс через китайские серверы, можно взять токены у американских провайдеров, заточенных на прайваси и не хранящих логи.

Anthropic ведёт себя как компания, у которой есть заложники. Как будто выбор стоит между их моделями, и вопрос только в том, какую скидку дать. Этого мира больше нет. Он закончился где-то весной. А выход Deepseek Flash и вчерашний релиз Deepseek Pro с метриками, что идут вровень с Fable, вбили последний гвоздь в эти пустые надежды.

Мои планы на ближайший месяц

Не продлять подписку Клода, а попробовать обойтись силами Kimi и Deepseek. Я был согласен на это ещё до анонса новой Deepseek Pro, теперь же это сделать ещё проще.

Планирование, анализ и аудит уходят в Kimi и Deepseek. Причём две модели здесь будут отлично дополнять друг друга, делать ревизии друг за другом, спорить и находить ошибки там, где не увидела другая. Обе умеют объяснять, тратят меньше токенов в своих харнессах и дают то же качество, что и Opus 5.

Реализация планов остаётся за Deepseek Flash, и частично Kimi K3 там, где нужно больше надёжности. Лимитов по подписке у Moonshot немного меньше. Так что часть сложных задач при необходимости уйдёт на Deepseek Pro.

Отдельный аргумент, который за последние месяцы стал для меня главным. Открытые веса это проверяемость. Когда модель закрыта, вопрос «что изменилось в этом релизе» решается доверием к вендору. Когда веса лежат, на него можно ответить самому. После истории с меткой, о механике которой не рассказывают, этот аргумент перестал быть теоретическим.

Вместо вывода

Я не утверждаю, что ввод водяного знака единолично сломал Клода. Скорее всего, причина здесь в серии факторов и ошибок. И политика Anthropic в движении против опенсорса тоже сыграла определённую роль.

Но в целом это уже и не важно. У нас есть отличная альтернатива, дающая то же качество за меньшие деньги. И это самое главное для нас, разработчиков.

Автор: prohronus

Источник [6]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34379

URLs in this post:

[1] интеллект: http://www.braintools.ru/article/7605

[2] интерес: http://www.braintools.ru/article/4220

[3] ошибку: http://www.braintools.ru/article/4192

[4] памяти: http://www.braintools.ru/article/4140

[5] обучении: http://www.braintools.ru/article/5125

[6] Источник: https://habr.com/ru/articles/1070194/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1070194

www.BrainTools.ru

Rambler's Top100