TL;DR: лучший англо-русский художественный перевод сегодня дают Gemini 3.8 Flash (91 из 100) и GPT-6 Astra (90). Лучшие из китайских моделей, DeepSeek V4.1 Flash и V4 Pro, набрали по 79, вровень с Claude Opus. Что очень круто. Так что их можно использовать для работы, если достаточно хорошего качества, а не максимального. С другой стороны Gemini 3.8 Flash очень дешева, так что в экономии не вижу смысла. Подробности — в рейтинге.
Месяц назад я сравнивал здесь Opus 5, Sol 5.6 и Gemini (Flash и Pro) в художественном переводе и редактуре. Метод был таков: одна модель переводила главу, а заведомо крутая LLM (Sol или Opus) её редактировала. Мерой качества служило число правок модели-редактора. Чем меньше правок — тем лучше перевод. Метод оказался вполне рабочим. Но по итогу у меня накопились претензии к нему. Он не был достаточно чётким, пользователи в комментариях писали, что нужен нормальный бенчмарк. Я его сделал, он встроен в конвейер BookTrans. Это обеспечивает его воспроизводимость.
Почему счёт правок перестал устраивать
Число правок редактора кажется объективной мерой, это ведь просто число, с которым легко работать. Но у этого метода есть куча недостатков.
Вкусовщина судьи. Sol правит вдвое больше абзацев, чем Opus, но это «на вкус и цвет товарищей нет» вкус, а не смысл. Сравнивать можно было переводы только если у них один судья. Это неудобно.
Счёт льстит осторожному. Редактор по соглашениям конвейера не видит оригинала. Поэтому гладкий перевод, который выбросил метафору и упростил предложение, получает меньше правок, чем смелый и точный.
Без ручного чтения числа ничего не значат. Всякий раз приходилось читать четыре перевода рядом с оригиналом, и главное находило чтение.
Бенчмарк должен был убрать эти и другие изъяны сохранив то, что счёт правок делает хорошо: измерять качество перевода в реальном пайплайне, с его промптами и требуемыми форматами ответа.
Как устроен бенчмарк
Идея взята из индустриального стандарта оценки переводов MQM, где качество описывают разметкой ошибок по категориям, а также из практики школьных экзаменов: у проверяющего есть ключ с ответами. LLM-судья получает список контрольных точек, где в тексте поставлена ловушка и ответы, и по каждой отвечает «пройдена» или «провалена». Он отвечает в специальном формализованном формате, далее итоговый балл считает программа.
Текст. За основу взят рассказ О. Генри «The Skylight Room» 1906 года, права на него давно истекли. Рассказ основательно переделан: действие перенесено в наши дни, устаревшие обороты заменены, имена и название другие, финал переписан. Сюжет сохранён, это цельная история на 66 абзацев и четверостишие в эпиграфе, около 3100 слов, как раз один стандартный кусок для конвейера. В текст посажено сто ловушек по двенадцати областям, каждая стоит одно очко, так что итог читается как процент.
|
Область |
Очков |
Что проверяется |
|---|---|---|
|
Точность смысла |
15 |
Ложные друзья, значение многозначного слова по контексту, цифры, кто кому что продал |
|
Полнота |
9 |
Выброшенные предложения, придаточные, эпитеты в перечислениях |
|
Отсутствие калек |
11 |
«Ты в порядке?», «это не о том…», «имеет смысл», избыток притяжательных |
|
Словарь и идиомы |
9 |
Редкие книжные слова, астрономические и медицинские термины, идиомы по смыслу |
|
Образность и стиль |
11 |
Метафоры сохранены, регистры речи персонажей различимы |
|
Стихи и игра слов |
8 |
Четверостишие размером и рифмой, три каламбура |
|
Согласованность |
8 |
Повторяющаяся реплика, имена и термин одинаковы по всему тексту; три значения слова fair разведены |
|
Пол и обращения |
8 |
Пол врача, раскрытый через шесть абзацев после первой реплики; звезда с мужским именем; ты/вы постоянны |
|
Имена и клички |
7 |
Транслитерация по звучанию: Cholmondeley, Siobhan, Leigh, Beauchamp, Worcester; клички по смыслу |
|
Норма языка |
6 |
Оформление диалога, многоточия, пересчёт футов и миль, курсив |
|
Сноски |
4 |
Есть к мифологии и реалиям, нет к очевидному |
|
Регистр и откровенность |
4 |
Ругательства не смягчены, телесные детали не выброшены |
Несколько ловушек в подробностях, чтобы было понятно, о чём речь
Врач скорой помощи шесть абзацев подряд упоминается без указания пола, а потом оказывается женщиной. В английском это ничего не стоит — в русском переводчик обязан выбрать род глаголов заранее, и модель, не дочитавшая текст до конца, пишет «сказал доктор Морган». Это три точки из ста, и первую из них проваливает больше половины прогонов, включая флагманов.
Слово fair встречается трижды: a fair shot в тире (меткий, засчитанный выстрел), the street fair (уличная ярмарка) и a fair complexion (светлая кожа). «Честный выстрел» пишут три модели из четырёх.
Мисс Вустер говорит «Well, really!» пять раз, и это её характеристика. Переводчик, который пять раз переводит по-разному, эту характеристику стирает.
Фамилия Beauchamp по-английски читается «Бичем», а модели в двух случаях из пяти пишут «Бошан», по-французски. Cholmondeley — это «Чамли», и примерно треть переводов даёт «Чолмонделей» по буквам. Зато ирландскую Siobhan почти все знают как «Шивон».
Ключ. К тексту прилагаются правильные ответы для судьи: сто строк вида «точка, область, адрес абзаца, что считается верным». Ключ написан по-английски и не зависит от языка перевода, поэтому тот же бенчмарк годится для тестирования перевода с английского на любой целевой язык, примеры для русского судья переносит на другой язык по смыслу. Переводчик ключа не видит.
Текст и ключ лежат в пакете сжатыми. Репозиторий публичный, а открытый ключ ответов рано или поздно попал бы в обучающую выборку тех моделей, которые занимаются переводом. Ни документация, ни тесты не цитируют текст для перевода, используемый в бенчмарке.
Штрафы. Сверх ключа судья отмечает отсебятину (факт, действие или оценка, которых нет в оригинале) и непереведённые фрагменты, а код без участия судьи считает потерянные абзацы, разошедшуюся разметку, буквы чужой письменности (иероглифы в русском тексте) и лишние попытки. Про попытки отдельно: когда модель отвечает не по форме, конвейер переспрашивает с подсказкой, до пяти раз. Без штрафа модель, попавшая в формат с третьего захода, получала бы тот же балл, что и попавшая с первого, хотя стоит втрое дороже по времени и деньгам.
Счёт. Балл области равен числу пройденных точек, итог равен сумме областей минус штрафы, нормированный к ста. Никакой «оценки от 0 до 100» судья не выставляет, и это принципиально: свободная оценка плавает между запусками на десятки баллов, а ответ «да/нет» по конкретному требованию воспроизводится. Тот же перевод, отданный судье второй раз, дал 82 и 83 балла с расхождением в одной точке из ста.
Три прогона. Один перевод модели не ранжирует. У средних моделей два перевода одного текста расходятся на 10–20 баллов, у сильных на 3–7. Поэтому по умолчанию текст переводится и судится три раза, прогоны идут одновременно, в отчёт попадает медиана и разброс.
Судья. По умолчанию используется Claude Opus 5.5 на среднем усилии, запасной Sol 5.6. Если установить судью из одной семьи с переводчиком, то бенчмарк выдаст ошибку: к своим калькам модель слепа, и поэтому модели Anthropic судит Sol. Sonnet 5 в роли судьи я тоже проверил: на одних и тех же переводах он расходится с Opus в 4–7 точках из ста, причём систематически прощает смягчённую брань, и не дешевле. Поэтому выбран Opus.
Как штрафы перевернули рейтинг, и почему их пришлось калибровать
Первая версия ключа штрафовала мелкую отсебятину на три очка, при том что ловушка стоила одно. На codex-моделях это дало контринтуитивный результат: дешёвая Luna обошла Terra и Sol. Разбор вердиктов показал, что по ловушкам порядок был обратный: Sol прошёл 90 точек из ста, Terra 89, Luna 85. Luna провалила пол врача во всех трёх точках, перевела «too lovely for anything» буквально и спутала fair shot с «честным». Но у Luna не было ни одного штрафа, а у Sol три «отсебятины» на девять очков: «богатый, румяный» за одно flush, «из десяти мишеней» вместо «из десяти».
Поэтому пришлось сделать в следующей версии ключа дешевле штрафы за мелкую отсебятину (1 очко, крупная 3). После этого codex-модели встали в ожидаемый порядок с разрывами 4–8 баллов.
Как запустить
Бенчмарк входит в BookTrans начиная с версии 1.10.77. Книга не нужна, текст в пакете. Нужен только язык перевода и переводчик:
uv tool install booktrans # или: pipx install booktrans
booktrans --bench --to ru --translator codex:gpt-6-astra:medium
Модель называется так же, как в любом другом ключе конвейера: агент, модель, усилие через двоеточие. Западные модели идут через их родные CLI (claude, codex, agy), китайские через любую точку протокола OpenAI. Я брал роутер byNara, у которого есть все интересующие меня китайские модели и бесплатный план, и подписку OpenCode Go с Kimi, MiniMax и Qwen; адрес точки и ключ кладутся в переменные окружения или в файлы папки настроек:
export OPENAI_BASE_URL=https://router.bynara.id/v1
export OPENAI_API_KEY=sk-…
booktrans --bench --to ru --translator openai:deepseek-v4.1-flash:medium
Через несколько минут в текущей папке появляется рабочая папка benchmark-en-ru-<провайдер-модель-усилие>-<дата>.work с тремя переводами внутри (их стоит прочитать глазами) и отчёт рядом. Первая строка отчёта — медиана, дальше таблица прогонов, области, проваленные точки с причинами и цитатами из перевода, штрафы, стоимость, время и готовая строка для таблицы результатов. Судью можно сменить ключом --judge, число прогонов ключом --bench-runs, свой набор текст+ключ подставляется через --bench ПАПКА. Подробности в docs/bench/README.md.
# Результаты
Все модели переводили на среднем усилии, кроме Gemini 3.1 Pro: у неё среднего нет, только высокое. Балл — медиана трёх прогонов, в скобках разброс. Время и цена указаны за один прогон, то есть за 3100 слов. Цену показывает только Claude Code; codex и agy работают по подписке, китайские модели шли через бесплатный план роутера.
|
Модель |
Балл |
Разброс |
Точность /15 |
Кальки /11 |
Стихи /8 |
Пол /8 |
Время, мин |
Цена, $ |
|---|---|---|---|---|---|---|---|---|
|
Gemini 3.8 Flash |
91 |
82–91 |
15 |
10 |
8 |
8 |
2 |
подписка |
|
GPT-6 Astra |
90 |
88–92 |
14 |
8 |
6 |
8 |
4 |
подписка |
|
GPT-5.6 Sol |
86 |
85–89 |
12 |
9 |
6 |
7 |
4,5 |
подписка |
|
Gemini 3.1 Pro (высокое усилие) |
83 |
81–85 |
12 |
9 |
7 |
7 |
3,5 |
подписка |
|
Muse Spark 1.3 |
83 |
82–83 |
13 |
9 |
6 |
6 |
4 |
роутер |
|
Gemini 3.7 Flash |
81 |
79–86 |
15 |
9 |
6 |
7 |
2,5 |
подписка |
|
DeepSeek V4.1 Flash |
79 |
71–85 |
13 |
7 |
5 |
7 |
21 |
роутер |
|
DeepSeek V4 Pro |
79 |
75–79 |
13 |
2 |
4 |
6 |
17 |
роутер |
|
GPT-5.6 Terra |
78 |
76–81 |
12 |
6 |
4 |
7 |
2,5 |
подписка |
|
Claude Opus 5 |
78 |
71–81 |
11 |
6 |
4 |
7 |
4,5 |
0,51 |
|
Claude Opus 5.5 |
78 |
76–81 |
9 |
9 |
6 |
5 |
2,5 |
0,34 |
|
Claude Fable 5.1 |
78 |
77–82 |
9 |
10 |
6 |
5 |
6,5 |
1,25 |
|
GPT-5.6 Luna |
72 |
72–74 |
12 |
6 |
4 |
5 |
2,5 |
подписка |
|
Claude Sonnet 5 |
67 |
62–77 |
9 |
6 |
4 |
4 |
4,5 |
0,28 |
|
Claude Haiku 4.5 |
54 |
52–56 |
— |
— |
— |
— |
4 |
0,09 |
Haiku пока прошёл два прогона из трёх, его строка предварительная. Области в таблице показаны у медианного прогона; полная разбивка по двенадцати областям лежит в репозитории.
Судей было двое. Западные модели судил Opus 5.5, модели Anthropic и все китайские — Sol 5.6. Для Claude это правило бенчмарка, судья своей семьи вычёркивается, для китайцев вынужденная мера: на прогон уходит около 30 тыс. токенов судьи, и лимит подписки на Opus закончился раньше, чем очередь моделей. Один и тот же судья на одном переводе даёт расхождение в один балл, но между судьями разных семей сдвиг в два-три балла я исключить не могу. Поэтому соседние места с разницей меньше разброса стоит считать одним местом.
Что проваливают все
Сто ловушек дают не только рейтинг, но и портрет общих слабостей. Вот точки, которые проваливают почти все модели, по 44 прогонам пятнадцати моделей:
|
Ловушка |
Провалов |
|---|---|
|
«Jesus, Leigh, you look like hell» смягчено до «Господи, на тебе лица нет» |
44 из 44 |
|
эхо корня crumpled / crumples («сжалась» и «заломы» вместо одного корня) |
43 |
|
«Are you okay?» → «Ты в порядке?» |
37 |
|
многоточие тремя точками ASCII вместо знака «…» |
37 |
|
«Shit» у героини, которая никогда не ругалась, смягчено до «Чёрт» |
36 |
|
«I look green» переведено как цвет, а не как неопытность |
34 |
|
«a fair shot» → «честный выстрел» |
33 |
|
«forty-five, fat, flush and foolish» без ритма и аллитерации |
31 |
|
каламбур «higher and lower» (этажом выше, ценой ниже) сведён к «повыше и подешевле» |
32 |
|
«Gamma? I’d have given it an alpha» — греческая буква не читается как оценка |
30 |
|
сделка с агентством перевёрнута: кто кого купил |
25 |
|
футы, дюймы и мили не пересчитаны |
27 |
|
пол врача, раскрытый через шесть абзацев, угадан как мужской |
25 |
Список поучительный. Половина строк это привычки LLM: смягчать брань, ставить три точки, калькировать «ты в порядке». Их можно закрыть промтом. Другая половина это проверка понимания: перевёрнутая сделка, «честный выстрел», зелёный цвет вместо неопытности и мужской род врача отличают модели, которые дочитали текст, от тех, которые переводили абзац за абзацем.
Игра слов не даётся никому. «Higher and lower» в оригинале это одновременно этаж выше и цена ниже, и русский эквивалент с обоими смыслами нашёлся только в 12 прогонах из 44. Каламбур с гаммой и альфой держится на том, что в американской школе оценки ставят буквами; по-русски «поставил бы ей альфу» не читается, и честнее было бы «пятёрку», как сделали в 14 прогонах из 44.
Выводы
Лучший перевод сегодня дают Gemini 3.8 Flash и GPT-6 Astra. Между ними один балл, и это меньше разброса. Astra ровнее: её три прогона легли в 88–92, у Flash один прогон просел до 82. Flash зато вдвое быстрее, и это модель лёгкого класса, а не флагман.
Claude 5 несколько разочаровал. Opus 5, Opus 5.5 и Fable 5.1 набрали одинаково, 78, и у Opus 5.5 и Fable провалы одни и те же: точность смысла 9 из 15 и пол персонажей 5 из 8. При этом по калькам и образности они среди лучших, 9–10 из 11. Claude пишет гладко, но пересказывает, а бенчмарк это ловит. Fable стоит вчетверо дороже Opus 5.5 и за эти деньги ничего не добавляет. Из троих, если уж брать Claude, я бы брал Opus 5.5: он дешевле и быстрее Opus 5 при том же балле.
Теперь про деньги. DeepSeek V4.1 Flash и V4 Pro встали вровень с Opus и Terra. Значит, на китайской модели можно получить перевод уровня Claude Opus, но не уровня Astra или Gemini Flash. V4.1 Flash нестабилен: три перевода одного текста легли от 71 до 85, и на книге из тридцати кусков это значит, что часть глав выйдет заметно хуже остальных. V4 Pro ровнее, но калькирует: 2 очка из 11 против 9–10 у лидеров. «Ты в порядке?», «Я в порядке», «Это не о том, как работают колодцы… Это о том, на что ты смотришь». И оба думают долго: 45 тыс. токенов вывода на кусок у Flash против 17 тыс. у Opus 5.5, и 17–21 минута на кусок через роутер против двух-четырёх у западных моделей.
Для чистового перевода сэкономить на китайцах не выйдет, лучшие результаты у западных моделей. Для черновика, который потом всё равно пройдёт через сильного редактора, DeepSeek годится и обходится дешевле Opus. А если нужна экономия без потери качества, её даёт Gemini Flash: лёгкая модель, которая в этом тесте обошла всех флагманов.
Остальные китайские модели — GLM, Qwen, MiMo, Kimi, MiniMax — сейчас проходят тест, их результаты я добавлю в таблицу в репозитории и в комментарии.
Полные материалы
Таблица результатов с разбивкой по областям ведётся в репозитории: docs/bench/results-en-ru.md. Там же методика, формат ключа и описание штрафов. Предыдущая статья со счётом правок: Сравнение Opus 5, Sol 5.6, Gemini Flash 3.7 и Pro 3.1 в художественном переводе и редактуре.
© 2026 ООО «МТ ФИНАНС»
Автор: inetstar


