Тест Qwen3.5 9b, Gemma 4 12b и Bonsai 27b на легенде пенсионного возраста GTX 1080 ti. ai.. ai. bonsai.. ai. bonsai. gemma.. ai. bonsai. gemma. qwen.. ai. bonsai. gemma. qwen. искусственный интеллект.. ai. bonsai. gemma. qwen. искусственный интеллект. Компьютерное железо.. ai. bonsai. gemma. qwen. искусственный интеллект. Компьютерное железо. локальные нейросети.

Все началось вообще не с идеи написать очередной бенчмарк. Мне нужно было собрать локальный пайплайн для длинных подкастов: получить транскрипт, найти в нем интересные куски, выбрать несколько сильных фрагментов и уже из них делать короткие вертикальные ролики.

Облачные модели с этой задачей справляются, но постоянно гонять туда длинные расшифровки не очень хотелось. Плюс было интересно понять, насколько далеко сейчас можно уехать на железе.

Под рукой была GTX 1080 Ti на 11 ГБ. Карта 2017 года, архитектура Pascal, никаких Tensor Cores.

Так из прикладной задачи постепенно вырос небольшой домашний стенд. Я прогнал три модели в одинаковых условиях, отдельно проверил длинный контекст, затем сделал свой набор reasoning‑задач и сравнил режимы с размышлением и без него. Результаты получились не совсем такими, как я ожидал.

Что тестировал

Модель

Вариант

Qwen3.5

9B Q4_K_M

Gemma 4

12B Q4_0

Bonsai

27B Q1_0

Основной runtime для сравнений — LM Studio. Для диагностики скорости дополнительно использовал Ollama и llama.cpp. Все модели гонялись на одной машине.

GPU: NVIDIA GeForce GTX 1080 Ti
VRAM: 11 GB
RAM: 32 GB
OS: Windows
NVIDIA Driver: 582.66

Сначала все уперлось не в модель, а в драйвер

До нормальных тестов я успел потратить прилично времени на довольно глупую проблему. Qwen3.5 9B раньше уже работала у меня примерно на 40 токенах в секунду, но в очередной запуск внезапно стала выдавать около 7 токенов/с.

После обновления драйвера до 582.66 CUDA снова заработала как надо, а Qwen вернулась примерно к 42 токенам/с.

Тест 1. Длинный контекст

Сначала хотелось понять простую вещь: может ли модель реально пользоваться большим контекстом или большая цифра в карточке модели существует в основном для маркетинга.

Я написал небольшой Python‑скрипт в духе Needle‑in‑a-Haystack. Он набивает контекст нейтральным текстом и вставляет пять контрольных фактов примерно в разные части документа. После этого модель должна вернуть все пять.

Я смотрел не только на правильность ответа, но и на actual input tokens, TTFT, скорость генерации и полное время запроса.

Qwen3.5 9B

Input tokens

Результат

TTFT

Generation

31 581

10/10

48.1 с

37.9 tok/s

62 868

10/10

125.5 с

31.6 tok/s

98 037

10/10

246.9 с

29.7 tok/s

125 394

10/10

366.0 с

28.5 tok/s

На 125 тысячах токенов Qwen все еще нашла все контрольные факты.

При этом узким местом оказался не decode, а prefill. Скорость генерации падала постепенно, а время до первого токена росло очень заметно. На 125k входа модель думала над самим prompt примерно шесть минут, прежде чем начала отвечать.

Для приложений, где один большой документ обрабатывается один раз, это терпимо. Для интерактивного чата на 100k контекста — уже совсем другая история.

Gemma 4 12B QAT

Input tokens

Результат

TTFT

Generation

30 711

10/10

110.0 с

24.8 tok/s

61 116

10/10

317.0 с

22.1 tok/s

Gemma тоже находила все факты, но длинный вход переваривала тяжелее. На примерно одинаковых 32k токенов Qwen понадобилось около 48 секунд до первого токена, Gemma — около 110.

То есть по retrieval обе модели выглядели хорошо, но для роли быстрого читателя длинных транскриптов Qwen явно была удобнее.

Bonsai 27B Q1

Bonsai я добавил скорее из любопытства. Это 27B‑модель в очень агрессивной 1-битной квантизации.

Input tokens

Результат

TTFT

Generation

4 222

10/10

14.5 с

28.0 tok/s

31 581

10/10

141.9 с

22.5 tok/s

Она действительно работает, причем не на уровне 1–2 токенов/с. Но длинный prefill оказался самым тяжелым из трех. На ~32k входа до первого токена прошло около 142 секунд.

Needle‑теста оказалось мало

На этом этапе возникла другая проблема: все модели начали получать 10/10. Такой тест хорошо отвечает на вопрос «нашла ли модель нужный факт», но почти ничего не говорит о том, насколько она умеет рассуждать.

Поэтому я сделал второй бенчмарк. Не научный, не претендующий на замену MMLU или LongBench, а просто прикладной набор задач, который удобно гонять локально через API LM Studio.

В финальной версии получилось 25 заданий по 4 балла. Пять блоков:

Блок

Количество

Логика и дедукция

5

Business reasoning

5

Multi‑hop по документам

5

Причинность, противоречия, ловушки

5

Анализ на контексте примерно до 10k

5

Reasoning OFF: быстрые ответы оказались слишком быстрыми

Первый прогон был с reasoning выключенным. Результаты получились такими:

Модель

Score

Avg TTFT

Generation

Полное время

Gemma 4 12B

68/100

3.98 с

33.68 tok/s

115.1 с

Bonsai 27B

48/100

6.91 с

32.59 tok/s

184.4 с

Qwen3.5 9B

44/100

2.33 с

47.97 tok/s

64.9 с

Сначала я решил, что снова сломал грейдер. Но когда посмотрел сырые ответы, оказалось, что большая часть ошибок настоящая.

Например Qwen ошибалась в элементарных многошаговых расчетах: давала 7.5 месяца вместо 3.6 в задаче на окупаемость, 133 вместо 200 в точке безубыточности, 1 вместо 4 в задаче на загрузку команды.

При этом на multi‑hop по документам она выступала заметно лучше. Возникло ощущение, что без reasoning модель часто просто фиксирует первый правдоподобный ответ и не успевает себя проверить.

Самое интересное было проверить тот же набор еще раз, но уже разрешить моделям думать.

Reasoning ON: вертаем диваны экспертов на 180 град.

Настройки оставил одинаковыми: контекст 16 384, температура 0, reasoning включен, общий лимит вывода и размышлений 2048 токенов.

И вот тут результаты стали совсем другими:

Модель

Score

Avg TTFT

Generation

Полное время

Bonsai 27B

100/100

6.73 с

27.66 tok/s

1072.0 с

Gemma 4 12B

100/100

3.93 с

29.75 tok/s

633.2 с

Qwen3.5 9B

96/100

2.33 с

40.63 tok/s

609.3 с

Qwen ошиблась только в одной логической задаче из 25. Gemma и Bonsai не ошиблись ни разу.

Категория

Qwen

Gemma

Bonsai

Logic

80%

100%

100%

Business

100%

100%

100%

Multi‑hop

100%

100%

100%

Causal / traps

100%

100%

100%

Analysis до 10k

100%

100%

100%

То есть Qwen выросла с 44/100 до 96/100, Bonsai — с 48/100 до 100/100. На тех же задачах, с тем же runtime и на том же железе.

Для меня это был, пожалуй, главный результат всей серии тестов: режим ответа влияет на практическое качество не меньше, чем выбор самой модели.

Gemma в итоге понравилась больше всего

До теста я ожидал довольно банальный расклад: Qwen будет быстрой, Bonsai 27B — самой умной, а Gemma окажется где‑то между ними.

Вышло интереснее. Bonsai действительно получила 100/100. Но Gemma тоже получила 100/100 и сделала это заметно быстрее.

Gemma: 633.2 с
Bonsai: 1072.0 с

Bonsai потребовалось примерно на 69% больше времени.

Qwen закончила за 609.3 секунды, то есть всего примерно на 4% быстрее Gemma по полному времени теста. Это особенно забавно, если смотреть только на скорость генерации: 40.6 tok/s у Qwen против 29.8 tok/s у Gemma.

Причина в том, что tok/s — это только часть картины. В reasoning‑режиме важны prefill, количество скрытых reasoning‑токенов и то, насколько долго сама модель продолжает проверять решение.

У Gemma по сохраненным логам было около 15 тысяч reasoning‑токенов на весь тест. Она не всегда доходила до лимита: на простых задачах тратила несколько сотен токенов, на сложных multi‑hop и длинном анализе доходила примерно до тысячи.

Bonsai рассуждала дольше, Qwen чаще была быстрее. Поэтому сравнивать reasoning‑модели только по decode speed оказалось не очень полезно. Гораздо честнее смотреть на время до готового правильного ответа.

Что бы я выбрал из этих трех

После этих прогонов у моделей для меня сформировались довольно разные роли.

Qwen3.5 9B я бы оставил для быстрого чтения больших объемов текста. Она быстрее всех переваривает длинный prompt, нормально работает с очень большим контекстом и в reasoning‑режиме почти догоняет более крупные модели по качеству.

Gemma 4 12B QAT стала основным кандидатом для задач, где нужно именно принять решение по уже отобранному материалу. В моем тесте она дала 100/100 и при этом по полному времени оказалась почти рядом с Qwen.

Bonsai 27B Q1 — самый необычный участник. 27B на GTX 1080 Ti, которая реально отвечает с нормальной скоростью и проходит reasoning‑тест на 100/100, сама по себе впечатляет. Но на этом конкретном наборе задач дополнительного качества относительно Gemma я не получил, а времени ушло намного больше.

Как это ложится на реальную задачу с подкастами

Моя исходная задача — не решать логические головоломки, а искать хорошие короткие фрагменты в длинных выпусках. После тестов я бы строил пайплайн в два этапа.

Полный транскрипт
|
v
Qwen3.5 9B, reasoning OFF
 быстро читает весь выпуск и находит 15–20 кандидатов
|
v
Gemma 4 12B, reasoning ON
сравнивает только отобранные сцены
|
v
TOP-6 клипов

Так не приходится скармливать более медленной модели весь выпуск. Qwen делает дешевую массовую работу, а Gemma подключается там, где действительно нужна аккуратная оценка.

При этом я не считаю эту схему окончательной. Следующий нормальный тест для такого приложения должен быть уже не синтетическим: взять несколько реальных выпусков, заранее вручную выбрать сильные клипы и посмотреть, какие модели ближе всего к человеческой разметке.

Насколько вообще можно верить этому бенчмарку

Немного холодной воды. 25 задач — маленькая выборка. Это не научный benchmark и точно не повод объявлять одну модель «лучшей вообще».

Результаты зависят от chat template, конкретной квантизации, версии runtime, reasoning budget, размера контекста, драйвера и формулировки самих задач. Я уже успел поймать две ошибки в собственном тесте, так что к абсолютным 100/100 отношусь спокойно.

Зато у такого домашнего теста есть другой плюс: все модели запускаются на одном железе, в одном runtime, с одинаковыми настройками и получают одни и те же задания. Для выбора модели под конкретную машину это иногда полезнее, чем смотреть на публичный leaderboard, собранный на другом стеке.

Если бы я развивал тест дальше, я бы не писал еще сотню собственных вопросов, а подключил часть стандартных наборов вроде MERA, RULER или lm‑evaluation‑harness и сравнил, сохраняется ли тот же расклад.

Минимальный код

Сам тест работает через локальный API LM Studio. Запрос в упрощенном виде выглядит так:

payload = {
“model”: model_id,
“input”: prompt,
“system_prompt”: system_prompt,
“temperature”: 0.0,
“max_output_tokens”: 2048,
“reasoning”: “on”,
“context_length”: 16384,
“stream”: False,
}

Каждая задача просит вернуть только один ответ:

{“answer”:“B”}

Дальше Python сам сохраняет expected answer, фактический ответ, количество input и reasoning tokens, TTFT, generation speed и wall time. Для сравнения моделей этого оказалось достаточно.

Что получилось в сухом остатке

Я начинал с довольно скромного вопроса: можно ли в 2026 году использовать GTX 1080 Ti как нормальную карту для локальных LLM, а не только для экспериментов.

После этих тестов мой ответ — да, если подобрать модель и не ждать от нее невозможного.

Qwen3.5 9B
 — около 40–48 tok/s
 — проверенный контекст как минимум до ~125k
 — 96/100 в reasoning‑тесте

Gemma 4 12B QAT
 — 100/100 в reasoning‑тесте
 — почти то же полное время выполнения, что у Qwen
 — лучший баланс качества и времени в моем наборе

Bonsai 27B Q1 
 — полноценная 27B‑модель на 11 GB VRAM
 — 100/100 
 — заметно медленнее Gemma на тех же задачах

Автор: Shashkov_ai

Источник