Сегодня, 13 августа DeepSeek выложил DeepSeek Harness v0.1 в Developer Preview. Открытый код, MIT, пакет @deepseek-ai/dsh в npm, запуск в одну строку:
npx @deepseek-ai/dsh web
Веб-морда поднимается на 127.0.0.1:3080. Главный философский тезис DeepSeek относительно обвязок — everything is a plugin: модели, инструменты, скиллы, сессии, песочницы, файловые системы, главный цикл агента, оркестрация и даже интерфейс реализованы плагинами и меняются конфигом, без правки исходников.
Само по себе это ещё один агент в очень плотной поляне — на июль 2026 в живых числилось около 35 активно поддерживаемых CLI-агентов. Интереснее не сам факт релиза, а то, во что он попал.
Считайте сами. 5 августа Meta выкатила Muse Code — свой первый терминальный агент, и тем самым перестала быть главным примером «большая лаба без харнесса». 12 августа DeepSeek тихо обновила флагман до V4-Pro-0813, и её главную агентную цифру — 87.9 на Terminal-Bench 2.1 — мерили ровно тем харнессом, который откроют на следующий день. 13 августа, то есть сегодня, харнесс открыли.
Две лабы за неделю, инструмент измерения и объект измерения с разницей в сутки. А если растянуть окно до квартала, картина совсем плотная: своими харнессами за это время обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek. Категория, которой два года назад не существовало, консолидируется прямо сейчас.
Хороший повод разложить её целиком: что такое харнесс и почему за него дерутся, у каких лаб он уже есть, у каких ещё нет, и что происходит в лагере тех, кто принципиально не привязан ни к одной модели.
1. Что такое вообще это ваш харнесс?
Модель — это, если уж очень грубо говоря, функция «текст → текст». Она не умеет читать ваш репозиторий, звать ripgrep, запускать тесты, разбирать чужой стектрейс, откатываться после падения и продолжать работу на сороковом шаге. Всё это делает обвязка: агентный цикл, набор инструментов, системные промпты, права доступа, компакция контекста, сабагенты, песочница, логирование.

Ключевое следствие, которое стоит держать в голове каждый раз, когда вы смотрите на таблицу бенчмарков:
Цифра на агентном бенчмарке — это результат связки модель+харнесс, а не свойство модели.
Отсюда возникает практическая проблема: как тогда честно сравнивать модели между собой?
Индустрия решает её одинаково — берёт нарочно примитивную обвязку, одинаковую для всех, и меряет в ней. Канонический пример — mini-SWE-agent от команды SWE-bench: один-единственный инструмент bash, никаких кастомных инструментов, линейная история сообщений, каждое действие через subprocess.run. Команда SWE-bench завела под него отдельный лидерборд Bash Only и описывает его прямым текстом — «дефолтный вид Verified: каждая модель в одном и том же окружении mini-SWE-agent».
Февральский прогон 2026 года: Claude 4.5 Opus — 74.4%, Gemini 3 Pro Preview — 74.2%, GPT-5.2 (high) — 71.8%, Claude 4.5 Sonnet — 70.6%. Для сравнения, в июле 2025 года mini-SWE-agent на том же бенчмарке выдавал 65%. Обвязка за это время принципиально не менялась — вырос слой моделей.
А сколько добавляет полноценная обвязка? Есть прямое измерение: работа Live-SWE-agent сравнивает mini с самоэволюционирующим агентом на одних и тех же моделях. Gemini 3 Pro: 74.2 → 77.4. Claude 4.5 Sonnet: 70.6 → 75.4. GPT-5: 65.0 → 68.4. То есть порядка 3–5 процентных пунктов.
Тут нужны две оговорки, и они работают в разные стороны. Во-первых, Bash Only использует одинаковый системный промпт для всех моделей — это делает сравнение моделей честным, но означает, что качество харнессов там в принципе не измеряется; лидерборд сконструирован, чтобы убрать переменную обвязки, а не доказать её незначимость. Во-вторых, SWE-bench Verified — это короткая задача внутри одного репозитория, то есть ровно тот режим, где харнесс нужен меньше всего. Память между сессиями, компакция контекста, сабагенты, восстановление после сбоя на сороковом шаге — ничего из этого туда не помещается. Именно поэтому индустрия переехала на Terminal-Bench 2.x, где горизонт длиннее и разброс от обвязки заметно больше.
Причём здесь DeepSeek
А при том, что minimal mode в DeepSeek Harness — это ровно тот же приём. Два инструмента, персистентный bash и str_replace_editor, и ничего больше. Не урезанная версия для бедных, а измерительный прибор: режим, в котором лаба меряет собственную модель, минимизируя вклад обвязки.
И вот здесь была проблема. В чейнджлоге от 31 июля под таблицей агентных бенчмарков V4-Flash висела сноска: Terminal-Bench 2.1 = 82.7 получено «на DeepSeek Harness minimal mode (to be released soon)», max effort, top_p=0.95, temperature=1.0.
Прибор был только у одной стороны. Полтора месяца цифру нельзя было воспроизвести — сэмплинг опубликован, а вторая половина конфигурации недоступна снаружи. Любая цифра, полученная на публичном харнессе, измеряла другую систему, и разрыв нельзя было разложить на «модель слабее заявленного» и «ваша обвязка хуже нашей».
Дальше — хронология одной недели. 12 августа выходит V4-Pro-0813 с Terminal-Bench 2.1 = 87.9 против 72.1 у апрельского превью. 13 августа открывается харнесс, включая тот самый minimal mode. Порядок событий говорит сам за себя: сначала цифра, потом инструмент для её проверки.
2. Анатомия DeepSeek Harness
Самое неожиданное — фундамент. Ядро DeepSeek Harness — Cordis, IoC-микроядро с dependency injection и обратимыми побочными эффектами, родом из экосистемы Koishi (китайский фреймворк для чат-ботов). Суть Cordis: всё, что регистрирует плагин, отслеживается и откатывается при выгрузке. Отсюда честный hot reload без утечек и без ручной уборки. Под архитектуру «всё плагин» выбор логичный, хоть и неочевидный.
Код — Node.js/TypeScript-монорепа на pnpm. Валидация схем — на самописном schemastery вместо более популярного zod, ради консистентности со стеком Cordis.
Четыре режима работы
|
Режим |
Что это |
|---|---|
|
Standard |
Полный агент: правка файлов, шелл, поиск по файлам и вебу, скиллы, планирование, цели, сабагенты, воркфлоу |
|
Code |
Инструменты выставлены через Code Mode SDK, и модель пишет одну TypeScript-программу, оркестрирующую многошаговые операции |
|
Minimal |
Ровно два инструмента: персистентный bash и |
|
Creator |
Сборка собственных пресетов: интроспекция рантайма, тесты плагинов в памяти, гайд по авторингу |
Code mode заслуживает отдельного абзаца — и объяснения, потому что идея неочевидная.
В обычном режиме инструменты отдаются модели списком функций, которые она вызывает по одной. Модель формулирует вызов, харнесс исполняет, результат целиком возвращается в контекст, модель читает его и решает, что делать дальше. Один инструмент — один круг.
В Code mode те же инструменты выставляются как SDK: набор типизированных функций, доступных из TypeScript. Модель пишет не вызов, а программу. Харнесс исполняет её в песочнице целиком, и обратно в контекст возвращается только то, что программа напечатала.
Разница видна на задаче вроде «найди все места, где импортируется устаревший модуль, и проверь, где он реально используется». Классический цикл: grep возвращает сорок путей — все сорок падают в контекст. Дальше сорок чтений файлов — ещё сорок результатов в контекст. Модель на каждом шаге перечитывает всю эту простыню заново.
В Code mode модель пишет примерно следующее (схематично, имена функций условные):
const files = await grep("import legacy_parser");
const hits = [];
for (const f of files) {
const src = await read(f);
if (/legacy_parser.w+(/.test(src)) hits.push(f);
}
print(hits); // в контекст вернутся только эти три пути
Сорок промежуточных результатов остались переменными внутри программы и до модели не доехали. В контекст пришли три строки вместо восьмидесяти простыней.
Плата за это — модель должна написать корректный код с первого раза. Если в программе ошибка, цикл отладки длиннее, чем при обычном вызове инструмента: падает вся программа, а не один шаг.
Это не изобретение DeepSeek — идея витает в воздухе. Nous Research называет то же самое Programmatic Tool Calling через execute_code, есть препринт с прямолинейным названием «Code as Agent Harness». Но в лабовом харнессе первого уровня это одна из первых полноценных реализаций.
Profile и Preset: два уровня конфигурации
Настройки в DeepSeek Harness разложены на два независимых слоя — процесс и агент.
Profile определяет, как живёт процесс целиком: web или headless, какие бандлы установлены. По сути это упорядоченный слой патчей cordis.patch.yml.
Agent Preset определяет, что видит конкретный агент в конкретной сессии: инструменты, промпты, скиллы, сабагентов, воркфлоу. Скоуп резолвится по цепочке agent → preset → global.
Практический смысл: в одном процессе одновременно живут агент-писатель, агент-кодер и агент-ресёрчер с разными наборами инструментов и инструкций. Не нужно поднимать четыре сервиса.
Трассируемость
Здесь, на мой взгляд, самая недооценённая часть релиза. Принцип формулируется как «видимое модели ⇔ записанное»: всё, что попадает модели на вход, пишется в append-only лог сессии — системные промпты, ризонинг, определения инструментов, вызовы и их результаты, планирование сабагентов, каждая инъекция контекста, реально использованная модель. В Trajectory view это разбирается по источникам.
Resume, fork, поиск и replay работают поверх одного и того же потока событий. Кто хоть раз пытался понять, почему агент на тридцатом шаге решил снести тесты, — тот оценит.
Похожий подход есть у OpenHands — детерминированный replay в SDK. Но интереснее другое: ровно ту же идею за неделю до DeepSeek выкатила Meta. В Muse Code каждая правка файла, вызов инструмента и решение агента пишутся в event log, а команда muse replay проходит сессию по шагам — мотивируют это compliance-сценариями вроде SOC 2 и HIPAA.
Две лабы независимо и почти одновременно пришли к одному решению. Это значит, что replay поверх потока событий перестаёт быть отличительной фишкой и превращается в ожидаемую часть категории — примерно как plan mode год назад.
Безопасность и оговорки
Песочница строится на нативных механизмах ОС, MCP поддерживается, OpenAI-совместимые эндпоинты тоже. Ключи лежат в $DSH_HOME/.credentials.yaml, конфиг ссылается только на имена креденшелов, в лог сессии они не попадают.
Две оговорки:
⚠️ Это v0.1 developer preview, и предупреждение стоит в README капслоком: «THERE WILL BE COMPATIBILITY-BREAKING CHANGES». На лендинге формулировка вежливее — основные плагины и API продолжат развиваться, — но смысл тот же.
Конкретных примеров поломок пока нет: проекту один день. Зато по архитектуре понятно, где рванёт первым, и это ровно то, ради чего DeepSeek Harness и берут. Всё, что вы напишете поверх плагинного API, разложите по слоям cordis.patch.yml или завяжете на цепочку скоупов agent → preset → global, держится на контрактах, которые автор прямым текстом обещает ломать. Писать плагин под dsh сегодня — это не «поставил и забыл», а подписка на чужой рефакторинг.
И небольшое by the way для тех, кто пойдёт ставить прямо сейчас. В PyPI с мая лежит пакет deepseek-harness от постороннего разработчика, и он тоже заводит команду dsh. Проект сам по себе честный, появился на три месяца раньше и к сегодняшнему релизу отношения не имеет — просто совпали имена. Но шума вокруг темы в ближайшие недели будет много, а совпадающее имя команды — идеальная почва для тайпсквоттинга. Простое правило: официальное ставится из npm и живёт в организации deepseek-ai. Если инструкция предлагает pip install — это не то.
3. Зачем лабе свой харнесс: четыре причины
Бенчмарки. Пока вашу модель гоняют в чужой обвязке, заточенной под чужую модель, вы выглядите хуже, чем есть. Свой харнесс — это контроль над цифрой в анонсе и, если он открыт, возможность её воспроизвести.
Обучение. Харнесс — это среда. При RL на агентных задачах вам нужен свой цикл, свои инструменты, своё определение шага. Ко-тренировка модели вместе с обвязкой — ровно то, чем объясняют силу связки Claude + Claude Code.
Деньги. Модель продаётся токенами, харнесс продаётся подпиской — а подписка предсказуемее и маржинальнее. Рынок это считал мгновенно: в треде под анонсом в X читатели тут же начали требовать кодинг-тариф в духе «харнесс есть, модель есть, компьюта хватает — где подписка?». Логика прозрачная: своего coding plan у DeepSeek до сих пор нет, а харнесс — ровно та деталь, без которой его не продать.
Контроль над точкой входа. Харнесс — это место, где пользователь на самом деле живёт: там он ставит задачу, там смотрит результат, там ругается. У DeepSeek такого места не было. До вчерашнего дня официальный ответ на вопрос «как запустить это агентом» звучал так:
export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<key>
export ANTHROPIC_MODEL=deepseek-v4-pro[1m]
export CLAUDE_CODE_EFFORT_LEVEL=max
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=786432
Да, это Claude Code с подменённым бэкендом. В доках DeepSeek больше десятка страниц Agent Integrations — Claude Code, Codex, OpenCode, OpenClaw, Hermes, Reasonix, Crush, Kilo Code, Pi и далее. Все чужие.
Интеграции и открытость — прекрасная стратегия распространения, но петлю обратной связи они не строят. Когда вашу модель гоняют в чужой обвязке, вы видите токены на входе и токены на выходе. Вы не видите, на каком шаге агент сломался, какой инструмент вернул мусор, где системный промпт увёл модель не туда и что пользователь молча переписал руками после. Всё, из чего собирается следующий посттрейн, остаётся у владельца харнесса — вместе с правом решать, каким промптом и с каким набором инструментов показывать вашу модель миру.
4. Лабы, у которых свой харнесс уже есть
|
Лаба |
Харнесс |
Дебют |
Код |
Особенность |
|---|---|---|---|---|
|
Anthropic |
Claude Code (+ Cowork) |
фев 2025 |
закрытый |
Задал шаблон категории; только Claude |
|
OpenAI |
апр 2025 |
Apache-2.0 |
Rust, ОС-песочница, облачный агент, локальные модели |
|
|
|
июн 2025 / май 2026 |
Apache / закрытый |
Antigravity делит харнесс с десктопной платформой |
|
|
Microsoft / GitHub |
сен 2025, GA фев 2026 |
закрытый |
Мультимодельный: Anthropic, OpenAI, Google, MAI, открытый Kimi K2.7. Copilot SDK в GA с июня 2026 |
|
|
xAI |
май 2026 |
закрытый |
256K контекста, до 8 параллельных сабагентов в worktree |
|
|
Mistral |
Vibe (2.0 в янв 2026) |
дек 2025 |
Apache-2.0 |
Work Mode + Code Mode, удалённые агенты, ACP |
|
Moonshot |
июн 2026 |
MIT |
Встроенные сабагенты coder/explore/plan, ACP |
|
|
Z.ai (Zhipu) |
ZCode |
июл 2026 |
десктопная IDE |
«Agentic Development Environment» под GLM-5.2, BYOK |
|
Alibaba |
Qwen Code, Qoder |
июл 2025 |
Apache-2.0 |
Форк Gemini CLI под открытые кодеры Qwen |
|
Amazon |
2025 |
закрытый |
Бывший Amazon Q Developer CLI, spec-driven |
|
|
Tencent |
CodeBuddy Code |
сен 2025 |
закрытый |
Скиллы, plan mode, ACP, песочница |
|
Nous Research |
Hermes Agent |
фев 2026 |
открытый |
Отдельный разговор, см. раздел 6 |
|
Meta |
авг 2026 |
закрытый |
Мультиагентность по умолчанию, event log и |
|
|
DeepSeek |
авг 2026 |
MIT |
Всё плагин, Cordis, четыре режима |
5. Кто до сих пор без
Список короче, чем был ещё месяц назад:
-
MiniMax — модели сильные, официального CLI-харнесса нет. В июне под их аккаунтом висел вполне отчаянный тред: «kimi code есть, qwen code есть, glm есть — где minimax?»
-
Nvidia, Cohere, AI21, Reka, Sakana — модели есть, харнессов нет.
-
Perplexity, Thinking Machines, SSI — не их бизнес в принципе.
Тенденция читается однозначно: если у лабы есть кодинг-модель, через полгода у неё будет свой харнесс. Лучшее подтверждение — сама Meta. Ещё в июле она была главным примером «лаба без харнесса»: внутренние инструменты есть, наружу ничего. 5 августа вышел Muse Code, и пример закончился. За один квартал 2026 года своими харнессами обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek.
Отдельная категория — платформенные харнессы, где вендор продаёт обвязку, но модель не тренирует: Cursor CLI, Amp (отделился от Sourcegraph в декабре 2025), Droid (Factory), Junie (JetBrains), Auggie (Augment), Qoder. Почти все они принципиально мультимодельные — в этом их продажа.
Copilot я сознательно занёс в таблицу выше, а не сюда, хотя он тоже мультимодельный и живёт на платформе GitHub. Критерий простой: у Microsoft есть собственные модели MAI, и они — одна из опций в модельном пикере Copilot. Если считать иначе, придётся выкинуть из таблицы и Amazon с Kiro, который тоже роутит между Opus, MiniMax, DeepSeek и Qwen. Граница между «лабой» и «платформой» в 2026 году размылась до того, что провести её честно уже нельзя.
6. Model-agnostic лагерь
Здесь самое интересное, потому что открытые веса подешевели настолько, что связка «нормальный харнесс + GLM-5.2 / DeepSeek V4 / Qwen3-Coder / Kimi K2.7» даёт околофронтирные результаты за долю подписочной цены.
|
Проект |
Лицензия |
Чем интересен |
|---|---|---|
|
MIT, ~182k★ |
Самый зазвёзженный агент на GitHub. 75+ провайдеров, клиент-сервер, TUI + десктоп + IDE |
|
|
MIT, ~67k★ |
Model-agnostic через вычитание: 4 инструмента, системный промпт короче 1000 токенов, MCP вынесен в SDK расширений |
|
|
MIT, ~16k★ |
Тот же Pi с обратным знаком: hash-anchored патчи, AST-переписывание, управление отладчиком по DAP, модель-надзиратель Advisor |
|
|
Apache-2.0, ~51k★ |
Единственный крупный агент под управлением фонда (AAIF при Linux Foundation). MCP-native, local-first |
|
|
Cline |
Apache-2.0, ~64k★ |
Вынес рантайм в отдельный открытый SDK — продукт превратился в инфраструктуру |
|
открытый, ~79k★ |
Контейнеризация всего, event-sourced replay в SDK |
|
|
Apache-2.0, ~47k★ |
Праотец. Гит-нативные атомарные коммиты, 100+ моделей через LiteLLM. Темп просел |
|
|
Kilo / Continue / Crush |
открытые |
500+ моделей / CI-first / лучший TUI в категории |
|
MIT, ~26k★ |
Сторонний харнесс вокруг префикс-кэша DeepSeek: байт-стабильный контекст, отчётные 99.8% попаданий |
|
|
MIT |
Только bash, ни одного кастомного инструмента. На нём построен лидерборд Bash Only — стандарт для сравнения моделей между собой |
Отдельно стоит Omnigent от Databricks — мета-харнесс, который оркестрирует другие харнессы (Claude Code, Codex, Cursor, OpenCode, Hermes, Kiro, Pi) в одной сессии с общими политиками апрувов и трат.
7. Персональные агенты: другой класс, та же архитектура
Всё вышеперечисленное — про код. Но есть вторая ветка эволюции, где харнесс обслуживает не репозиторий, а жизнь пользователя. Две главные фигуры:
OpenClaw
Проект Петера Штайнбергера — австрийца, который до этого тринадцать лет в одиночку бутстрапил PSPDFKit, PDF-фреймворк для мобильных приложений. Dropbox, IBM, банки; в 2021 году — стратегическая инвестиция Insight Partners на €100 млн и выход из компании. Дальше выгорание и несколько лет практически без кода, пока в конце 2024-го он не сел за Claude Code.
OpenClaw появился в ноябре 2025-го (сначала под именем Clawdbot, потом Moltbot) и написан, по словам автора, за час — потому что он проголодался и захотел проверить своих агентов с кухни. Дальше случилось то, что случилось: самый зазвёзженный репозиторий на GitHub меньше чем за пять месяцев (346k+ звёзд), 4.7 млн еженедельных загрузок, около полумиллиона машин по миру.
Суть — персональный ассистент, который живёт локально на вашей машине и общается с вами через мессенджеры, которыми вы и так пользуетесь: WhatsApp, Telegram. Не «чат с ИИ», а сущность, которая работает в фоне и пишет вам сама.
В феврале 2026 Штайнбергер ушёл в OpenAI «строить следующее поколение персональных агентов». OpenClaw остался открытым и живёт в фонде, который OpenAI обещал поддерживать.
И вот главное, ради чего его стоит упомянуть в статье про харнессы. Штайнбергер публично сформулировал урок, который дорого ему обошёлся:
«Бизнес-модель твоей зависимости — это твоя бизнес-модель».
Он оптимизировал свой харнесс под модели Anthropic. Потом Anthropic примерно за сутки предупредила об отключении подписок и выкатила собственного конкурирующего агента. Всё.
Это ровно тот сценарий, от которого страхуются и OpenCode, и Pi, и — теперь — DeepSeek, выкладывая свой харнесс под MIT. Открытость здесь не благотворительность, а стратегия: если ваша обвязка стала субстратом, на котором строят другие, вас нельзя выключить одним письмом.
(Заодно там же — поучительная история про безопасность: пресса объявила, что 20% скиллов OpenClaw вредоносные, реальная цифра оказалась 0.3%. Осадочек, впрочем, остался, и вопрос «что мы вообще пускаем к файловой системе» никуда не делся.)
Hermes Agent
Проект Nous Research — и это как раз лаба, которая делает модели (линейка Hermes, которые они файнтьюнили из Llama), но при этом её харнесс принципиально model-agnostic. Работает с Nous Portal, OpenRouter, OpenAI и любым эндпоинтом.
Nous формулирует прямой архитектурный тезис — Harness Engineering: главный анлок 2026 года не в более умной модели, а в более умной обёртке вокруг неё. Отсюда пять слоёв, в которые они вкладываются: инструкции, ограничения, обратная связь, память, оркестрация. Модель при этом объявлена сменной деталью — сегодня фронтир, завтра локальная, послезавтра какая-нибудь ещё.
Что отличает Hermes от кодинг-агентов:
-
Самоулучшение. Он ведёт персистентную память своих успехов и провалов и генерирует из них переиспользуемые скиллы. Агент после месяца работы измеримо отличается от того, с которого вы начали. Слоган — «the agent that grows with you».
-
Каналы доставки. Терминал, нативное десктопное приложение под macOS/Windows/Linux, телеграм-бот, cron, вебхуки.
-
Пять бэкендов песочницы: local, Docker, SSH, Singularity, Modal — с харденингом контейнеров и изоляцией неймспейсов.
-
Programmatic Tool Calling через
execute_code— та же идея, что и Code mode в DeepSeek Harness. -
Скиллы для управления другими харнессами. Hermes умеет вызывать Claude Code, Codex CLI, OpenCode и OpenHands как сабагентов. Пожалуй, самый чистый способ скомпоновать несколько харнессов без написания клея.
-
Совместимость со стандартом скиллов agentskills.io.
По снимку OpenRouter от 10 мая Hermes был №1 по дневному потреблению токенов: 224 млрд в день против 186 млрд у OpenClaw. В июле Nous Research привлекала раунд по оценке $1.5 млрд.
Мораль для темы статьи: харнесс перестал быть придатком модели настолько, что вокруг него оценивают компании в полтора миллиарда.
Можно, а зачем?
Несмотря на то, что формально основная идея всех подобных тулов улучшать жизнь и быть крутым персональным агентом, лично я не вижу в них большую ценность – в большинстве случаев задачи так или иначе требуют вашего внимания и что OpenClaw, что Hermes Agent, несмотря на сумасшедшие оценки со стороны инвесторов – абсолютно все примеры использования сводятся к тому, что люди наколхозили себе ChatGPT на VPSке с доступом через телеграм. Если вы знаете какие-то хорошие примеры использования – пишите в коментариях.
8. Что со всем этим делать
На данный момент формируется два лагеря: первые — арчеры, которые бесконечно возяться со своим любимым harnessом и его бесконечными плагинами. Действительно ли это помогает с продуктивностью — сложно сказать. Второй, приверженцем которого является автор статьи, что в зависимости от того, какую модель вы используете, стоит подбирать соответсвующую обвязку. Раз в какое-то количество времени можно переезжать по желанию, но я думаю, что все еще стоит фокусироваться на том, что вы делаете и есть ли у этого выхлоп, а не на том, каким молотком вы пользуетесь.
Разбор самой модели я вынес отдельно — цифры V4-Pro-0813, цена за миллион токенов, агентные бенчмарки и то, чего в них не видно, лежат у меня в телеграме. Там же всё остальное про локальный инференс и агентную возню, чипы и иногда про науку.
Ссылки: deepseek.com/harness · github.com/deepseek-ai/deepseek-harness · github.com/topics/dsh-plugin
Все бенчмарки в статье, где не указано иное, — вендорские. Звёзды и версии — на середину августа 2026.
Автор: danyathewriter


