- BrainTools - https://www.braintools.ru -
Сегодня, 13 августа DeepSeek выложил DeepSeek Harness v0.1 [1] в Developer Preview. Открытый код, MIT, пакет @deepseek-ai/dsh в npm, запуск в одну строку:
npx @deepseek-ai/dsh web
Веб-морда поднимается на 127.0.0.1:3080. Главный философский тезис DeepSeek относительно обвязок — everything is a plugin: модели, инструменты, скиллы, сессии, песочницы, файловые системы, главный цикл агента, оркестрация и даже интерфейс реализованы плагинами и меняются конфигом, без правки исходников.
Само по себе это ещё один агент в очень плотной поляне — на июль 2026 в живых числилось около 35 активно поддерживаемых CLI-агентов. Интереснее не сам факт релиза, а то, во что он попал.
Считайте сами. 5 августа Meta выкатила Muse Code — свой первый терминальный агент, и тем самым перестала быть главным примером «большая лаба без харнесса». 12 августа DeepSeek тихо обновила флагман до V4-Pro-0813, и её главную агентную цифру — 87.9 на Terminal-Bench 2.1 — мерили ровно тем харнессом, который откроют на следующий день. 13 августа, то есть сегодня, харнесс открыли.
Две лабы за неделю, инструмент измерения и объект измерения с разницей в сутки. А если растянуть окно до квартала, картина совсем плотная: своими харнессами за это время обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek. Категория, которой два года назад не существовало, консолидируется прямо сейчас.
Хороший повод разложить её целиком: что такое харнесс и почему за него дерутся, у каких лаб он уже есть, у каких ещё нет, и что происходит в лагере тех, кто принципиально не привязан ни к одной модели.
Модель — это, если уж очень грубо говоря, функция «текст → текст». Она не умеет читать ваш репозиторий, звать ripgrep, запускать тесты, разбирать чужой стектрейс, откатываться после падения и продолжать работу на сороковом шаге. Всё это делает обвязка: агентный цикл, набор инструментов, системные промпты, права доступа, компакция контекста, сабагенты, песочница, логирование.
Ключевое следствие, которое стоит держать в голове каждый раз, когда вы смотрите на таблицу бенчмарков:
Цифра на агентном бенчмарке — это результат связки модель+харнесс, а не свойство модели.
Отсюда возникает практическая проблема: как тогда честно сравнивать модели между собой?
Индустрия решает её одинаково — берёт нарочно примитивную обвязку, одинаковую для всех, и меряет в ней. Канонический пример — mini-SWE-agent [2] от команды SWE-bench: один-единственный инструмент bash, никаких кастомных инструментов, линейная история сообщений, каждое действие через subprocess.run. Команда SWE-bench завела под него отдельный лидерборд Bash Only [3] и описывает его прямым текстом — «дефолтный вид Verified: каждая модель в одном и том же окружении mini-SWE-agent».
Февральский прогон 2026 года [4]: Claude 4.5 Opus — 74.4%, Gemini 3 Pro Preview — 74.2%, GPT-5.2 (high) — 71.8%, Claude 4.5 Sonnet — 70.6%. Для сравнения, в июле 2025 года mini-SWE-agent на том же бенчмарке выдавал 65%. Обвязка за это время принципиально не менялась — вырос слой моделей.
А сколько добавляет полноценная обвязка? Есть прямое измерение: работа Live-SWE-agent [5] сравнивает mini с самоэволюционирующим агентом на одних и тех же моделях. Gemini 3 Pro: 74.2 → 77.4. Claude 4.5 Sonnet: 70.6 → 75.4. GPT-5: 65.0 → 68.4. То есть порядка 3–5 процентных пунктов.
Тут нужны две оговорки, и они работают в разные стороны. Во-первых, Bash Only использует одинаковый системный промпт для всех моделей — это делает сравнение моделей честным, но означает, что качество харнессов там в принципе не измеряется; лидерборд сконструирован, чтобы убрать переменную обвязки, а не доказать её незначимость. Во-вторых, SWE-bench Verified — это короткая задача внутри одного репозитория, то есть ровно тот режим, где харнесс нужен меньше всего. Память [6] между сессиями, компакция контекста, сабагенты, восстановление после сбоя на сороковом шаге — ничего из этого туда не помещается. Именно поэтому индустрия переехала на Terminal-Bench 2.x [7], где горизонт длиннее и разброс от обвязки заметно больше.
А при том, что minimal mode в DeepSeek Harness — это ровно тот же приём. Два инструмента, персистентный bash и str_replace_editor, и ничего больше. Не урезанная версия для бедных, а измерительный прибор: режим, в котором лаба меряет собственную модель, минимизируя вклад обвязки.
И вот здесь была проблема. В чейнджлоге от 31 июля [8] под таблицей агентных бенчмарков V4-Flash висела сноска: Terminal-Bench 2.1 = 82.7 получено «на DeepSeek Harness minimal mode (to be released soon)», max effort, top_p=0.95, temperature=1.0.
Прибор был только у одной стороны. Полтора месяца цифру нельзя было воспроизвести — сэмплинг опубликован, а вторая половина конфигурации недоступна снаружи. Любая цифра, полученная на публичном харнессе, измеряла другую систему, и разрыв нельзя было разложить на «модель слабее заявленного» и «ваша обвязка хуже нашей».
Дальше — хронология одной недели. 12 августа выходит V4-Pro-0813 с Terminal-Bench 2.1 = 87.9 против 72.1 у апрельского превью. 13 августа открывается харнесс, включая тот самый minimal mode. Порядок событий говорит сам за себя: сначала цифра, потом инструмент для её проверки.
Самое неожиданное — фундамент. Ядро DeepSeek Harness — Cordis [9], IoC-микроядро с dependency injection и обратимыми побочными эффектами, родом из экосистемы Koishi (китайский фреймворк для чат-ботов). Суть Cordis: всё, что регистрирует плагин, отслеживается и откатывается при выгрузке. Отсюда честный hot reload без утечек и без ручной уборки. Под архитектуру «всё плагин» выбор логичный, хоть и неочевидный.
Код — Node.js/TypeScript-монорепа на pnpm. Валидация схем — на самописном schemastery вместо более популярного zod, ради консистентности со стеком Cordis.
|
Режим |
Что это |
|---|---|
|
Standard |
Полный агент: правка файлов, шелл, поиск по файлам и вебу, скиллы, планирование, цели, сабагенты, воркфлоу |
|
Code |
Инструменты выставлены через Code Mode SDK, и модель пишет одну TypeScript-программу, оркестрирующую многошаговые операции |
|
Minimal |
Ровно два инструмента: персистентный bash и |
|
Creator |
Сборка собственных пресетов: интроспекция рантайма, тесты плагинов в памяти, гайд по авторингу |
Code mode заслуживает отдельного абзаца — и объяснения, потому что идея неочевидная.
В обычном режиме инструменты отдаются модели списком функций, которые она вызывает по одной. Модель формулирует вызов, харнесс исполняет, результат целиком возвращается в контекст, модель читает его и решает, что делать дальше. Один инструмент — один круг.
В Code mode те же инструменты выставляются как SDK: набор типизированных функций, доступных из TypeScript. Модель пишет не вызов, а программу. Харнесс исполняет её в песочнице целиком, и обратно в контекст возвращается только то, что программа напечатала.
Разница видна на задаче вроде «найди все места, где импортируется устаревший модуль, и проверь, где он реально используется». Классический цикл: grep возвращает сорок путей — все сорок падают в контекст. Дальше сорок чтений файлов — ещё сорок результатов в контекст. Модель на каждом шаге перечитывает всю эту простыню заново.
В Code mode модель пишет примерно следующее (схематично, имена функций условные):
const files = await grep("import legacy_parser");
const hits = [];
for (const f of files) {
const src = await read(f);
if (/legacy_parser.w+(/.test(src)) hits.push(f);
}
print(hits); // в контекст вернутся только эти три пути
Сорок промежуточных результатов остались переменными внутри программы и до модели не доехали. В контекст пришли три строки вместо восьмидесяти простыней.
Плата за это — модель должна написать корректный код с первого раза. Если в программе ошибка [10], цикл отладки длиннее, чем при обычном вызове инструмента: падает вся программа, а не один шаг.
Это не изобретение DeepSeek — идея витает в воздухе. Nous Research называет то же самое Programmatic Tool Calling через execute_code, есть препринт с прямолинейным названием «Code as Agent Harness» [11]. Но в лабовом харнессе первого уровня это одна из первых полноценных реализаций.
Настройки в DeepSeek Harness разложены на два независимых слоя — процесс и агент.
Profile определяет, как живёт процесс целиком: web или headless, какие бандлы установлены. По сути это упорядоченный слой патчей cordis.patch.yml.
Agent Preset определяет, что видит конкретный агент в конкретной сессии: инструменты, промпты, скиллы, сабагентов, воркфлоу. Скоуп резолвится по цепочке agent → preset → global.
Практический смысл: в одном процессе одновременно живут агент-писатель, агент-кодер и агент-ресёрчер с разными наборами инструментов и инструкций. Не нужно поднимать четыре сервиса.
Здесь, на мой взгляд, самая недооценённая часть релиза. Принцип формулируется как «видимое модели ⇔ записанное»: всё, что попадает модели на вход, пишется в append-only лог сессии — системные промпты, ризонинг, определения инструментов, вызовы и их результаты, планирование сабагентов, каждая инъекция контекста, реально использованная модель. В Trajectory view это разбирается по источникам.
Resume, fork, поиск и replay работают поверх одного и того же потока событий. Кто хоть раз пытался понять, почему агент на тридцатом шаге решил снести тесты, — тот оценит.
Похожий подход есть у OpenHands [12] — детерминированный replay в SDK. Но интереснее другое: ровно ту же идею за неделю до DeepSeek выкатила Meta. В Muse Code каждая правка файла, вызов инструмента и решение агента пишутся в event log, а команда muse replay проходит сессию по шагам — мотивируют это compliance-сценариями вроде SOC 2 и HIPAA.
Две лабы независимо и почти одновременно пришли к одному решению. Это значит, что replay поверх потока событий перестаёт быть отличительной фишкой и превращается в ожидаемую часть категории — примерно как plan mode год назад.
Песочница строится на нативных механизмах ОС, MCP поддерживается, OpenAI-совместимые эндпоинты тоже. Ключи лежат в $DSH_HOME/.credentials.yaml, конфиг ссылается только на имена креденшелов, в лог сессии они не попадают.
Две оговорки:
⚠️ Это v0.1 developer preview, и предупреждение стоит в README [13] капслоком: «THERE WILL BE COMPATIBILITY-BREAKING CHANGES». На лендинге формулировка вежливее — основные плагины и API продолжат развиваться, — но смысл тот же.
Конкретных примеров поломок пока нет: проекту один день. Зато по архитектуре понятно, где рванёт первым, и это ровно то, ради чего DeepSeek Harness и берут. Всё, что вы напишете поверх плагинного API, разложите по слоям cordis.patch.yml или завяжете на цепочку скоупов agent → preset → global, держится на контрактах, которые автор прямым текстом обещает ломать. Писать плагин под dsh сегодня — это не «поставил и забыл», а подписка на чужой рефакторинг.
И небольшое by the way для тех, кто пойдёт ставить прямо сейчас. В PyPI с мая лежит пакет deepseek-harness от постороннего разработчика [14], и он тоже заводит команду dsh. Проект сам по себе честный, появился на три месяца раньше и к сегодняшнему релизу отношения не имеет — просто совпали имена. Но шума вокруг темы в ближайшие недели будет много, а совпадающее имя команды — идеальная почва для тайпсквоттинга. Простое правило: официальное ставится из npm и живёт в организации deepseek-ai. Если инструкция предлагает pip install — это не то.
Бенчмарки. Пока вашу модель гоняют в чужой обвязке, заточенной под чужую модель, вы выглядите хуже, чем есть. Свой харнесс — это контроль над цифрой в анонсе и, если он открыт, возможность её воспроизвести.
Обучение [15]. Харнесс — это среда. При RL на агентных задачах вам нужен свой цикл, свои инструменты, своё определение шага. Ко-тренировка модели вместе с обвязкой — ровно то, чем объясняют силу связки Claude + Claude Code.
Деньги. Модель продаётся токенами, харнесс продаётся подпиской — а подписка предсказуемее и маржинальнее. Рынок это считал мгновенно: в треде под анонсом в X читатели тут же начали требовать кодинг-тариф в духе «харнесс есть, модель есть, компьюта хватает — где подписка?». Логика [16] прозрачная: своего coding plan у DeepSeek до сих пор нет, а харнесс — ровно та деталь, без которой его не продать.
Контроль над точкой входа. Харнесс — это место, где пользователь на самом деле живёт: там он ставит задачу, там смотрит результат, там ругается. У DeepSeek такого места не было. До вчерашнего дня официальный ответ на вопрос «как запустить это агентом» звучал так:
export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<key>
export ANTHROPIC_MODEL=deepseek-v4-pro[1m]
export CLAUDE_CODE_EFFORT_LEVEL=max
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=786432
Да, это Claude Code с подменённым бэкендом. В доках DeepSeek больше десятка страниц Agent Integrations [17] — Claude Code, Codex, OpenCode, OpenClaw, Hermes, Reasonix, Crush, Kilo Code, Pi и далее. Все чужие.
Интеграции и открытость — прекрасная стратегия распространения, но петлю обратной связи они не строят. Когда вашу модель гоняют в чужой обвязке, вы видите токены на входе и токены на выходе. Вы не видите, на каком шаге агент сломался, какой инструмент вернул мусор, где системный промпт увёл модель не туда и что пользователь молча переписал руками после. Всё, из чего собирается следующий посттрейн, остаётся у владельца харнесса — вместе с правом решать, каким промптом и с каким набором инструментов показывать вашу модель миру.
|
Лаба |
Харнесс |
Дебют |
Код |
Особенность |
|---|---|---|---|---|
|
Anthropic |
Claude Code [18] (+ Cowork) |
фев 2025 |
закрытый |
Задал шаблон категории; только Claude |
|
OpenAI |
Codex CLI [19] |
апр 2025 |
Apache-2.0 |
Rust, ОС-песочница, облачный агент, локальные модели |
|
|
июн 2025 / май 2026 |
Apache / закрытый |
Antigravity делит харнесс с десктопной платформой |
|
|
Microsoft / GitHub |
Copilot CLI [21] |
сен 2025, GA фев 2026 |
закрытый |
Мультимодельный: Anthropic, OpenAI, Google, MAI, открытый Kimi K2.7. Copilot SDK в GA с июня 2026 |
|
xAI |
Grok Build [22] |
май 2026 |
закрытый |
256K контекста, до 8 параллельных сабагентов в worktree |
|
Mistral |
Vibe [23] (2.0 в янв 2026) |
дек 2025 |
Apache-2.0 |
Work Mode + Code Mode, удалённые агенты, ACP |
|
Moonshot |
Kimi Code CLI [24] |
июн 2026 |
MIT |
Встроенные сабагенты coder/explore/plan, ACP |
|
Z.ai (Zhipu) |
ZCode |
июл 2026 |
десктопная IDE |
«Agentic Development Environment» под GLM-5.2, BYOK |
|
Alibaba |
Qwen Code, Qoder |
июл 2025 |
Apache-2.0 |
Форк Gemini CLI под открытые кодеры Qwen |
|
Amazon |
Kiro / Kiro CLI [25] |
2025 |
закрытый |
Бывший Amazon Q Developer CLI, spec-driven |
|
Tencent |
CodeBuddy Code |
сен 2025 |
закрытый |
Скиллы, plan mode, ACP, песочница |
|
Nous Research |
Hermes Agent |
фев 2026 |
открытый |
Отдельный разговор, см. раздел 6 |
|
Meta |
Muse Code [26] |
авг 2026 |
закрытый |
Мультиагентность по умолчанию, event log и |
|
DeepSeek |
DeepSeek Harness [27] |
авг 2026 |
MIT |
Всё плагин, Cordis, четыре режима |
Список короче, чем был ещё месяц назад:
MiniMax — модели сильные, официального CLI-харнесса нет. В июне под их аккаунтом висел вполне отчаянный тред: «kimi code есть, qwen code есть, glm есть — где minimax?»
Nvidia, Cohere, AI21, Reka, Sakana — модели есть, харнессов нет.
Perplexity, Thinking Machines, SSI — не их бизнес в принципе.
Тенденция читается однозначно: если у лабы есть кодинг-модель, через полгода у неё будет свой харнесс. Лучшее подтверждение — сама Meta. Ещё в июле она была главным примером «лаба без харнесса»: внутренние инструменты есть, наружу ничего. 5 августа вышел Muse Code, и пример закончился. За один квартал 2026 года своими харнессами обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek.
Отдельная категория — платформенные харнессы, где вендор продаёт обвязку, но модель не тренирует: Cursor CLI, Amp [28] (отделился от Sourcegraph в декабре 2025), Droid [29] (Factory), Junie [30] (JetBrains), Auggie [31] (Augment), Qoder. Почти все они принципиально мультимодельные — в этом их продажа.
Copilot я сознательно занёс в таблицу выше, а не сюда, хотя он тоже мультимодельный и живёт на платформе GitHub. Критерий простой: у Microsoft есть собственные модели MAI, и они — одна из опций в модельном пикере Copilot. Если считать иначе, придётся выкинуть из таблицы и Amazon с Kiro, который тоже роутит между Opus, MiniMax, DeepSeek и Qwen. Граница между «лабой» и «платформой» в 2026 году размылась до того, что провести её честно уже нельзя.
Здесь самое интересное, потому что открытые веса подешевели настолько, что связка «нормальный харнесс + GLM-5.2 [32] / DeepSeek V4 / Qwen3-Coder / Kimi K2.7» даёт околофронтирные результаты за долю подписочной цены.
|
Проект |
Лицензия |
Чем интересен |
|---|---|---|
|
OpenCode [33] |
MIT, ~182k★ |
Самый зазвёзженный агент на GitHub. 75+ провайдеров, клиент-сервер, TUI + десктоп + IDE |
|
Pi [34] |
MIT, ~67k★ |
Model-agnostic через вычитание: 4 инструмента, системный промпт короче 1000 токенов, MCP вынесен в SDK расширений |
|
oh-my-pi / Omp [35] |
MIT, ~16k★ |
Тот же Pi с обратным знаком: hash-anchored патчи, AST-переписывание, управление отладчиком по DAP, модель-надзиратель Advisor |
|
Goose [36] |
Apache-2.0, ~51k★ |
Единственный крупный агент под управлением фонда (AAIF при Linux Foundation). MCP-native, local-first |
|
Cline |
Apache-2.0, ~64k★ |
Вынес рантайм в отдельный открытый SDK — продукт превратился в инфраструктуру |
|
OpenHands [12] |
открытый, ~79k★ |
Контейнеризация всего, event-sourced replay в SDK |
|
Aider [37] |
Apache-2.0, ~47k★ |
Праотец. Гит-нативные атомарные коммиты, 100+ моделей через LiteLLM. Темп просел |
|
Kilo / Continue / Crush |
открытые |
500+ моделей / CI-first / лучший TUI в категории |
|
DeepSeek-Reasonix [38] |
MIT, ~26k★ |
Сторонний харнесс вокруг префикс-кэша DeepSeek: байт-стабильный контекст, отчётные 99.8% попаданий |
|
mini-SWE-agent [39] |
MIT |
Только bash, ни одного кастомного инструмента. На нём построен лидерборд Bash Only — стандарт для сравнения моделей между собой |
Отдельно стоит Omnigent от Databricks — мета-харнесс, который оркестрирует другие харнессы (Claude Code, Codex, Cursor, OpenCode, Hermes, Kiro, Pi) в одной сессии с общими политиками апрувов и трат.
Всё вышеперечисленное — про код. Но есть вторая ветка эволюции, где харнесс обслуживает не репозиторий, а жизнь пользователя. Две главные фигуры:
Проект Петера Штайнбергера [40] — австрийца, который до этого тринадцать лет в одиночку бутстрапил PSPDFKit, PDF-фреймворк для мобильных приложений. Dropbox, IBM, банки; в 2021 году — стратегическая инвестиция Insight Partners на €100 млн и выход из компании. Дальше выгорание и несколько лет практически без кода, пока в конце 2024-го он не сел за Claude Code.
OpenClaw появился в ноябре 2025-го (сначала под именем Clawdbot, потом Moltbot) и написан, по словам автора, за час — потому что он проголодался и захотел проверить своих агентов с кухни. Дальше случилось то, что случилось: самый зазвёзженный репозиторий на GitHub [41] меньше чем за пять месяцев (346k+ звёзд), 4.7 млн еженедельных загрузок, около полумиллиона машин по миру.
Суть — персональный ассистент, который живёт локально на вашей машине и общается с вами через мессенджеры, которыми вы и так пользуетесь: WhatsApp, Telegram. Не «чат с ИИ», а сущность, которая работает в фоне и пишет вам сама.
В феврале 2026 Штайнбергер ушёл в OpenAI [42] «строить следующее поколение персональных агентов». OpenClaw остался открытым и живёт в фонде, который OpenAI обещал поддерживать.
И вот главное, ради чего его стоит упомянуть в статье про харнессы. Штайнбергер публично сформулировал [43] урок, который дорого ему обошёлся:
«Бизнес-модель твоей зависимости — это твоя бизнес-модель».
Он оптимизировал свой харнесс под модели Anthropic. Потом Anthropic примерно за сутки предупредила об отключении подписок и выкатила собственного конкурирующего агента. Всё.
Это ровно тот сценарий, от которого страхуются и OpenCode, и Pi, и — теперь — DeepSeek, выкладывая свой харнесс под MIT. Открытость здесь не благотворительность, а стратегия: если ваша обвязка стала субстратом, на котором строят другие, вас нельзя выключить одним письмом.
(Заодно там же — поучительная история про безопасность: пресса объявила, что 20% скиллов OpenClaw вредоносные, реальная цифра оказалась 0.3%. Осадочек, впрочем, остался, и вопрос «что мы вообще пускаем к файловой системе» никуда не делся.)
Проект Nous Research [44] — и это как раз лаба, которая делает модели (линейка Hermes, которые они файнтьюнили из Llama), но при этом её харнесс принципиально model-agnostic. Работает с Nous Portal, OpenRouter, OpenAI и любым эндпоинтом.
Nous формулирует прямой архитектурный тезис — Harness Engineering: главный анлок 2026 года не в более умной модели, а в более умной обёртке вокруг неё. Отсюда пять слоёв, в которые они вкладываются: инструкции, ограничения, обратная связь, память, оркестрация. Модель при этом объявлена сменной деталью — сегодня фронтир, завтра локальная, послезавтра какая-нибудь ещё.
Что отличает Hermes от кодинг-агентов:
Самоулучшение. Он ведёт персистентную память своих успехов и провалов и генерирует из них переиспользуемые скиллы. Агент после месяца работы измеримо отличается от того, с которого вы начали. Слоган — «the agent that grows with you».
Каналы доставки. Терминал, нативное десктопное приложение под macOS/Windows/Linux, телеграм-бот, cron, вебхуки.
Пять бэкендов песочницы: local, Docker, SSH, Singularity, Modal — с харденингом контейнеров и изоляцией неймспейсов.
Programmatic Tool Calling через execute_code — та же идея, что и Code mode в DeepSeek Harness.
Скиллы для управления другими харнессами. Hermes умеет вызывать Claude Code, Codex CLI, OpenCode и OpenHands как сабагентов. Пожалуй, самый чистый способ скомпоновать несколько харнессов без написания клея.
Совместимость со стандартом скиллов agentskills.io.
По снимку OpenRouter от 10 мая Hermes был №1 по дневному потреблению токенов: 224 млрд в день против 186 млрд у OpenClaw. В июле Nous Research привлекала раунд [45] по оценке $1.5 млрд.
Мораль для темы статьи: харнесс перестал быть придатком модели настолько, что вокруг него оценивают компании в полтора миллиарда.
Несмотря на то, что формально основная идея всех подобных тулов улучшать жизнь и быть крутым персональным агентом, лично я не вижу в них большую ценность – в большинстве случаев задачи так или иначе требуют вашего внимания [46] и что OpenClaw, что Hermes Agent, несмотря на сумасшедшие оценки со стороны инвесторов – абсолютно все примеры использования сводятся к тому, что люди наколхозили себе ChatGPT на VPSке с доступом через телеграм. Если вы знаете какие-то хорошие примеры использования – пишите в коментариях.
На данный момент формируется два лагеря: первые — арчеры, которые бесконечно возяться со своим любимым harnessом и его бесконечными плагинами. Действительно ли это помогает с продуктивностью — сложно сказать. Второй, приверженцем которого является автор статьи, что в зависимости от того, какую модель вы используете, стоит подбирать соответсвующую обвязку. Раз в какое-то количество времени можно переезжать по желанию, но я думаю, что все еще стоит фокусироваться на том, что вы делаете и есть ли у этого выхлоп, а не на том, каким молотком вы пользуетесь.
Разбор самой модели я вынес отдельно — цифры V4-Pro-0813, цена за миллион токенов, агентные бенчмарки и то, чего в них не видно, лежат у меня в телеграме [47]. Там же всё остальное про локальный инференс и агентную возню, чипы и иногда про науку.
Ссылки: deepseek.com/harness [1] · github.com/deepseek-ai/deepseek-harness [27] · github.com/topics/dsh-plugin [48]
Все бенчмарки в статье, где не указано иное, — вендорские. Звёзды и версии — на середину августа 2026.
Автор: danyathewriter
Источник [49]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/34387
URLs in this post:
[1] DeepSeek Harness v0.1: https://www.deepseek.com/harness/en/
[2] mini-SWE-agent: https://github.com/SWE-agent/mini-swe-agent
[3] отдельный лидерборд Bash Only: https://www.swebench.com/
[4] Февральский прогон 2026 года: https://simonwillison.net/2026/Feb/19/swe-bench/
[5] Live-SWE-agent: https://arxiv.org/abs/2511.13646
[6] Память: http://www.braintools.ru/article/4140
[7] Terminal-Bench 2.x: https://www.tbench.ai/leaderboard/terminal-bench/2.0
[8] чейнджлоге от 31 июля: https://api-docs.deepseek.com/updates/
[9] Cordis: https://github.com/cordiverse/cordis
[10] ошибка: http://www.braintools.ru/article/4192
[11] «Code as Agent Harness»: https://arxiv.org/abs/2605.18747
[12] OpenHands: https://docs.openhands.dev/sdk
[13] README: https://github.com/deepseek-ai/deepseek-harness/blob/master/README.md
[14] постороннего разработчика: https://github.com/HenryZ838978/deepseek-harness
[15] Обучение: http://www.braintools.ru/article/5125
[16] Логика: http://www.braintools.ru/article/7640
[17] Agent Integrations: https://api-docs.deepseek.com/quick_start/agent_integrations/claude_code/
[18] Claude Code: https://claude.com/pricing
[19] Codex CLI: https://developers.openai.com/codex/changelog
[20] Gemini CLI → Antigravity CLI: https://developers.googleblog.com/an-important-update-transitioning-gemini-cli-to-antigravity-cli/
[21] Copilot CLI: https://docs.github.com/copilot/concepts/agents/about-copilot-cli
[22] Grok Build: https://x.ai/news/grok-build-cli
[23] Vibe: https://mistral.ai/news/vibe-agent/
[24] Kimi Code CLI: https://github.com/MoonshotAI/kimi-code
[25] Kiro / Kiro CLI: https://kiro.dev/cli
[26] Muse Code: https://dev.meta.ai/docs/muse-code
[27] DeepSeek Harness: https://github.com/deepseek-ai/deepseek-harness
[28] Amp: https://sourcegraph.com/blog/why-sourcegraph-and-amp-are-becoming-independent-companies
[29] Droid: https://factory.ai/news/terminal-bench
[30] Junie: https://blog.jetbrains.com/junie/2026/06/junie-coding-agent-out-of-beta/
[31] Auggie: https://www.augmentcode.com/product/cli
[32] GLM-5.2: https://venturebeat.com/technology/z-ais-open-weights-glm-5-2-beats-gpt-5-5-on-multiple-long-horizon-coding-benchmarks-for-1-6th-the-cost
[33] OpenCode: https://opencode.ai/docs/
[34] Pi: https://mariozechner.at/posts/2025-11-30-pi-coding-agent/
[35] oh-my-pi / Omp: https://omp.sh/
[36] Goose: https://goose-docs.ai/blog/2026/04/07/goose-moves-to-aaif/
[37] Aider: https://github.com/Aider-AI/aider
[38] DeepSeek-Reasonix: https://github.com/esengine/deepseek-reasonix
[39] mini-SWE-agent: https://mini-swe-agent.com/latest/
[40] Петера Штайнбергера: https://en.wikipedia.org/wiki/Peter_Steinberger_%28programmer%29
[41] самый зазвёзженный репозиторий на GitHub: https://openclaw.ai/
[42] ушёл в OpenAI: https://techcrunch.com/2026/02/15/openclaw-creator-peter-steinberger-joins-openai/
[43] публично сформулировал: https://finance.biggo.com/news/041c532266006d72
[44] Nous Research: https://hermes-agent.nousresearch.com/
[45] привлекала раунд: https://techcrunch.com/2026/07/13/hermes-agent-maker-nous-research-in-talks-for-new-funding-at-1-5b-valuation/
[46] внимания: http://www.braintools.ru/article/7595
[47] лежат у меня в телеграме: https://t.me/techn0danya
[48] github.com/topics/dsh-plugin: https://github.com/topics/dsh-plugin
[49] Источник: https://habr.com/ru/articles/1070296/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1070296
Нажмите здесь для печати.