Что такое Harness и с какими моделями его едят?. claude code.. claude code. deepseek.. claude code. deepseek. DeepSeek Harness.. claude code. deepseek. DeepSeek Harness. llm.. claude code. deepseek. DeepSeek Harness. llm. mcp.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source. swe-bench.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source. swe-bench. агентные харнессы.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source. swe-bench. агентные харнессы. ии-агенты.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source. swe-bench. агентные харнессы. ии-агенты. искусственный интеллект.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source. swe-bench. агентные харнессы. ии-агенты. искусственный интеллект. кодинг-агенты.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source. swe-bench. агентные харнессы. ии-агенты. искусственный интеллект. кодинг-агенты. Машинное обучение.. claude code. deepseek. DeepSeek Harness. llm. mcp. Open source. swe-bench. агентные харнессы. ии-агенты. искусственный интеллект. кодинг-агенты. Машинное обучение. Программирование.
Как выглядит среднестатистический владелец китайской лабы сейчас

Как выглядит среднестатистический владелец китайской лабы сейчас

Сегодня, 13 августа DeepSeek выложил DeepSeek Harness v0.1 в Developer Preview. Открытый код, MIT, пакет @deepseek-ai/dsh в npm, запуск в одну строку:

npx @deepseek-ai/dsh web

Веб-морда поднимается на 127.0.0.1:3080. Главный философский тезис DeepSeek относительно обвязок — everything is a plugin: модели, инструменты, скиллы, сессии, песочницы, файловые системы, главный цикл агента, оркестрация и даже интерфейс реализованы плагинами и меняются конфигом, без правки исходников.

Само по себе это ещё один агент в очень плотной поляне — на июль 2026 в живых числилось около 35 активно поддерживаемых CLI-агентов. Интереснее не сам факт релиза, а то, во что он попал.

Считайте сами. 5 августа Meta выкатила Muse Code — свой первый терминальный агент, и тем самым перестала быть главным примером «большая лаба без харнесса». 12 августа DeepSeek тихо обновила флагман до V4-Pro-0813, и её главную агентную цифру — 87.9 на Terminal-Bench 2.1 — мерили ровно тем харнессом, который откроют на следующий день. 13 августа, то есть сегодня, харнесс открыли.

Две лабы за неделю, инструмент измерения и объект измерения с разницей в сутки. А если растянуть окно до квартала, картина совсем плотная: своими харнессами за это время обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek. Категория, которой два года назад не существовало, консолидируется прямо сейчас.

Хороший повод разложить её целиком: что такое харнесс и почему за него дерутся, у каких лаб он уже есть, у каких ещё нет, и что происходит в лагере тех, кто принципиально не привязан ни к одной модели.


1. Что такое вообще это ваш харнесс?

Скриншот с сайта DeepSeek

Скриншот с сайта DeepSeek

Модель — это, если уж очень грубо говоря, функция «текст → текст». Она не умеет читать ваш репозиторий, звать ripgrep, запускать тесты, разбирать чужой стектрейс, откатываться после падения и продолжать работу на сороковом шаге. Всё это делает обвязка: агентный цикл, набор инструментов, системные промпты, права доступа, компакция контекста, сабагенты, песочница, логирование.

Данные с AutoBench Agentic

Данные с AutoBench Agentic

Ключевое следствие, которое стоит держать в голове каждый раз, когда вы смотрите на таблицу бенчмарков:

Цифра на агентном бенчмарке — это результат связки модель+харнесс, а не свойство модели.

Отсюда возникает практическая проблема: как тогда честно сравнивать модели между собой?

Индустрия решает её одинаково — берёт нарочно примитивную обвязку, одинаковую для всех, и меряет в ней. Канонический пример — mini-SWE-agent от команды SWE-bench: один-единственный инструмент bash, никаких кастомных инструментов, линейная история сообщений, каждое действие через subprocess.run. Команда SWE-bench завела под него отдельный лидерборд Bash Only и описывает его прямым текстом — «дефолтный вид Verified: каждая модель в одном и том же окружении mini-SWE-agent».

Февральский прогон 2026 года: Claude 4.5 Opus — 74.4%, Gemini 3 Pro Preview — 74.2%, GPT-5.2 (high) — 71.8%, Claude 4.5 Sonnet — 70.6%. Для сравнения, в июле 2025 года mini-SWE-agent на том же бенчмарке выдавал 65%. Обвязка за это время принципиально не менялась — вырос слой моделей.

А сколько добавляет полноценная обвязка? Есть прямое измерение: работа Live-SWE-agent сравнивает mini с самоэволюционирующим агентом на одних и тех же моделях. Gemini 3 Pro: 74.2 → 77.4. Claude 4.5 Sonnet: 70.6 → 75.4. GPT-5: 65.0 → 68.4. То есть порядка 3–5 процентных пунктов.

Тут нужны две оговорки, и они работают в разные стороны. Во-первых, Bash Only использует одинаковый системный промпт для всех моделей — это делает сравнение моделей честным, но означает, что качество харнессов там в принципе не измеряется; лидерборд сконструирован, чтобы убрать переменную обвязки, а не доказать её незначимость. Во-вторых, SWE-bench Verified — это короткая задача внутри одного репозитория, то есть ровно тот режим, где харнесс нужен меньше всего. Память между сессиями, компакция контекста, сабагенты, восстановление после сбоя на сороковом шаге — ничего из этого туда не помещается. Именно поэтому индустрия переехала на Terminal-Bench 2.x, где горизонт длиннее и разброс от обвязки заметно больше.

Причём здесь DeepSeek

А при том, что minimal mode в DeepSeek Harness — это ровно тот же приём. Два инструмента, персистентный bash и str_replace_editor, и ничего больше. Не урезанная версия для бедных, а измерительный прибор: режим, в котором лаба меряет собственную модель, минимизируя вклад обвязки.

И вот здесь была проблема. В чейнджлоге от 31 июля под таблицей агентных бенчмарков V4-Flash висела сноска: Terminal-Bench 2.1 = 82.7 получено «на DeepSeek Harness minimal mode (to be released soon)», max effort, top_p=0.95, temperature=1.0.

Прибор был только у одной стороны. Полтора месяца цифру нельзя было воспроизвести — сэмплинг опубликован, а вторая половина конфигурации недоступна снаружи. Любая цифра, полученная на публичном харнессе, измеряла другую систему, и разрыв нельзя было разложить на «модель слабее заявленного» и «ваша обвязка хуже нашей».

Дальше — хронология одной недели. 12 августа выходит V4-Pro-0813 с Terminal-Bench 2.1 = 87.9 против 72.1 у апрельского превью. 13 августа открывается харнесс, включая тот самый minimal mode. Порядок событий говорит сам за себя: сначала цифра, потом инструмент для её проверки.


Фото из офиса Meta

Фото из офиса Meta

2. Анатомия DeepSeek Harness

Самое неожиданное — фундамент. Ядро DeepSeek Harness — Cordis, IoC-микроядро с dependency injection и обратимыми побочными эффектами, родом из экосистемы Koishi (китайский фреймворк для чат-ботов). Суть Cordis: всё, что регистрирует плагин, отслеживается и откатывается при выгрузке. Отсюда честный hot reload без утечек и без ручной уборки. Под архитектуру «всё плагин» выбор логичный, хоть и неочевидный.

Код — Node.js/TypeScript-монорепа на pnpm. Валидация схем — на самописном schemastery вместо более популярного zod, ради консистентности со стеком Cordis.

Четыре режима работы

Режим

Что это

Standard

Полный агент: правка файлов, шелл, поиск по файлам и вебу, скиллы, планирование, цели, сабагенты, воркфлоу

Code

Инструменты выставлены через Code Mode SDK, и модель пишет одну TypeScript-программу, оркестрирующую многошаговые операции

Minimal

Ровно два инструмента: персистентный bash и str_replace_editor. Тот самый режим для бенчмарков

Creator

Сборка собственных пресетов: интроспекция рантайма, тесты плагинов в памяти, гайд по авторингу

Code mode заслуживает отдельного абзаца — и объяснения, потому что идея неочевидная.

В обычном режиме инструменты отдаются модели списком функций, которые она вызывает по одной. Модель формулирует вызов, харнесс исполняет, результат целиком возвращается в контекст, модель читает его и решает, что делать дальше. Один инструмент — один круг.

В Code mode те же инструменты выставляются как SDK: набор типизированных функций, доступных из TypeScript. Модель пишет не вызов, а программу. Харнесс исполняет её в песочнице целиком, и обратно в контекст возвращается только то, что программа напечатала.

Разница видна на задаче вроде «найди все места, где импортируется устаревший модуль, и проверь, где он реально используется». Классический цикл: grep возвращает сорок путей — все сорок падают в контекст. Дальше сорок чтений файлов — ещё сорок результатов в контекст. Модель на каждом шаге перечитывает всю эту простыню заново.

В Code mode модель пишет примерно следующее (схематично, имена функций условные):

const files = await grep("import legacy_parser");
const hits = [];
for (const f of files) {
  const src = await read(f);
  if (/legacy_parser.w+(/.test(src)) hits.push(f);
}
print(hits);   // в контекст вернутся только эти три пути

Сорок промежуточных результатов остались переменными внутри программы и до модели не доехали. В контекст пришли три строки вместо восьмидесяти простыней.

Плата за это — модель должна написать корректный код с первого раза. Если в программе ошибка, цикл отладки длиннее, чем при обычном вызове инструмента: падает вся программа, а не один шаг.

Это не изобретение DeepSeek — идея витает в воздухе. Nous Research называет то же самое Programmatic Tool Calling через execute_code, есть препринт с прямолинейным названием «Code as Agent Harness». Но в лабовом харнессе первого уровня это одна из первых полноценных реализаций.

Profile и Preset: два уровня конфигурации

Настройки в DeepSeek Harness разложены на два независимых слоя — процесс и агент.

Profile определяет, как живёт процесс целиком: web или headless, какие бандлы установлены. По сути это упорядоченный слой патчей cordis.patch.yml.

Agent Preset определяет, что видит конкретный агент в конкретной сессии: инструменты, промпты, скиллы, сабагентов, воркфлоу. Скоуп резолвится по цепочке agent → preset → global.

Практический смысл: в одном процессе одновременно живут агент-писатель, агент-кодер и агент-ресёрчер с разными наборами инструментов и инструкций. Не нужно поднимать четыре сервиса.

Трассируемость

Здесь, на мой взгляд, самая недооценённая часть релиза. Принцип формулируется как «видимое модели ⇔ записанное»: всё, что попадает модели на вход, пишется в append-only лог сессии — системные промпты, ризонинг, определения инструментов, вызовы и их результаты, планирование сабагентов, каждая инъекция контекста, реально использованная модель. В Trajectory view это разбирается по источникам.

Resume, fork, поиск и replay работают поверх одного и того же потока событий. Кто хоть раз пытался понять, почему агент на тридцатом шаге решил снести тесты, — тот оценит.

Похожий подход есть у OpenHands — детерминированный replay в SDK. Но интереснее другое: ровно ту же идею за неделю до DeepSeek выкатила Meta. В Muse Code каждая правка файла, вызов инструмента и решение агента пишутся в event log, а команда muse replay проходит сессию по шагам — мотивируют это compliance-сценариями вроде SOC 2 и HIPAA.

Две лабы независимо и почти одновременно пришли к одному решению. Это значит, что replay поверх потока событий перестаёт быть отличительной фишкой и превращается в ожидаемую часть категории — примерно как plan mode год назад.

Безопасность и оговорки

Песочница строится на нативных механизмах ОС, MCP поддерживается, OpenAI-совместимые эндпоинты тоже. Ключи лежат в $DSH_HOME/.credentials.yaml, конфиг ссылается только на имена креденшелов, в лог сессии они не попадают.

Две оговорки:

⚠️ Это v0.1 developer preview, и предупреждение стоит в README капслоком: «THERE WILL BE COMPATIBILITY-BREAKING CHANGES». На лендинге формулировка вежливее — основные плагины и API продолжат развиваться, — но смысл тот же.

Конкретных примеров поломок пока нет: проекту один день. Зато по архитектуре понятно, где рванёт первым, и это ровно то, ради чего DeepSeek Harness и берут. Всё, что вы напишете поверх плагинного API, разложите по слоям cordis.patch.yml или завяжете на цепочку скоупов agent → preset → global, держится на контрактах, которые автор прямым текстом обещает ломать. Писать плагин под dsh сегодня — это не «поставил и забыл», а подписка на чужой рефакторинг.

И небольшое by the way для тех, кто пойдёт ставить прямо сейчас. В PyPI с мая лежит пакет deepseek-harness от постороннего разработчика, и он тоже заводит команду dsh. Проект сам по себе честный, появился на три месяца раньше и к сегодняшнему релизу отношения не имеет — просто совпали имена. Но шума вокруг темы в ближайшие недели будет много, а совпадающее имя команды — идеальная почва для тайпсквоттинга. Простое правило: официальное ставится из npm и живёт в организации deepseek-ai. Если инструкция предлагает pip install — это не то.


Действительно зачем?

Действительно зачем?

3. Зачем лабе свой харнесс: четыре причины

Бенчмарки. Пока вашу модель гоняют в чужой обвязке, заточенной под чужую модель, вы выглядите хуже, чем есть. Свой харнесс — это контроль над цифрой в анонсе и, если он открыт, возможность её воспроизвести.

Обучение. Харнесс — это среда. При RL на агентных задачах вам нужен свой цикл, свои инструменты, своё определение шага. Ко-тренировка модели вместе с обвязкой — ровно то, чем объясняют силу связки Claude + Claude Code.

Деньги. Модель продаётся токенами, харнесс продаётся подпиской — а подписка предсказуемее и маржинальнее. Рынок это считал мгновенно: в треде под анонсом в X читатели тут же начали требовать кодинг-тариф в духе «харнесс есть, модель есть, компьюта хватает — где подписка?». Логика прозрачная: своего coding plan у DeepSeek до сих пор нет, а харнесс — ровно та деталь, без которой его не продать.

Контроль над точкой входа. Харнесс — это место, где пользователь на самом деле живёт: там он ставит задачу, там смотрит результат, там ругается. У DeepSeek такого места не было. До вчерашнего дня официальный ответ на вопрос «как запустить это агентом» звучал так:

export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<key>
export ANTHROPIC_MODEL=deepseek-v4-pro[1m]
export CLAUDE_CODE_EFFORT_LEVEL=max
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=786432

Да, это Claude Code с подменённым бэкендом. В доках DeepSeek больше десятка страниц Agent Integrations — Claude Code, Codex, OpenCode, OpenClaw, Hermes, Reasonix, Crush, Kilo Code, Pi и далее. Все чужие.

Интеграции и открытость — прекрасная стратегия распространения, но петлю обратной связи они не строят. Когда вашу модель гоняют в чужой обвязке, вы видите токены на входе и токены на выходе. Вы не видите, на каком шаге агент сломался, какой инструмент вернул мусор, где системный промпт увёл модель не туда и что пользователь молча переписал руками после. Всё, из чего собирается следующий посттрейн, остаётся у владельца харнесса — вместе с правом решать, каким промптом и с каким набором инструментов показывать вашу модель миру.


Молоток – универсальный инструмент для проведения различных видов ручных работ

Молоток – универсальный инструмент для проведения различных видов ручных работ

4. Лабы, у которых свой харнесс уже есть

Лаба

Харнесс

Дебют

Код

Особенность

Anthropic

Claude Code (+ Cowork)

фев 2025

закрытый

Задал шаблон категории; только Claude

OpenAI

Codex CLI

апр 2025

Apache-2.0

Rust, ОС-песочница, облачный агент, локальные модели

Google

Gemini CLI → Antigravity CLI

июн 2025 / май 2026

Apache / закрытый

Antigravity делит харнесс с десктопной платформой

Microsoft / GitHub

Copilot CLI

сен 2025, GA фев 2026

закрытый

Мультимодельный: Anthropic, OpenAI, Google, MAI, открытый Kimi K2.7. Copilot SDK в GA с июня 2026

xAI

Grok Build

май 2026

закрытый

256K контекста, до 8 параллельных сабагентов в worktree

Mistral

Vibe (2.0 в янв 2026)

дек 2025

Apache-2.0

Work Mode + Code Mode, удалённые агенты, ACP

Moonshot

Kimi Code CLI

июн 2026

MIT

Встроенные сабагенты coder/explore/plan, ACP

Z.ai (Zhipu)

ZCode

июл 2026

десктопная IDE

«Agentic Development Environment» под GLM-5.2, BYOK

Alibaba

Qwen Code, Qoder

июл 2025

Apache-2.0

Форк Gemini CLI под открытые кодеры Qwen

Amazon

Kiro / Kiro CLI

2025

закрытый

Бывший Amazon Q Developer CLI, spec-driven

Tencent

CodeBuddy Code

сен 2025

закрытый

Скиллы, plan mode, ACP, песочница

Nous Research

Hermes Agent

фев 2026

открытый

Отдельный разговор, см. раздел 6

Meta

Muse Code

авг 2026

закрытый

Мультиагентность по умолчанию, event log и muse replay, ко-тренирован с Muse Spark 1.2

DeepSeek

DeepSeek Harness

авг 2026

MIT

Всё плагин, Cordis, четыре режима

5. Кто до сих пор без

AI b2b SaaS 6-7 стартапер

AI b2b SaaS 6-7 стартапер

Список короче, чем был ещё месяц назад:

  • MiniMax — модели сильные, официального CLI-харнесса нет. В июне под их аккаунтом висел вполне отчаянный тред: «kimi code есть, qwen code есть, glm есть — где minimax?»

  • Nvidia, Cohere, AI21, Reka, Sakana — модели есть, харнессов нет.

  • Perplexity, Thinking Machines, SSI — не их бизнес в принципе.

Тенденция читается однозначно: если у лабы есть кодинг-модель, через полгода у неё будет свой харнесс. Лучшее подтверждение — сама Meta. Ещё в июле она была главным примером «лаба без харнесса»: внутренние инструменты есть, наружу ничего. 5 августа вышел Muse Code, и пример закончился. За один квартал 2026 года своими харнессами обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek.

Отдельная категория — платформенные харнессы, где вендор продаёт обвязку, но модель не тренирует: Cursor CLI, Amp (отделился от Sourcegraph в декабре 2025), Droid (Factory), Junie (JetBrains), Auggie (Augment), Qoder. Почти все они принципиально мультимодельные — в этом их продажа.

Copilot я сознательно занёс в таблицу выше, а не сюда, хотя он тоже мультимодельный и живёт на платформе GitHub. Критерий простой: у Microsoft есть собственные модели MAI, и они — одна из опций в модельном пикере Copilot. Если считать иначе, придётся выкинуть из таблицы и Amazon с Kiro, который тоже роутит между Opus, MiniMax, DeepSeek и Qwen. Граница между «лабой» и «платформой» в 2026 году размылась до того, что провести её честно уже нельзя.


Интерфейс OpenCode

Интерфейс OpenCode

6. Model-agnostic лагерь

Здесь самое интересное, потому что открытые веса подешевели настолько, что связка «нормальный харнесс + GLM-5.2 / DeepSeek V4 / Qwen3-Coder / Kimi K2.7» даёт околофронтирные результаты за долю подписочной цены.

Проект

Лицензия

Чем интересен

OpenCode

MIT, ~182k★

Самый зазвёзженный агент на GitHub. 75+ провайдеров, клиент-сервер, TUI + десктоп + IDE

Pi

MIT, ~67k★

Model-agnostic через вычитание: 4 инструмента, системный промпт короче 1000 токенов, MCP вынесен в SDK расширений

oh-my-pi / Omp

MIT, ~16k★

Тот же Pi с обратным знаком: hash-anchored патчи, AST-переписывание, управление отладчиком по DAP, модель-надзиратель Advisor

Goose

Apache-2.0, ~51k★

Единственный крупный агент под управлением фонда (AAIF при Linux Foundation). MCP-native, local-first

Cline

Apache-2.0, ~64k★

Вынес рантайм в отдельный открытый SDK — продукт превратился в инфраструктуру

OpenHands

открытый, ~79k★

Контейнеризация всего, event-sourced replay в SDK

Aider

Apache-2.0, ~47k★

Праотец. Гит-нативные атомарные коммиты, 100+ моделей через LiteLLM. Темп просел

Kilo / Continue / Crush

открытые

500+ моделей / CI-first / лучший TUI в категории

DeepSeek-Reasonix

MIT, ~26k★

Сторонний харнесс вокруг префикс-кэша DeepSeek: байт-стабильный контекст, отчётные 99.8% попаданий

mini-SWE-agent

MIT

Только bash, ни одного кастомного инструмента. На нём построен лидерборд Bash Only — стандарт для сравнения моделей между собой

Отдельно стоит Omnigent от Databricks — мета-харнесс, который оркестрирует другие харнессы (Claude Code, Codex, Cursor, OpenCode, Hermes, Kiro, Pi) в одной сессии с общими политиками апрувов и трат.


OpenClaw или что-то типа того

OpenClaw или что-то типа того

7. Персональные агенты: другой класс, та же архитектура

Всё вышеперечисленное — про код. Но есть вторая ветка эволюции, где харнесс обслуживает не репозиторий, а жизнь пользователя. Две главные фигуры:

OpenClaw

Проект Петера Штайнбергера — австрийца, который до этого тринадцать лет в одиночку бутстрапил PSPDFKit, PDF-фреймворк для мобильных приложений. Dropbox, IBM, банки; в 2021 году — стратегическая инвестиция Insight Partners на €100 млн и выход из компании. Дальше выгорание и несколько лет практически без кода, пока в конце 2024-го он не сел за Claude Code.

OpenClaw появился в ноябре 2025-го (сначала под именем Clawdbot, потом Moltbot) и написан, по словам автора, за час — потому что он проголодался и захотел проверить своих агентов с кухни. Дальше случилось то, что случилось: самый зазвёзженный репозиторий на GitHub меньше чем за пять месяцев (346k+ звёзд), 4.7 млн еженедельных загрузок, около полумиллиона машин по миру.

Суть — персональный ассистент, который живёт локально на вашей машине и общается с вами через мессенджеры, которыми вы и так пользуетесь: WhatsApp, Telegram. Не «чат с ИИ», а сущность, которая работает в фоне и пишет вам сама.

В феврале 2026 Штайнбергер ушёл в OpenAI «строить следующее поколение персональных агентов». OpenClaw остался открытым и живёт в фонде, который OpenAI обещал поддерживать.

И вот главное, ради чего его стоит упомянуть в статье про харнессы. Штайнбергер публично сформулировал урок, который дорого ему обошёлся:

«Бизнес-модель твоей зависимости — это твоя бизнес-модель».

Он оптимизировал свой харнесс под модели Anthropic. Потом Anthropic примерно за сутки предупредила об отключении подписок и выкатила собственного конкурирующего агента. Всё.

Это ровно тот сценарий, от которого страхуются и OpenCode, и Pi, и — теперь — DeepSeek, выкладывая свой харнесс под MIT. Открытость здесь не благотворительность, а стратегия: если ваша обвязка стала субстратом, на котором строят другие, вас нельзя выключить одним письмом.

(Заодно там же — поучительная история про безопасность: пресса объявила, что 20% скиллов OpenClaw вредоносные, реальная цифра оказалась 0.3%. Осадочек, впрочем, остался, и вопрос «что мы вообще пускаем к файловой системе» никуда не делся.)

Hermes Agent

Проект Nous Research — и это как раз лаба, которая делает модели (линейка Hermes, которые они файнтьюнили из Llama), но при этом её харнесс принципиально model-agnostic. Работает с Nous Portal, OpenRouter, OpenAI и любым эндпоинтом.

Nous формулирует прямой архитектурный тезис — Harness Engineering: главный анлок 2026 года не в более умной модели, а в более умной обёртке вокруг неё. Отсюда пять слоёв, в которые они вкладываются: инструкции, ограничения, обратная связь, память, оркестрация. Модель при этом объявлена сменной деталью — сегодня фронтир, завтра локальная, послезавтра какая-нибудь ещё.

Что отличает Hermes от кодинг-агентов:

  • Самоулучшение. Он ведёт персистентную память своих успехов и провалов и генерирует из них переиспользуемые скиллы. Агент после месяца работы измеримо отличается от того, с которого вы начали. Слоган — «the agent that grows with you».

  • Каналы доставки. Терминал, нативное десктопное приложение под macOS/Windows/Linux, телеграм-бот, cron, вебхуки.

  • Пять бэкендов песочницы: local, Docker, SSH, Singularity, Modal — с харденингом контейнеров и изоляцией неймспейсов.

  • Programmatic Tool Calling через execute_code — та же идея, что и Code mode в DeepSeek Harness.

  • Скиллы для управления другими харнессами. Hermes умеет вызывать Claude Code, Codex CLI, OpenCode и OpenHands как сабагентов. Пожалуй, самый чистый способ скомпоновать несколько харнессов без написания клея.

  • Совместимость со стандартом скиллов agentskills.io.

По снимку OpenRouter от 10 мая Hermes был №1 по дневному потреблению токенов: 224 млрд в день против 186 млрд у OpenClaw. В июле Nous Research привлекала раунд по оценке $1.5 млрд.

Мораль для темы статьи: харнесс перестал быть придатком модели настолько, что вокруг него оценивают компании в полтора миллиарда.

Можно, а зачем?

Несмотря на то, что формально основная идея всех подобных тулов улучшать жизнь и быть крутым персональным агентом, лично я не вижу в них большую ценность – в большинстве случаев задачи так или иначе требуют вашего внимания и что OpenClaw, что Hermes Agent, несмотря на сумасшедшие оценки со стороны инвесторов – абсолютно все примеры использования сводятся к тому, что люди наколхозили себе ChatGPT на VPSке с доступом через телеграм. Если вы знаете какие-то хорошие примеры использования – пишите в коментариях.


Ответ на вопрос пишите в комментариях

Ответ на вопрос пишите в комментариях

8. Что со всем этим делать

На данный момент формируется два лагеря: первые — арчеры, которые бесконечно возяться со своим любимым harnessом и его бесконечными плагинами. Действительно ли это помогает с продуктивностью — сложно сказать. Второй, приверженцем которого является автор статьи, что в зависимости от того, какую модель вы используете, стоит подбирать соответсвующую обвязку. Раз в какое-то количество времени можно переезжать по желанию, но я думаю, что все еще стоит фокусироваться на том, что вы делаете и есть ли у этого выхлоп, а не на том, каким молотком вы пользуетесь.


Разбор самой модели я вынес отдельно — цифры V4-Pro-0813, цена за миллион токенов, агентные бенчмарки и то, чего в них не видно, лежат у меня в телеграме. Там же всё остальное про локальный инференс и агентную возню, чипы и иногда про науку.

Ссылки: deepseek.com/harness · github.com/deepseek-ai/deepseek-harness · github.com/topics/dsh-plugin

Все бенчмарки в статье, где не указано иное, — вендорские. Звёзды и версии — на середину августа 2026.

Автор: danyathewriter

Источник