- BrainTools - https://www.braintools.ru -

Что такое Harness и с какими моделями его едят?

Как выглядит среднестатистический владелец китайской лабы сейчас

Как выглядит среднестатистический владелец китайской лабы сейчас

Сегодня, 13 августа DeepSeek выложил DeepSeek Harness v0.1 [1] в Developer Preview. Открытый код, MIT, пакет @deepseek-ai/dsh в npm, запуск в одну строку:

npx @deepseek-ai/dsh web

Веб-морда поднимается на 127.0.0.1:3080. Главный философский тезис DeepSeek относительно обвязок — everything is a plugin: модели, инструменты, скиллы, сессии, песочницы, файловые системы, главный цикл агента, оркестрация и даже интерфейс реализованы плагинами и меняются конфигом, без правки исходников.

Само по себе это ещё один агент в очень плотной поляне — на июль 2026 в живых числилось около 35 активно поддерживаемых CLI-агентов. Интереснее не сам факт релиза, а то, во что он попал.

Считайте сами. 5 августа Meta выкатила Muse Code — свой первый терминальный агент, и тем самым перестала быть главным примером «большая лаба без харнесса». 12 августа DeepSeek тихо обновила флагман до V4-Pro-0813, и её главную агентную цифру — 87.9 на Terminal-Bench 2.1 — мерили ровно тем харнессом, который откроют на следующий день. 13 августа, то есть сегодня, харнесс открыли.

Две лабы за неделю, инструмент измерения и объект измерения с разницей в сутки. А если растянуть окно до квартала, картина совсем плотная: своими харнессами за это время обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek. Категория, которой два года назад не существовало, консолидируется прямо сейчас.

Хороший повод разложить её целиком: что такое харнесс и почему за него дерутся, у каких лаб он уже есть, у каких ещё нет, и что происходит в лагере тех, кто принципиально не привязан ни к одной модели.


1. Что такое вообще это ваш харнесс?

Скриншот с сайта DeepSeek

Скриншот с сайта DeepSeek

Модель — это, если уж очень грубо говоря, функция «текст → текст». Она не умеет читать ваш репозиторий, звать ripgrep, запускать тесты, разбирать чужой стектрейс, откатываться после падения и продолжать работу на сороковом шаге. Всё это делает обвязка: агентный цикл, набор инструментов, системные промпты, права доступа, компакция контекста, сабагенты, песочница, логирование.

Данные с AutoBench Agentic

Данные с AutoBench Agentic

Ключевое следствие, которое стоит держать в голове каждый раз, когда вы смотрите на таблицу бенчмарков:

Цифра на агентном бенчмарке — это результат связки модель+харнесс, а не свойство модели.

Отсюда возникает практическая проблема: как тогда честно сравнивать модели между собой?

Индустрия решает её одинаково — берёт нарочно примитивную обвязку, одинаковую для всех, и меряет в ней. Канонический пример — mini-SWE-agent [2] от команды SWE-bench: один-единственный инструмент bash, никаких кастомных инструментов, линейная история сообщений, каждое действие через subprocess.run. Команда SWE-bench завела под него отдельный лидерборд Bash Only [3] и описывает его прямым текстом — «дефолтный вид Verified: каждая модель в одном и том же окружении mini-SWE-agent».

Февральский прогон 2026 года [4]: Claude 4.5 Opus — 74.4%, Gemini 3 Pro Preview — 74.2%, GPT-5.2 (high) — 71.8%, Claude 4.5 Sonnet — 70.6%. Для сравнения, в июле 2025 года mini-SWE-agent на том же бенчмарке выдавал 65%. Обвязка за это время принципиально не менялась — вырос слой моделей.

А сколько добавляет полноценная обвязка? Есть прямое измерение: работа Live-SWE-agent [5] сравнивает mini с самоэволюционирующим агентом на одних и тех же моделях. Gemini 3 Pro: 74.2 → 77.4. Claude 4.5 Sonnet: 70.6 → 75.4. GPT-5: 65.0 → 68.4. То есть порядка 3–5 процентных пунктов.

Тут нужны две оговорки, и они работают в разные стороны. Во-первых, Bash Only использует одинаковый системный промпт для всех моделей — это делает сравнение моделей честным, но означает, что качество харнессов там в принципе не измеряется; лидерборд сконструирован, чтобы убрать переменную обвязки, а не доказать её незначимость. Во-вторых, SWE-bench Verified — это короткая задача внутри одного репозитория, то есть ровно тот режим, где харнесс нужен меньше всего. Память [6] между сессиями, компакция контекста, сабагенты, восстановление после сбоя на сороковом шаге — ничего из этого туда не помещается. Именно поэтому индустрия переехала на Terminal-Bench 2.x [7], где горизонт длиннее и разброс от обвязки заметно больше.

Причём здесь DeepSeek

А при том, что minimal mode в DeepSeek Harness — это ровно тот же приём. Два инструмента, персистентный bash и str_replace_editor, и ничего больше. Не урезанная версия для бедных, а измерительный прибор: режим, в котором лаба меряет собственную модель, минимизируя вклад обвязки.

И вот здесь была проблема. В чейнджлоге от 31 июля [8] под таблицей агентных бенчмарков V4-Flash висела сноска: Terminal-Bench 2.1 = 82.7 получено «на DeepSeek Harness minimal mode (to be released soon)», max effort, top_p=0.95, temperature=1.0.

Прибор был только у одной стороны. Полтора месяца цифру нельзя было воспроизвести — сэмплинг опубликован, а вторая половина конфигурации недоступна снаружи. Любая цифра, полученная на публичном харнессе, измеряла другую систему, и разрыв нельзя было разложить на «модель слабее заявленного» и «ваша обвязка хуже нашей».

Дальше — хронология одной недели. 12 августа выходит V4-Pro-0813 с Terminal-Bench 2.1 = 87.9 против 72.1 у апрельского превью. 13 августа открывается харнесс, включая тот самый minimal mode. Порядок событий говорит сам за себя: сначала цифра, потом инструмент для её проверки.


Фото из офиса Meta

Фото из офиса Meta

2. Анатомия DeepSeek Harness

Самое неожиданное — фундамент. Ядро DeepSeek Harness — Cordis [9], IoC-микроядро с dependency injection и обратимыми побочными эффектами, родом из экосистемы Koishi (китайский фреймворк для чат-ботов). Суть Cordis: всё, что регистрирует плагин, отслеживается и откатывается при выгрузке. Отсюда честный hot reload без утечек и без ручной уборки. Под архитектуру «всё плагин» выбор логичный, хоть и неочевидный.

Код — Node.js/TypeScript-монорепа на pnpm. Валидация схем — на самописном schemastery вместо более популярного zod, ради консистентности со стеком Cordis.

Четыре режима работы

Режим

Что это

Standard

Полный агент: правка файлов, шелл, поиск по файлам и вебу, скиллы, планирование, цели, сабагенты, воркфлоу

Code

Инструменты выставлены через Code Mode SDK, и модель пишет одну TypeScript-программу, оркестрирующую многошаговые операции

Minimal

Ровно два инструмента: персистентный bash и str_replace_editor. Тот самый режим для бенчмарков

Creator

Сборка собственных пресетов: интроспекция рантайма, тесты плагинов в памяти, гайд по авторингу

Code mode заслуживает отдельного абзаца — и объяснения, потому что идея неочевидная.

В обычном режиме инструменты отдаются модели списком функций, которые она вызывает по одной. Модель формулирует вызов, харнесс исполняет, результат целиком возвращается в контекст, модель читает его и решает, что делать дальше. Один инструмент — один круг.

В Code mode те же инструменты выставляются как SDK: набор типизированных функций, доступных из TypeScript. Модель пишет не вызов, а программу. Харнесс исполняет её в песочнице целиком, и обратно в контекст возвращается только то, что программа напечатала.

Разница видна на задаче вроде «найди все места, где импортируется устаревший модуль, и проверь, где он реально используется». Классический цикл: grep возвращает сорок путей — все сорок падают в контекст. Дальше сорок чтений файлов — ещё сорок результатов в контекст. Модель на каждом шаге перечитывает всю эту простыню заново.

В Code mode модель пишет примерно следующее (схематично, имена функций условные):

const files = await grep("import legacy_parser");
const hits = [];
for (const f of files) {
  const src = await read(f);
  if (/legacy_parser.w+(/.test(src)) hits.push(f);
}
print(hits);   // в контекст вернутся только эти три пути

Сорок промежуточных результатов остались переменными внутри программы и до модели не доехали. В контекст пришли три строки вместо восьмидесяти простыней.

Плата за это — модель должна написать корректный код с первого раза. Если в программе ошибка [10], цикл отладки длиннее, чем при обычном вызове инструмента: падает вся программа, а не один шаг.

Это не изобретение DeepSeek — идея витает в воздухе. Nous Research называет то же самое Programmatic Tool Calling через execute_code, есть препринт с прямолинейным названием «Code as Agent Harness» [11]. Но в лабовом харнессе первого уровня это одна из первых полноценных реализаций.

Profile и Preset: два уровня конфигурации

Настройки в DeepSeek Harness разложены на два независимых слоя — процесс и агент.

Profile определяет, как живёт процесс целиком: web или headless, какие бандлы установлены. По сути это упорядоченный слой патчей cordis.patch.yml.

Agent Preset определяет, что видит конкретный агент в конкретной сессии: инструменты, промпты, скиллы, сабагентов, воркфлоу. Скоуп резолвится по цепочке agent → preset → global.

Практический смысл: в одном процессе одновременно живут агент-писатель, агент-кодер и агент-ресёрчер с разными наборами инструментов и инструкций. Не нужно поднимать четыре сервиса.

Трассируемость

Здесь, на мой взгляд, самая недооценённая часть релиза. Принцип формулируется как «видимое модели ⇔ записанное»: всё, что попадает модели на вход, пишется в append-only лог сессии — системные промпты, ризонинг, определения инструментов, вызовы и их результаты, планирование сабагентов, каждая инъекция контекста, реально использованная модель. В Trajectory view это разбирается по источникам.

Resume, fork, поиск и replay работают поверх одного и того же потока событий. Кто хоть раз пытался понять, почему агент на тридцатом шаге решил снести тесты, — тот оценит.

Похожий подход есть у OpenHands [12] — детерминированный replay в SDK. Но интереснее другое: ровно ту же идею за неделю до DeepSeek выкатила Meta. В Muse Code каждая правка файла, вызов инструмента и решение агента пишутся в event log, а команда muse replay проходит сессию по шагам — мотивируют это compliance-сценариями вроде SOC 2 и HIPAA.

Две лабы независимо и почти одновременно пришли к одному решению. Это значит, что replay поверх потока событий перестаёт быть отличительной фишкой и превращается в ожидаемую часть категории — примерно как plan mode год назад.

Безопасность и оговорки

Песочница строится на нативных механизмах ОС, MCP поддерживается, OpenAI-совместимые эндпоинты тоже. Ключи лежат в $DSH_HOME/.credentials.yaml, конфиг ссылается только на имена креденшелов, в лог сессии они не попадают.

Две оговорки:

⚠️ Это v0.1 developer preview, и предупреждение стоит в README [13] капслоком: «THERE WILL BE COMPATIBILITY-BREAKING CHANGES». На лендинге формулировка вежливее — основные плагины и API продолжат развиваться, — но смысл тот же.

Конкретных примеров поломок пока нет: проекту один день. Зато по архитектуре понятно, где рванёт первым, и это ровно то, ради чего DeepSeek Harness и берут. Всё, что вы напишете поверх плагинного API, разложите по слоям cordis.patch.yml или завяжете на цепочку скоупов agent → preset → global, держится на контрактах, которые автор прямым текстом обещает ломать. Писать плагин под dsh сегодня — это не «поставил и забыл», а подписка на чужой рефакторинг.

И небольшое by the way для тех, кто пойдёт ставить прямо сейчас. В PyPI с мая лежит пакет deepseek-harness от постороннего разработчика [14], и он тоже заводит команду dsh. Проект сам по себе честный, появился на три месяца раньше и к сегодняшнему релизу отношения не имеет — просто совпали имена. Но шума вокруг темы в ближайшие недели будет много, а совпадающее имя команды — идеальная почва для тайпсквоттинга. Простое правило: официальное ставится из npm и живёт в организации deepseek-ai. Если инструкция предлагает pip install — это не то.


Действительно зачем?

Действительно зачем?

3. Зачем лабе свой харнесс: четыре причины

Бенчмарки. Пока вашу модель гоняют в чужой обвязке, заточенной под чужую модель, вы выглядите хуже, чем есть. Свой харнесс — это контроль над цифрой в анонсе и, если он открыт, возможность её воспроизвести.

Обучение [15]. Харнесс — это среда. При RL на агентных задачах вам нужен свой цикл, свои инструменты, своё определение шага. Ко-тренировка модели вместе с обвязкой — ровно то, чем объясняют силу связки Claude + Claude Code.

Деньги. Модель продаётся токенами, харнесс продаётся подпиской — а подписка предсказуемее и маржинальнее. Рынок это считал мгновенно: в треде под анонсом в X читатели тут же начали требовать кодинг-тариф в духе «харнесс есть, модель есть, компьюта хватает — где подписка?». Логика [16] прозрачная: своего coding plan у DeepSeek до сих пор нет, а харнесс — ровно та деталь, без которой его не продать.

Контроль над точкой входа. Харнесс — это место, где пользователь на самом деле живёт: там он ставит задачу, там смотрит результат, там ругается. У DeepSeek такого места не было. До вчерашнего дня официальный ответ на вопрос «как запустить это агентом» звучал так:

export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<key>
export ANTHROPIC_MODEL=deepseek-v4-pro[1m]
export CLAUDE_CODE_EFFORT_LEVEL=max
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=786432

Да, это Claude Code с подменённым бэкендом. В доках DeepSeek больше десятка страниц Agent Integrations [17] — Claude Code, Codex, OpenCode, OpenClaw, Hermes, Reasonix, Crush, Kilo Code, Pi и далее. Все чужие.

Интеграции и открытость — прекрасная стратегия распространения, но петлю обратной связи они не строят. Когда вашу модель гоняют в чужой обвязке, вы видите токены на входе и токены на выходе. Вы не видите, на каком шаге агент сломался, какой инструмент вернул мусор, где системный промпт увёл модель не туда и что пользователь молча переписал руками после. Всё, из чего собирается следующий посттрейн, остаётся у владельца харнесса — вместе с правом решать, каким промптом и с каким набором инструментов показывать вашу модель миру.


Молоток – универсальный инструмент для проведения различных видов ручных работ

Молоток – универсальный инструмент для проведения различных видов ручных работ

4. Лабы, у которых свой харнесс уже есть

Лаба

Харнесс

Дебют

Код

Особенность

Anthropic

Claude Code [18] (+ Cowork)

фев 2025

закрытый

Задал шаблон категории; только Claude

OpenAI

Codex CLI [19]

апр 2025

Apache-2.0

Rust, ОС-песочница, облачный агент, локальные модели

Google

Gemini CLI → Antigravity CLI [20]

июн 2025 / май 2026

Apache / закрытый

Antigravity делит харнесс с десктопной платформой

Microsoft / GitHub

Copilot CLI [21]

сен 2025, GA фев 2026

закрытый

Мультимодельный: Anthropic, OpenAI, Google, MAI, открытый Kimi K2.7. Copilot SDK в GA с июня 2026

xAI

Grok Build [22]

май 2026

закрытый

256K контекста, до 8 параллельных сабагентов в worktree

Mistral

Vibe [23] (2.0 в янв 2026)

дек 2025

Apache-2.0

Work Mode + Code Mode, удалённые агенты, ACP

Moonshot

Kimi Code CLI [24]

июн 2026

MIT

Встроенные сабагенты coder/explore/plan, ACP

Z.ai (Zhipu)

ZCode

июл 2026

десктопная IDE

«Agentic Development Environment» под GLM-5.2, BYOK

Alibaba

Qwen Code, Qoder

июл 2025

Apache-2.0

Форк Gemini CLI под открытые кодеры Qwen

Amazon

Kiro / Kiro CLI [25]

2025

закрытый

Бывший Amazon Q Developer CLI, spec-driven

Tencent

CodeBuddy Code

сен 2025

закрытый

Скиллы, plan mode, ACP, песочница

Nous Research

Hermes Agent

фев 2026

открытый

Отдельный разговор, см. раздел 6

Meta

Muse Code [26]

авг 2026

закрытый

Мультиагентность по умолчанию, event log и muse replay, ко-тренирован с Muse Spark 1.2

DeepSeek

DeepSeek Harness [27]

авг 2026

MIT

Всё плагин, Cordis, четыре режима

5. Кто до сих пор без

AI b2b SaaS 6-7 стартапер

AI b2b SaaS 6-7 стартапер

Список короче, чем был ещё месяц назад:

  • MiniMax — модели сильные, официального CLI-харнесса нет. В июне под их аккаунтом висел вполне отчаянный тред: «kimi code есть, qwen code есть, glm есть — где minimax?»

  • Nvidia, Cohere, AI21, Reka, Sakana — модели есть, харнессов нет.

  • Perplexity, Thinking Machines, SSI — не их бизнес в принципе.

Тенденция читается однозначно: если у лабы есть кодинг-модель, через полгода у неё будет свой харнесс. Лучшее подтверждение — сама Meta. Ещё в июле она была главным примером «лаба без харнесса»: внутренние инструменты есть, наружу ничего. 5 августа вышел Muse Code, и пример закончился. За один квартал 2026 года своими харнессами обзавелись xAI, Moonshot, Z.ai, Meta и DeepSeek.

Отдельная категория — платформенные харнессы, где вендор продаёт обвязку, но модель не тренирует: Cursor CLI, Amp [28] (отделился от Sourcegraph в декабре 2025), Droid [29] (Factory), Junie [30] (JetBrains), Auggie [31] (Augment), Qoder. Почти все они принципиально мультимодельные — в этом их продажа.

Copilot я сознательно занёс в таблицу выше, а не сюда, хотя он тоже мультимодельный и живёт на платформе GitHub. Критерий простой: у Microsoft есть собственные модели MAI, и они — одна из опций в модельном пикере Copilot. Если считать иначе, придётся выкинуть из таблицы и Amazon с Kiro, который тоже роутит между Opus, MiniMax, DeepSeek и Qwen. Граница между «лабой» и «платформой» в 2026 году размылась до того, что провести её честно уже нельзя.


Интерфейс OpenCode

Интерфейс OpenCode

6. Model-agnostic лагерь

Здесь самое интересное, потому что открытые веса подешевели настолько, что связка «нормальный харнесс + GLM-5.2 [32] / DeepSeek V4 / Qwen3-Coder / Kimi K2.7» даёт околофронтирные результаты за долю подписочной цены.

Проект

Лицензия

Чем интересен

OpenCode [33]

MIT, ~182k★

Самый зазвёзженный агент на GitHub. 75+ провайдеров, клиент-сервер, TUI + десктоп + IDE

Pi [34]

MIT, ~67k★

Model-agnostic через вычитание: 4 инструмента, системный промпт короче 1000 токенов, MCP вынесен в SDK расширений

oh-my-pi / Omp [35]

MIT, ~16k★

Тот же Pi с обратным знаком: hash-anchored патчи, AST-переписывание, управление отладчиком по DAP, модель-надзиратель Advisor

Goose [36]

Apache-2.0, ~51k★

Единственный крупный агент под управлением фонда (AAIF при Linux Foundation). MCP-native, local-first

Cline

Apache-2.0, ~64k★

Вынес рантайм в отдельный открытый SDK — продукт превратился в инфраструктуру

OpenHands [12]

открытый, ~79k★

Контейнеризация всего, event-sourced replay в SDK

Aider [37]

Apache-2.0, ~47k★

Праотец. Гит-нативные атомарные коммиты, 100+ моделей через LiteLLM. Темп просел

Kilo / Continue / Crush

открытые

500+ моделей / CI-first / лучший TUI в категории

DeepSeek-Reasonix [38]

MIT, ~26k★

Сторонний харнесс вокруг префикс-кэша DeepSeek: байт-стабильный контекст, отчётные 99.8% попаданий

mini-SWE-agent [39]

MIT

Только bash, ни одного кастомного инструмента. На нём построен лидерборд Bash Only — стандарт для сравнения моделей между собой

Отдельно стоит Omnigent от Databricks — мета-харнесс, который оркестрирует другие харнессы (Claude Code, Codex, Cursor, OpenCode, Hermes, Kiro, Pi) в одной сессии с общими политиками апрувов и трат.


OpenClaw или что-то типа того

OpenClaw или что-то типа того

7. Персональные агенты: другой класс, та же архитектура

Всё вышеперечисленное — про код. Но есть вторая ветка эволюции, где харнесс обслуживает не репозиторий, а жизнь пользователя. Две главные фигуры:

OpenClaw

Проект Петера Штайнбергера [40] — австрийца, который до этого тринадцать лет в одиночку бутстрапил PSPDFKit, PDF-фреймворк для мобильных приложений. Dropbox, IBM, банки; в 2021 году — стратегическая инвестиция Insight Partners на €100 млн и выход из компании. Дальше выгорание и несколько лет практически без кода, пока в конце 2024-го он не сел за Claude Code.

OpenClaw появился в ноябре 2025-го (сначала под именем Clawdbot, потом Moltbot) и написан, по словам автора, за час — потому что он проголодался и захотел проверить своих агентов с кухни. Дальше случилось то, что случилось: самый зазвёзженный репозиторий на GitHub [41] меньше чем за пять месяцев (346k+ звёзд), 4.7 млн еженедельных загрузок, около полумиллиона машин по миру.

Суть — персональный ассистент, который живёт локально на вашей машине и общается с вами через мессенджеры, которыми вы и так пользуетесь: WhatsApp, Telegram. Не «чат с ИИ», а сущность, которая работает в фоне и пишет вам сама.

В феврале 2026 Штайнбергер ушёл в OpenAI [42] «строить следующее поколение персональных агентов». OpenClaw остался открытым и живёт в фонде, который OpenAI обещал поддерживать.

И вот главное, ради чего его стоит упомянуть в статье про харнессы. Штайнбергер публично сформулировал [43] урок, который дорого ему обошёлся:

«Бизнес-модель твоей зависимости — это твоя бизнес-модель».

Он оптимизировал свой харнесс под модели Anthropic. Потом Anthropic примерно за сутки предупредила об отключении подписок и выкатила собственного конкурирующего агента. Всё.

Это ровно тот сценарий, от которого страхуются и OpenCode, и Pi, и — теперь — DeepSeek, выкладывая свой харнесс под MIT. Открытость здесь не благотворительность, а стратегия: если ваша обвязка стала субстратом, на котором строят другие, вас нельзя выключить одним письмом.

(Заодно там же — поучительная история про безопасность: пресса объявила, что 20% скиллов OpenClaw вредоносные, реальная цифра оказалась 0.3%. Осадочек, впрочем, остался, и вопрос «что мы вообще пускаем к файловой системе» никуда не делся.)

Hermes Agent

Проект Nous Research [44] — и это как раз лаба, которая делает модели (линейка Hermes, которые они файнтьюнили из Llama), но при этом её харнесс принципиально model-agnostic. Работает с Nous Portal, OpenRouter, OpenAI и любым эндпоинтом.

Nous формулирует прямой архитектурный тезис — Harness Engineering: главный анлок 2026 года не в более умной модели, а в более умной обёртке вокруг неё. Отсюда пять слоёв, в которые они вкладываются: инструкции, ограничения, обратная связь, память, оркестрация. Модель при этом объявлена сменной деталью — сегодня фронтир, завтра локальная, послезавтра какая-нибудь ещё.

Что отличает Hermes от кодинг-агентов:

  • Самоулучшение. Он ведёт персистентную память своих успехов и провалов и генерирует из них переиспользуемые скиллы. Агент после месяца работы измеримо отличается от того, с которого вы начали. Слоган — «the agent that grows with you».

  • Каналы доставки. Терминал, нативное десктопное приложение под macOS/Windows/Linux, телеграм-бот, cron, вебхуки.

  • Пять бэкендов песочницы: local, Docker, SSH, Singularity, Modal — с харденингом контейнеров и изоляцией неймспейсов.

  • Programmatic Tool Calling через execute_code — та же идея, что и Code mode в DeepSeek Harness.

  • Скиллы для управления другими харнессами. Hermes умеет вызывать Claude Code, Codex CLI, OpenCode и OpenHands как сабагентов. Пожалуй, самый чистый способ скомпоновать несколько харнессов без написания клея.

  • Совместимость со стандартом скиллов agentskills.io.

По снимку OpenRouter от 10 мая Hermes был №1 по дневному потреблению токенов: 224 млрд в день против 186 млрд у OpenClaw. В июле Nous Research привлекала раунд [45] по оценке $1.5 млрд.

Мораль для темы статьи: харнесс перестал быть придатком модели настолько, что вокруг него оценивают компании в полтора миллиарда.

Можно, а зачем?

Несмотря на то, что формально основная идея всех подобных тулов улучшать жизнь и быть крутым персональным агентом, лично я не вижу в них большую ценность – в большинстве случаев задачи так или иначе требуют вашего внимания [46] и что OpenClaw, что Hermes Agent, несмотря на сумасшедшие оценки со стороны инвесторов – абсолютно все примеры использования сводятся к тому, что люди наколхозили себе ChatGPT на VPSке с доступом через телеграм. Если вы знаете какие-то хорошие примеры использования – пишите в коментариях.


Ответ на вопрос пишите в комментариях

Ответ на вопрос пишите в комментариях

8. Что со всем этим делать

На данный момент формируется два лагеря: первые — арчеры, которые бесконечно возяться со своим любимым harnessом и его бесконечными плагинами. Действительно ли это помогает с продуктивностью — сложно сказать. Второй, приверженцем которого является автор статьи, что в зависимости от того, какую модель вы используете, стоит подбирать соответсвующую обвязку. Раз в какое-то количество времени можно переезжать по желанию, но я думаю, что все еще стоит фокусироваться на том, что вы делаете и есть ли у этого выхлоп, а не на том, каким молотком вы пользуетесь.


Разбор самой модели я вынес отдельно — цифры V4-Pro-0813, цена за миллион токенов, агентные бенчмарки и то, чего в них не видно, лежат у меня в телеграме [47]. Там же всё остальное про локальный инференс и агентную возню, чипы и иногда про науку.

Ссылки: deepseek.com/harness [1] · github.com/deepseek-ai/deepseek-harness [27] · github.com/topics/dsh-plugin [48]

Все бенчмарки в статье, где не указано иное, — вендорские. Звёзды и версии — на середину августа 2026.

Автор: danyathewriter

Источник [49]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34387

URLs in this post:

[1] DeepSeek Harness v0.1: https://www.deepseek.com/harness/en/

[2] mini-SWE-agent: https://github.com/SWE-agent/mini-swe-agent

[3] отдельный лидерборд Bash Only: https://www.swebench.com/

[4] Февральский прогон 2026 года: https://simonwillison.net/2026/Feb/19/swe-bench/

[5] Live-SWE-agent: https://arxiv.org/abs/2511.13646

[6] Память: http://www.braintools.ru/article/4140

[7] Terminal-Bench 2.x: https://www.tbench.ai/leaderboard/terminal-bench/2.0

[8] чейнджлоге от 31 июля: https://api-docs.deepseek.com/updates/

[9] Cordis: https://github.com/cordiverse/cordis

[10] ошибка: http://www.braintools.ru/article/4192

[11] «Code as Agent Harness»: https://arxiv.org/abs/2605.18747

[12] OpenHands: https://docs.openhands.dev/sdk

[13] README: https://github.com/deepseek-ai/deepseek-harness/blob/master/README.md

[14] постороннего разработчика: https://github.com/HenryZ838978/deepseek-harness

[15] Обучение: http://www.braintools.ru/article/5125

[16] Логика: http://www.braintools.ru/article/7640

[17] Agent Integrations: https://api-docs.deepseek.com/quick_start/agent_integrations/claude_code/

[18] Claude Code: https://claude.com/pricing

[19] Codex CLI: https://developers.openai.com/codex/changelog

[20] Gemini CLI → Antigravity CLI: https://developers.googleblog.com/an-important-update-transitioning-gemini-cli-to-antigravity-cli/

[21] Copilot CLI: https://docs.github.com/copilot/concepts/agents/about-copilot-cli

[22] Grok Build: https://x.ai/news/grok-build-cli

[23] Vibe: https://mistral.ai/news/vibe-agent/

[24] Kimi Code CLI: https://github.com/MoonshotAI/kimi-code

[25] Kiro / Kiro CLI: https://kiro.dev/cli

[26] Muse Code: https://dev.meta.ai/docs/muse-code

[27] DeepSeek Harness: https://github.com/deepseek-ai/deepseek-harness

[28] Amp: https://sourcegraph.com/blog/why-sourcegraph-and-amp-are-becoming-independent-companies

[29] Droid: https://factory.ai/news/terminal-bench

[30] Junie: https://blog.jetbrains.com/junie/2026/06/junie-coding-agent-out-of-beta/

[31] Auggie: https://www.augmentcode.com/product/cli

[32] GLM-5.2: https://venturebeat.com/technology/z-ais-open-weights-glm-5-2-beats-gpt-5-5-on-multiple-long-horizon-coding-benchmarks-for-1-6th-the-cost

[33] OpenCode: https://opencode.ai/docs/

[34] Pi: https://mariozechner.at/posts/2025-11-30-pi-coding-agent/

[35] oh-my-pi / Omp: https://omp.sh/

[36] Goose: https://goose-docs.ai/blog/2026/04/07/goose-moves-to-aaif/

[37] Aider: https://github.com/Aider-AI/aider

[38] DeepSeek-Reasonix: https://github.com/esengine/deepseek-reasonix

[39] mini-SWE-agent: https://mini-swe-agent.com/latest/

[40] Петера Штайнбергера: https://en.wikipedia.org/wiki/Peter_Steinberger_%28programmer%29

[41] самый зазвёзженный репозиторий на GitHub: https://openclaw.ai/

[42] ушёл в OpenAI: https://techcrunch.com/2026/02/15/openclaw-creator-peter-steinberger-joins-openai/

[43] публично сформулировал: https://finance.biggo.com/news/041c532266006d72

[44] Nous Research: https://hermes-agent.nousresearch.com/

[45] привлекала раунд: https://techcrunch.com/2026/07/13/hermes-agent-maker-nous-research-in-talks-for-new-funding-at-1-5b-valuation/

[46] внимания: http://www.braintools.ru/article/7595

[47] лежат у меня в телеграме: https://t.me/techn0danya

[48] github.com/topics/dsh-plugin: https://github.com/topics/dsh-plugin

[49] Источник: https://habr.com/ru/articles/1070296/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1070296

www.BrainTools.ru

Rambler's Top100