DeepSeek Harness 与中国 Agent Harness 六强格局
DeepSeek 内部正在开发 Agent 工作台 DSH,负责人是 Jane Street 九年量化老兵崔添翼。基于泄露技术报告还原 Cordis 魔改架构、双 Surface 设计和遥测一等公民,同时放入中国六家 Harness 厂商全景对比——三条技术路线分歧、一个正在关闭的窗口期。
当一家量化交易老兵开始造 Agent 工作台,他面对的不是空白市场,而是一个已经涌入六家厂商、1300 万 DAU 的赛道。
引子:一份泄露报告和一个时间节点
2026 年 8 月 11 日,两条消息在同一天爆发。
第一条:智谱 ZCode 宣布用户突破 100 万,同步上线 Goal 模式、Subagents、Remote Control 和闲时任务四大功能。第二条:DeepSeek 的微信公众号"DeepSeek Harness 团队"(7 月 6 日已注册,头像是一只黑色鲸鱼)在这一天被媒体大规模报道。同一天夜里,GitHub 上 dsh-external 组织的所有仓库紧急转为私有。
这不是巧合。中国 AI 竞争的焦点,已经从模型参数转向了 Harness 和产品力。
DeepSeek Harness(以下简称 DSH)是 DeepSeek 内部正在开发的 Agent 工作台,负责人是崔添翼——浙大 ACM 六金得主、Jane Street 香港九年量化系统老兵。2026 年 3 月加入 DeepSeek,5 月立项,7 月小范围内测,公众号 7 月 6 日已注册。一份泄露的技术报告 v2.1 版(基于 6 张证据截图 + 4 份仓库源码 + 生态追踪表)让外界第一次窥见了它的全貌。
但 DSH 面对的不是一片蓝海。在它还在内测的这半年里,阿里 Qoder 已经拿下 IDC 中国 AI 编程市场 47.6% 的份额和 500 万用户,智谱 ZCode 已经跑出 100 万用户和 ARR 10 亿美元,腾讯 WorkBuddy 的 DAU 已经到了 1300 万。
本文拆解 DSH 的技术架构,同时把它放到中国 Harness 全景里做横向对比——六家厂商、三条技术路线、一个正在关闭的窗口期。
一、DSH 技术架构还原
1.1 官方证据链
最硬的证据来自 DeepSeek 自己的 API 文档。在 V4-Flash-0731 发布说明中,Change Log 写道:
"For the Code Agent tasks in the public benchmark sets, the official DeepSeek-V4-Flash was tested using the DeepSeek Harness minimal mode (to be released soon) as the framework."
一句话确认了四件事:DSH 存在;当前版本叫 minimal mode;官方 benchmark 跑在 DSH 上;它尚未发布。崔添翼此前表示 Harness 将和 V4 同时发布——8 月 13 日 V4 Pro 0813 已悄然上线,DSH 的公开发布可能就在数周之内。
1.2 底座选择:Cordis 4.0 深度魔改
泄露报告显示,DSH 选择了 Cordis 4.0 作为底座框架。Cordis 是 Koishi 聊天机器人框架的依赖注入核心,作者是中国前端社区核心贡献者 shigma。选择 Cordis 的逻辑很直接:5 月立项到 7 月内测只有两个月,自研框架至少要半年;Cordis 提供了完整的插件注册、依赖注入、配置树和热重载能力,拿来就能用。
但代价是三处必须做的核心魔改。
魔改一:调用链精准溯源。 原生 Cordis 为聊天机器人设计,服务注入只追踪 origin 注册源。Agent Loop 存在工具嵌套调用——工具 A 调用工具 B,B 报错时要追溯到 A。DSH 引入了 symbols.caller 拦截器,劫持 Proxy 的 get/set,让最内层子工具报错时能穿透 shadow 上下文,将责任追溯到真实调用方。
魔改二:高频事件循环性能。 Agent 在 CoT 推理和连续 Tool Call 时,产生极其密集的生命周期事件。原生 Cordis 用 callback.bind(thisArg) 每次创建新闭包,在高频场景下 GC 压力暴增。DSH 废弃了闭包绑定,全面改为 Reflect.apply(callback, thisArg, args) 动态调用,在 dispatch/emit/serial/waterfall 全链条中去除了闭包分配。
魔改三:幽灵 Fiber 状态一致性。 DSH 广泛使用 EntryTree 配置树做插件热重载,旧服务卸载和新服务加载的竞态导致 IoC 容器状态分裂。修复方案是在 restart()/update() 中强制操作真实的 this.ctx.fiber。
这三处魔改的共同指向:Cordis 原本为低频、扁平的聊天机器人交互设计,Agent 工作负载的特征是高频事件、深嵌套调用、长任务运行——两个设计假设根本不同。崔添翼的团队用两个月修补了这个 gap,但长期来看,如果 DSH 成功,核心引擎大概率需要重写。
1.3 双 Surface 架构:最重要的设计决策
DSH 实现了彻底的 Host(Node.js 运行时)与 Client(浏览器 Web GUI)分离体系。
Host 侧走 ctx.tools.register(defineTool) 和 ctx.systemPrompt.section(),负责工具注册、Prompt 分段注入、MCP 桥接和 schemastery 配置校验。Client 侧走 ctx.slots.inject() 和 ctx.theme,负责 UI 插槽注入、--dsw-* CSS Design Token 主题系统(100+ 语义化变量)和 defineStore 乐观更新。
两者的插件生命周期完全独立。一个 Host 插件可以只注册工具不碰 UI,一个 Client 插件可以只注入 UI 不碰工具链。这意味着第三方开发者可以写一个插件,Host 侧注册调试工具,Client 侧注入调用栈可视化——这种扩展能力在目前的竞品中是独有的。
社区内部形成了三叉戟分治体系:dsh-hub(正经插件,核心功能与生产力工具)、toybox(整活插件,社区试验性探索)、dsh-skins(换肤皮肤,GUI 主题注册)。从 dsh-skins 仓库可以看到 Nord 等皮肤仅需覆盖 alias 层 token 即可实现全局换色,零侵入核心 UI。
1.4 遥测一等公民
泄露报告中一张实拍截图(图 5)提供了 DSH Web 运行时的黄金证据。底部状态栏显示:
1 turns · 3 steps | Tool call 14.5s | Context 1% of 1M | Cache hit 66% | Input 39.2K tok · Output 447 tok
把 KV Cache 命中率暴露在 UI 一等公民,这个设计选择不是随意的。66% 意味着 39.2K input tokens 中约 25.9K 命中了服务端缓存。第三方 Harness(Cursor、OpenCode)通过 API 调用 DeepSeek,拿不到这个数据,也控制不了服务端缓存策略。DSH 把它暴露出来,说明 DeepSeek 在把推理引擎的优势产品化——不只是比价格,而是让用户感知到"这个平台更快更便宜"。
Turns 与 Steps 的分离也值得注意。1 turn 是用户视角的一轮对话,3 steps 是 Agent 内部循环三次(Bash 搜索 → view_image 视觉解析 → Markdown 总结)。这是 Agent Loop 可观测性的正确粒度。
1.5 llm-pi-ai:推理策略控制层
泄露目录树显示 DSH 的 packages/llm/ 下有两个并列包:llm-deepseek 和 llm-pi-ai。后者包含 adapter.ts、config.ts、context.ts、replay.ts 和 stream.ts。llm-pi-ai 的功能在泄露报告中标注为"存在不确定性"。
排除法推理(以下为基于文件名的推演,无源码验证):如果只是外部模型适配器,不需要 replay.ts(会话回放)和独立的 context.ts(上下文构建)。命名为 "pi-ai" 而非 "llm-openai" 也不符合命名规范。最可能的解释是——"pi"(π)在 ML 语境中指策略函数或策略迭代,llm-pi-ai 是 DeepSeek 的推理策略控制层,负责 Flash/Pro 模型路由、推理强度切换(low/high/max)、<think> 块自动剥离、会话确定性回放和流式输出控制。
如果这个推演正确,DSH 在架构上深度绑定 DeepSeek 自家模型。llm-pi-ai 和 llm-deepseek 共同构成了对 DeepSeek 推理引擎的端到端优化闭环——但需要强调,这是基于泄露目录树文件名的排除法推理,不是确认的事实。
1.6 崔添翼的量化基因
理解 DSH 的工程哲学,需要理解崔添翼的背景。他不是做 AI 出身的。
2008 年 NOIP 铜牌保送浙大计算机,大学期间六枚 ACM-ICPC 亚洲区域赛金牌。2013 年毕业加入 Jane Street Capital 香港,助理量化研究员,九年。覆盖股票和固收方向的软件开发与研究,在香港和纽约办公室都工作过。2022 年联合创办 TSY Capital(天市垣资本),系统化量化交易。2026 年 2 月离开 TSY,3 月加入 DeepSeek。
Jane Street 的量化交易执行系统有几条核心原则:执行速度即金钱(慢一毫秒钱就被别人赚走了);可靠性是生存条件(系统挂了不是少赚钱是赔钱);全链路可追溯(出了问题必须知道是哪一步出的);确定性回放(出了 bug 要能精确复现)。
这些原则几乎完美映射到 DSH 的设计:Agent Loop 每轮推理-工具-反馈必须快(Reflect.apply 事件分发优化);长时间运行不崩溃(Fiber 状态一致性修复);Telemetry 把 turns/steps/cache hit/tokens 全部暴露在 UI(全链路可追溯);llm-pi-ai 的 replay.ts 提供会话回放(确定性回现)。
这不是巧合。这是 Jane Street 的工程纪律在 Agent 领域的映射。

二、中国 Agent Harness 六强格局
DSH 不是在真空中诞生。把视野放大到整个中国市场,Agent Harness 赛道在 2026 年上半年已经高度拥挤。
2.1 阿里 Qoder:产品线最全的平台型选手
阿里 2025 年 8 月发布 Qoder,2026 年 5 月升级为 1.0 智能体自主开发工作台。产品矩阵覆盖六条线:Qoder IDE(桌面 IDE / JetBrains / VS Code 插件)、Qoder CLI(命令行)、QoderWork(桌面办公自动化)、Qoder Cloud Agents(阿里云全托管)、QoderWake(7×24 数字员工)、Qoder Mobile(移动端)。
QoderWork 的技术架构是一个三层设计。交互层提供三种分级自主模式——Ask(只读问答)、Agent(多轮迭代需确认)、Quest(一次性委托全权限预设边界)。决策层包含 Agent 规划编排、意识系统(记忆+反思+技能进化)和 MCP 工具发现与自动编排。执行层是本地沙盒中的文件操作、Shell 快照和会话级隔离。
Qoder 1.0 进行了 Agent Harness 的系统重构,将传统聊天对话模式转变为结构化的任务运行时。官方称可一次检索 10 万个代码文件,Repo Wiki 代码知识图谱和团队级知识引擎整合为统一的知识底座。
底座采用多模型兼容策略(Qwen/GLM/DeepSeek/Kimi/MiniMax),不锁定单一模型。IDC 报告显示其市占率 47.6%,用户 500 万。优势是产品线最全、用户基数最大;短板是多模型兼容意味着无法做模型-Harness 深度协同优化。
2.2 智谱 ZCode 3.0:自研内核的深度绑定
ZCode 的关键决策在 3.0 版本——全面切换自研 ZCode Agent 内核,不再内置或维护其他 Agent 适配。这是一个用减法做加法的决策:放弃多 Agent 兼容(之前支持 Claude Code、Codex、Gemini),换取对 GLM-5.2 的端到端深度优化。
自研内核最直观的成果是缓存命中率超过 98%。这个数字是所有 Harness 中最高的。对比 DSH 的 66%(单次实拍),差距来自自研内核可以精确控制上下文结构,确保 prefix caching 最大命中。在智谱自研的 Z.ai Code Bench 中,GLM-5.2 + ZCode 的任务整体通过率比 GLM-5.2 + Claude Code 高 2.39%。
ZCode 的功能架构在 8 月 11 日升级后已经相当完整:Goal 模式(设定可验收目标,自动拆解/修改/测试/迭代)、Subagents(通用执行型 + 只读探索型 + 自定义智能体)、Remote Control(微信/飞书手机端访问桌面)、闲时任务(低峰自动执行不扣积分)、Zread 智能项目知识库、可视化 Git 分支图谱。
智谱从 1 亿到 10 亿 ARR 只用了 5 个月(比 Anthropic 快 10 个月),主要靠 Coding。ZCode 用户已突破 100 万。优势是模型-Harness 协同优化最深;短板是放弃多模型支持后变成纯 GLM 生态——如果 GLM 模型能力落后,整个产品线都会受影响。
2.3 腾讯 WorkBuddy:CodeBuddy 内核
WorkBuddy 的底座是腾讯内部的 CodeBuddy 内核,与 QClaw 等产品并行整合为当前形态(并非简单的线性演化)。据腾讯官方数据,腾讯从 2022 年开始做 AI 编码工具,CodeBuddy 已覆盖腾讯 90% 工程师,AI 生成代码占比超 50%,整体编码时间缩短 40%。
WorkBuddy 的 DAU 已达 1300 万,MAU 2000 万,国内效率智能体第一。三种工作模式(Craft 直接执行 / Plan 先出方案 / Ask 只问答)和 Qoder 的分级自主性类似。
企业版的架构设计值得特别关注:"Workflow 主干 + Agent 灵活注入"——用 Workflow 保证生产型业务的确定性、可追溯、可重试,在需要灵活判断处注入 Agent 的长链思考能力。这是目前看到的最好的工程化设计之一,比纯 Agent Loop 更可靠。
据腾讯官方信息,内置 13 个主流大模型,兼容 OpenClaw 技能生态(200+ 自定义技能插件)。企业版已发布,支持从 SaaS 到私有化本地部署(信创环境)。腾讯生态全打通(文档/网盘/微信/会议/支付)是它最大的差异化。
短板同样明显:多模型策略下没有自研模型做底座。腾讯混元在 Agent/Coding 方向不是第一梯队。
2.4 MiniMax MaxClaw/MaxHermes:OpenClaw 云托管
MaxClaw 的本质是 OpenClaw 的云端网关封装。用 MiniMax 云端算力完成 OpenClaw 底层部署,用户无需本地安装/配置 API/管理 Docker,10 秒部署。已跻身同类服务第一梯队。
MaxHermes 是升级版,基于 Hermes Agent 构建,具备"自主智能演化"机制——每完成一项任务就解锁新技能,持续扩展能力边界。底层模型据官方信息为 MiniMax M2.7(独立验证暂缺),支持 50+ Skills 和 60-150 个 Feature list 的复杂环境。
MaxHermes 的"自我进化"逻辑是独特的——Harness 本身在进化。任务执行后自动学习,扩展技能库,下次能处理更复杂的任务。这和 DSH 的插件热重载指向同一个方向:Harness 不是静态框架,而是会成长的系统。
短板是基于 OpenClaw 开源框架,没有自研内核。模型-Harness 协同优化深度有限。
2.5 字节 TRAE:IDE 起步的全路线选手
据官方信息,字节跳动 TRAE 已积累 600 万以上注册用户。双模式设计:IDE 模式保留传统编辑器工作流,SOLO 模式以 AI 为主导自动规划任务。CUE 是核心差异化功能(链式补全 + 多行修改 + 修改点预测跳转),让 AI 第一次具备了和开发者一起重构代码的能力。
产品已从开发者工具扩展为 TRAE Work 工作空间。内置多模型(Doubao/DeepSeek/Kimi/Qwen/GLM),独立 IDE + VS Code/JetBrains 插件两种形态。
2.6 DeepSeek DSH:Cordis 魔改的开放生态
回到 DSH 本身。它的核心差异化在于开放插件生态。三叉戟分治(dsh-hub / toybox / dsh-skins)+ 双 Surface 物理级解耦,让它有可能成为"Agent Harness 领域的 VS Code"——不锁定模型(虽然深度绑定 DeepSeek),不锁定用户,但锁定生态。
崔添翼的量化工程基因带来了独特的工程纪律:Telemetry 一等公民(全链路可观测)、Reflect.apply 事件分发优化(毫秒级执行)、replay.ts 确定性回放。这些都是 Jane Street 九年磨出来的工程习惯。
但时间窗口紧迫。769 人报名内测 vs ZCode 100 万用户 vs WorkBuddy 1300 万 DAU。晚半年进场,竞品已有百万级用户粘性和成熟的产品迭代经验。
三、三条路线的根本分歧
六家厂商的竞争,表面是功能比拼,底层是三条路线的分歧。
分歧一:模型绑定 vs 模型无关。 ZCode(GLM only)和 DSH(DeepSeek only)赌的是模型-Harness 深度协同大于灵活性——98% 缓存命中率和 KV Cache UI 一等公民就是这种协同的证据。Qoder、WorkBuddy、TRAE 赌的是多模型灵活性加用户基数大于协同深度。两边的核心假设完全相反。
分歧二:自研内核 vs 开源框架。 ZCode(从零写)、WorkBuddy(CodeBuddy 四年积累)走自研路线,启动慢但长期可控。DSH(Cordis 魔改)、MaxClaw(OpenClaw 封装)走框架路线,启动快但技术债会累积。DSH 的三处 Cordis 魔改已经证明:聊天机器人框架的底座扛不住 Agent 工作负载,12-18 个月内大概率需要重写核心。
分歧三:开放生态 vs 封闭体验。 DSH(三叉戟插件)、WorkBuddy(OpenClaw 技能兼容)走开放路线。ZCode 明确不再支持第三方 Agent——赌的是自研体验足够好,用户愿意接受锁定。Qoder 和 TRAE 介于两者之间,有 MCP 和技能扩展但深度有限。

四、DSH 的突围路径
DSH 面对的核心问题是:在一个已有 500 万用户竞品(Qoder)和 100 万用户竞品(ZCode)的存量市场里,凭什么赢?
第一个差异化:插件生态开放性。 ZCode 走封闭路线(不再支持第三方 Agent),Qoder 和 WorkBuddy 有技能扩展但缺乏 Host/Client 物理级解耦的设计。DSH 的双 Surface 架构让第三方开发者可以在 Host 侧注册工具同时在 Client 侧注入 UI,这种扩展能力目前只有 DSH 具备。如果三叉戟生态跑起来,DSH 可能成为"Agent Harness 领域的 VS Code"。
但风险同样真实——769 人报名内测,dsh-external 组织已转私有,插件生态目前还是纸面规划。WorkBuddy 已有 200+ 技能插件在跑。
第二个差异化:V4 Pro 模型能力。 V4 Pro 0813 今天上线。如果 V4 Pro 在 Agent 任务上超越 GLM-5.2 和 Qwen3.8-Max,DSH 有模型优势。DeepSeek API 文档中官方 benchmark 全部跑在 DSH 上这个事实本身就是一个信号——DeepSeek 敢于用自家 Harness 测出公开分数。
第三个差异化:崔添翼的量化工程哲学。 这是最难复制的东西。Jane Street 九年的执行系统纪律——毫秒级优化、全链路可追溯、确定性回放——不是招几个工程师就能补上的。DSH 的 Telemetry 一等公民设计(cache hit rate / context usage / turns-steps 分离)带有强烈的量化交易执行系统基因。在长时间运行、高可靠 Agent 场景下,这种工程纪律会变成真正的竞争力。
窗口期判断:DSH 的最佳发布窗口就是未来 2-4 周——V4 Pro 0813 刚上线,市场注意力集中在 DeepSeek 身上。如果拖到 Qoder 或 ZCode 下一个大版本之后发布,注意力红利就没了。
五、行业走向
Harness 自身进化:从框架到生命体
这场竞争中最前沿的方向不是模型能力(各家趋同),而是 Harness 自身进化能力。MaxHermes 的"任务完成→解锁新技能"和 DSH 的"插件热重载 + Cordis Fiber 状态一致性"指向同一个趋势——Harness 不是静态框架,而是会成长的系统。
这呼应了一个正在形成的技术共识:Agent Harness 的下一个进化方向是自我进化。不是模型变强了 Harness 自动变强,而是 Harness 本身具备学习能力——记录执行模式、优化工具调用链路、自动生成新技能。谁先在这个方向上突破,谁就拿到下一张入场券。
推理基础设施竞争的产品化
DSH 把 KV Cache 命中率做成 UI 一等公民,ZCode 做到超过 98% 缓存命中——这些数字指向同一个判断:推理成本的竞争正在从模型定价层下沉到推理基础设施层。
第三方 Harness(Cursor、OpenCode)通过 API 调用大模型,拿不到服务端缓存数据,也控制不了缓存策略。模型公司自研 Harness(ZCode、DSH)天然拥有这个优势——它们控制从模型权重到推理引擎到 Harness 的全链路,可以做端到端优化。
这对独立 Harness 厂商构成了结构性压力。当模型公司开始把最好的 Harness 体验绑定在自家模型上,独立厂商的优化天花板会被锁死在 API 接口层。
中国市场的特殊变量
虎嗅在一篇文章中将 Harness 竞争定义为争夺三权:能力分发权(Skill 入口)、工具供给权(Tool 调用)、最终结算权(Token 账单)。谁控制了 Harness,谁就控制了开发者与模型之间的分发通道和结算通道。
这个框架比"Model + Harness = Agent"更精确。中国市场的特殊性在于——腾讯有微信和企业微信的超级入口,阿里有钉钉和阿里云的企业渠道,字节有飞书和抖音的分发能力。WorkBuddy 接入微信支付形成支付闭环,Qoder 接入钉钉连接企业工作流——这些生态优势是 DeepSeek 和智谱不具备的。
纯技术公司(DeepSeek、智谱)的 Harness 需要回答一个额外的问题:当竞品绑定了超级 App 的分发渠道时,你怎么触达非技术用户?
答案可能是:DSH 和 ZCode 不需要触达所有人。它们只需要锁定最核心的开发者群体——那些对模型能力、缓存性能和 Agent 可靠性最敏感的专业用户。WorkBuddy 和 Qoder 服务大众市场,ZCode 和 DSH 服务专业开发者。这个分层可能就是终局。
注释与数据来源
- DeepSeek API Change Log:api-docs.deepseek.com/updates(V4-Flash-0731 发布说明)
- DSH 泄露技术报告 v2.1(基于 6 张证据截图 + 4 份仓库源码 + 生态追踪表)
- IDC《中国 AI 编程市场份额,2025》:阿里 Qoder 市占率 47.6%
- 智谱 ZCode 官方数据:用户 100 万,缓存命中率超过 98%,Z.ai Code Bench 评测
- 腾讯云开发者社区 WorkBuddy 技术拆解:DAU 1300 万,CodeBuddy 四年积累
- MiniMax MaxClaw/MaxHermes 官方信息:M2.7 模型,OpenClaw 云端实现
- 崔添翼履历:百度百科、凤凰科技、每日经济新闻交叉验证
- 虎嗅《模型趋同之后,Agent 的"手脚、工作台和账本"值钱了》(2026-08-11)
本文不构成投资建议。数据截止:2026-08-13。
