
2026年8月13日,DeepSeek在发布V4 Pro正式版的同时开源了首款Agent产品——DeepSeek Harness(简称DSH,命令行名dsh)。MIT协议、一切皆插件、三天GitHub星标突破10万、社区插件仓库超1000个。这不是简单的”DeepSeek版Claude Code”,而是一套基于Cordis依赖注入内核的可重组Agent运行时,将模型、工具、会话、沙箱、循环、调度乃至UI全部拆解为可自由替换的插件。本文基于最新开源仓库、官方文档、社区实测和Composio第三方横评数据,对DeepSeek Harness进行全面深度测评。
一、产品定位:不是DeepSeek版Codex,是Agent运行时
如果把AI模型比作一匹马,Harness就是你驾驭这匹马所需要的全部工程装备。模型是大脑,负责思考与生成;Harness是手脚和工具,负责让AI真正操作文件、执行命令、调用服务,把一件任务从头做到尾。DeepSeek在2025年和2026年初一直被定位为”模型公司”——以性价比震惊市场。这次发布标志着战略转向:DeepSeek不再只卖大脑,开始建造身体。
据报道,DeepSeek于2026年3月聘请了前Jane Street工程师崔天宇专门领导Harness开发,表明这是一次有预谋、有资源的战略投入而非仓促的副产品。选择MIT协议开源而非闭源,延续了DeepSeek以免费+低门槛策略获取生态主导权的打法——与其在单一基准测试周期中获胜,不如成为开发者默认使用的框架。
核心定位:DeepSeek Harness不是”DeepSeek版Claude Code”——Claude Code是一台装好的Mac,核心系统定死;DSH是一台能自己换主板、换显卡、换操作系统的DIY PC。Claude Code和Codex的定制化局限于表层参数调整,DSH的定制化延伸到依赖注入层本身。
二、八层可替换架构:一切皆插件的真实含义
“Everything is a plugin”不是营销话术,而是字面意思。DSH将Agent运行时拆解为八个独立可替换的层,全部通过Cordis依赖注入系统连接。整个产品由50多个独立的Cordis插件构成,所有插件地位完全平等,不存在任何特权核心——没有不可或缺、无法替换的底层核心代码。
| 层级 | 覆盖范围 | 可替换性 |
|---|---|---|
| 推理层(Inference) | 模型适配器和词汇表处理(ctx.llm) | 支持40+家模型提供商 |
| 工具层(Tools) | 工具注册表、模式定义、策略执行、结果处理 | 工具可自由增减 |
| 状态层(State) | 仅追加的会话事件日志,支持持久化、回放和分叉 | 可切换存储后端 |
| 控制层(Control) | Agent注册表和循环驱动器——目标、轮次、步骤管理 | Agent循环本身可替换 |
| 执行层(Execution) | 文件系统、Shell、子进程、终端和沙箱提供者 | 沙箱方案可选 |
| 组合层(Composition) | 配置文件、打包、补丁和运行时覆盖 | Agent配置可自由组装 |
| 体验层(Experience) | 内置Web应用、对话节点和设置界面 | UI可完全替换 |
| 框架层(Framework) | Cordis本身——依赖注入系统,支持可逆注册 | 连DI底层都能换 |
2.1 Cordis内核:从QQ机器人到Agent框架
Cordis是从Koishi(国内老牌QQ机器人框架)中抽出来的微内核,作者是GitHub上的Shigma。它只管三件事:加载插件、卸载插件、管理插件之间的依赖,本身不提供任何Agent能力。核心技术叫”可逆副作用”——每个插件注册时产生的所有副作用都会被追踪,卸载时自动回收,不留垃圾、不漏内存。翻译成使用体验就是热插拔:装插件、卸插件、换整套UI,都不用重启。
Cordis配套论文《A Programming Paradigm for Spatiotemporal Composability》(面向时空可组合性的编程范式)由DeepSeek联合北京大学研发,赋予了这套架构学术可信度。独立技术评测认为,DeepSeek Harness在组合性方面比OpenCode更灵活、比Pi的非模块化核心更激进——它是目前最彻底的插件化Agent框架。
三、四种工作模式:从极简测试到创造插件
| 模式 | 核心特点 | 开箱工具 | 适合谁 |
|---|---|---|---|
| 标准模式 | 工具最全,开箱即用 | 文件编辑、Shell、搜索、Skills、规划、子Agent | 绝大多数人,默认推荐 |
| PTC模式 | 程序化工具调用,模型写代码编排多次调用 | Code Mode SDK,十次来回合并成一次执行 | 批量自动化、Token成本敏感用户 |
| 极简模式 | 最小工具集,减少干扰 | 仅一个持久bash+一个文件编辑器 | 官方跑模型基准测试用 |
| 创造模式 | AI可检查和改装自身运行时 | 允许Agent检查插件环境,现场生成新工具 | 开发自定义插件和Agent的进阶玩家 |
实测中,AI在创造模式下生成了一个”统计汉字个数”的工具,耗时约3分钟,当场可用。另有媒体测试让DSH创建一个名为”事实核查员”的Agent,专门检查文章里的事实错误,约11分钟完成创建,新会话中可直接调用。DeepSeek自己用极简模式测试了V4-Flash模型——这本身就是对其工具链的自用验证。
建议:第一次使用先开极简模式,让它在一个小目录里干一件简单的活,感受它的节奏;熟悉了再切标准模式。PTC和创造模式等你想折腾插件的时候再碰。Node.js版本必须22.19+或24+,低版本会报一堆看不懂的错。
四、插件生态爆发:3天1000+仓库,广告与去广告同时存在
社区反应速度令人惊叹。8月13日当晚实测时一个目录收录了288个插件仓库;到8月14日,GitHub上打dsh-plugin标签的仓库已超过1000个。目前已有两个主要插件目录:awesome-deepseek-harness(0xsline维护,带安装命令)和Awesome DSH Plugin(中英双语,分类更细)。
4.1 必装插件Top 10
| # | 插件名 | 功能 |
|---|---|---|
| 1 | iPolloWork Design Studio | 画布式可视化文档编辑器,原生集成在DSH对话中 |
| 2 | Mirage DSH | 统一挂载本地目录、内存存储和远程资源到路径树 |
| 3 | DSH Web UI | 任务看板、Git图谱、手机远程、Token统计全家桶 |
| 4 | Modlens | 截图/图表转OCR文本+布局信息,给纯文本模型加”眼睛” |
| 5 | DSH TUI | Claude Code风格全屏终端,流式输出+TPS表 |
| 6 | DSH Better Sidebar | 侧边栏改造成工作台:文件编辑器+终端+Git面板 |
| 7 | DSH Vision Toolkit | 图片问答、长截图OCR、UI还原、像素对比 |
| 8 | DSH Agent Teams | 创建Agent团队、分配任务、共享状态——多Agent协作 |
| 9 | Graph Memory | 跨会话图结构记忆,支持PageRank、社区检测、向量搜索 |
| 10 | DSH Ads | 给界面加复古中文网站风格广告(已有人做了屏蔽插件) |
最绝的是DSH Ads这个插件——给Web界面加上复古中文网站风格的广告和弹窗。按实测报道,目录里紧挨着一个专门屏蔽它的插件。广告是插件,去广告也是插件,生态自己先完成了一轮攻防。此外还有远程渠道插件(QQ机器人、微信bot、飞书bot、企业微信bot、Telegram),装上后DSH就变成在各平台被@的机器人。沙箱也有多种社区隔离方案可选,从轻量容器到内核级强制访问控制都有。
五、缓存经济学:99%命中率的架构必然性
DSH最惊人的实测数据来自缓存命中率。有开发者跑了一个插件开发任务:6轮、115步、LLM累计思考16分20秒,输入15.4M Token,缓存命中99%——1540万输入Token里只有不到1%是真正新发给模型的。更有网友用它生成小程序,14.5M Token,缓存命中率高达99.9%,最后只花了5毛钱。同一任务对比:Codex花了7块多,DSH只要2块左右。
99%的命中率不是手动调出来的,而是DSH架构天然喂出来的:系统提示词、工具定义、已注入的Skill、会话历史全部排在消息序列最前面,且只要不在中途切模型/切模式,它们字节级不变——这就是前缀缓存最理想的命中对象。这是”模型+Harness一起设计”带来的结构性优势,第三方Agent框架难以复制。
但需要注意的是,V4 Pro从8月16日起实行峰谷定价。高峰时段输出从每百万Token 6元涨到27元(约4.5倍),空闲时段为高峰的一半。独立分析发现,即使空闲时段也是旧价的2.28倍,高峰时段是4.55倍——这是真正涨价而非折扣重组。但99%的缓存命中率意味着实际成本只有全miss的零头,缓存就是省钱的命根子。
| 计费项 | 低谷价格(元/M) | 高峰价格(元/M) | 旧价 |
|---|---|---|---|
| 缓存命中输入 | 0.3 | 0.3 | 0.025 |
| 缓存未命中输入 | 3 | 9 | 3 |
| 输出 | 8 | 27 | 6 |
六、实测报告:能干活,但得盯着
6.1 简单任务:几乎无差距
让标准模式和极简模式分别制作一个咖啡馆网页,结果几乎没拉开差距。标准模式选了棕色主视觉,极简模式用了墨绿色,但页面结构、功能模块和交互都比较接近。至少在简单任务里,工具更多并不等于结果一定更好。
6.2 复杂任务:上限不低,但需人工验收
让DSH用Three.js制作鲁布·戈德堡机关(金属球滚下斜坡→撞倒多米诺骨牌→触发摆锤→弹起小方块)。第一版因果链就断了——小球没滚下来,骨牌却自己倒了。指出问题后,第二版修正了物理效果。更复杂的3D机械陀飞轮测试中,DSH跑了40多分钟,最终交付了打不开的成品——因为两个任务在同一文件夹运行,另一个任务覆盖了陀飞轮的首页文件。排除问题后,成品完成度较高。
6.3 横向对比:同一模型,三种工具
| 任务 | DSH | Codex | WorkBuddy |
|---|---|---|---|
| 数据看板 | 首次2.5h未完成;加视觉插件后3分钟完成,数据最全 | 约8分钟完成,部分数字重叠 | 约30分钟,图表渲染错误 |
| 3D滑索游戏 | 约13分钟交付最快,但角色没挂在绳索上 | 未测试 | 约23分钟,首次交付空白页 |
关键发现:自己的模型配自己的Harness,确实比硬套别人家的壳顺手。V4 Pro虽然也提供了Codex、Claude Code的接入文档,但那是适配别人的协议和交互;在DSH里,模型、工具、缓存、Trajectory日志是一套一起设计的。
七、Composio 8框架横评:Harness本身已成为评测变量
第三方AI基础设施公司Composio于2026年8月做了一组对照测试:把同一个DeepSeek V4-Flash模型分别接入8套不同Agent框架,跑同一批30个真实多步任务。结果证明Harness本身已成为评测变量——同一个模型在不同框架下的成功率可以从47%到67%,差距比换一个模型还大。
| 指标 | 最佳 | 最差 | 差距 |
|---|---|---|---|
| 任务通过率 | Pi Agent 67% | OpenCode 47% | 20个百分点 |
| 每成功任务成本 | Pi Agent 约$0.028 | Claude Code 约$0.195 | 近7倍 |
| 中位完成时间 | Claude Code 122.7s | Oh My Pi 272.4s | 2.2倍 |
这组数据揭示了一个行业级结论:当模型能力趋同时,Agent框架(即Harness)对最终产出质量的影响可能比模型选择更大。这解释了为什么DeepSeek在发布模型的同时要开源Agent运行时——因为”模型+Harness打包”的垂直整合才是2026年AI竞争的核心维度。
八、竞品对比:DSH vs Claude Code vs Codex
| 维度 | DeepSeek Harness | Claude Code | OpenAI Codex |
|---|---|---|---|
| 模型绑定 | V4系列+40家提供商 | 绑定Claude | 绑定GPT |
| 开源程度 | MIT全开源+论文 | 闭源CLI | Apache 2.0(云端API) |
| 运行环境 | 本地/自托管 | 本地终端 | 云端沙箱 |
| 扩展方式 | 一切皆插件(含主循环) | hooks+MCP | 有限扩展 |
| 会话审计 | 轨迹视图,可逐字节重建 | 消息树,不可还原 | 云端 |
| 数据隐私 | 全部在本地 | 本地(需上传API) | 云端处理 |
| 插件生态 | 1000+社区仓库(3天) | 有限 | 有限 |
| 缓存优化 | 99%命中率(架构天然) | 未公开 | 未公开 |
| 成熟度 | v0.1.0-rc.5(预览版) | 多年生产验证 | 成熟 |
DSH用灵活性和开放性交换了Claude Code的成熟度和产品打磨。想完全掌控Agent技术栈、或需要在单一界面后运行多个模型提供商的团队,DSH提供了Claude Code设计上不具备的灵活性。但想要一个有长期生产验证记录的成品产品,目前Claude Code仍是更稳妥的选择。
九、优缺点总结
优势
- 架构最彻底的插件化:8层全部可替换,连依赖注入底层本身都能换,目前最激进的模块化Agent框架
- 99%缓存命中率:架构天然产生前缀缓存最优命中,成本仅为Codex的三分之一到七分之一
- 全程轨迹审计:每次运行可逐字节重建,开发者可回到模型当时看到的真实上下文定位问题
- 模型无关:支持40+家提供商,切换模型是配置变更而非代码重写
- MIT协议无限制:可fork、可商用、可二次开发,无任何商业限制
- 插件生态爆发:3天1000+社区仓库,覆盖工具、UI、远程渠道、安全、记忆等全场景
- 数据完全本地:数据不出境,适合国企/军工/金融等合规场景
短板
- 仍是预览版:v0.1.0-rc.5,明确警告会有破坏性变更,不适合直接用于生产环境
- 沙箱默认不强制:支持沙箱提供者,但安全配置是部署选择而非强制默认
- V4 Pro基准为自报数据:大幅提升的方向可信(跨5项一致),但精确幅度未经第三方独立验证
- 安全披露较薄:无针对Harness本身的模型卡或前沿安全框架评估,薄于Google/Anthropic同类工具
- 复杂任务需人工验收:鲁布·戈德堡机关第一版因果链断裂、3D陀飞轮文件被覆盖——长任务和并行执行仍存在可靠性问题
- API涨价在即:V4 Pro峰谷定价后实际成本是旧价的2.28-4.55倍,尽管缓存命中率高,但非Agent场景成本上升明显
- 项目新、大规模验证不足:不同于Claude Code多年生产验证,Harness发布仅数天
注意:DSH目前处于开发者预览阶段,明确警告会有API破坏性变更。生产环境部署应预期需要持续追踪breaking changes,而非将当前API视为稳定。Node.js必须22.19+或24+版本,低版本会报不明确错误。Windows用户优先使用Web UI模式。
十、行业意义:AI竞争从”谁的模型更聪明”到”谁的系统能干活”
DeepSeek Harness的发布标志着AI行业竞争焦点的根本转移。Composio的8框架横评数据证明了一个关键事实:同一个模型在不同框架下的成功率差距(47%-67%)比换一个模型还大。这意味着Agent运行时本身已成为影响最终产出质量的核心变量——不再是”谁的模型更聪明”,而是”谁的Harness更高效地组装模型、工具和上下文”。
DeepSeek的垂直整合策略——V4 Pro模型+Harness运行时+MIT开源+插件生态——与Claude有Code、OpenAI有Codex、xAI有Cursor的趋势一致:各家都在向”模型+Agent框架”的垂直整合方向走。DeepSeek的独特之处在于选择了最彻底的开放:MIT协议全开源、模型无关、一切皆插件。这是一个赌注:成为开发者默认使用的Agent基础设施,比赢得任何单一基准测试周期更重要。
写在最后:DeepSeek Harness是2026年AI行业最具架构野心的Agent框架发布。它不是在Claude Code后面追赶,而是选择了一条完全不同的路:将Agent运行时的每一层——从模型推理到工具调用,从会话状态到UI界面——全部拆解为可自由替换的插件,连依赖注入底层本身都不例外。99%的缓存命中率、3天1000+社区插件、Composio横评证明的框架级影响力——这些数据共同说明一个事实:当模型能力趋同时,Harness(Agent运行时)正在成为决定最终产出质量的核心变量。对于想完全掌控Agent技术栈、需要模型无关性、或需要私有化部署的开发者,DSH是目前最灵活的选择。但它的短板同样明确:预览版阶段、安全披露较薄、复杂任务仍需人工验收。DSH不是”完成品”,而是”基础设施”——DeepSeek不是在卖一个产品,而是在铺设一块让其他人建造城市的地基。
延伸阅读
- 2026年8月17日AI行业资讯速览 — 回顾近期AI行业每日资讯,掌握DeepSeek及相关技术发展脉络
- 2026年8月16日AI行业资讯速览 — 回顾近期AI行业每日资讯,掌握DeepSeek及相关技术发展脉络
- 2026年8月15日AI行业资讯速览 — 回顾近期AI行业每日资讯,掌握DeepSeek及相关技术发展脉络
- DeepSeek编程Agent选型指南:2026年8月主流编程Agent横向深度测评 — 了解DeepSeek V4 Pro在主流编程Agent中的横向对比和选型建议
- 2026年8月14日AI行业资讯速览 — 回顾近期AI行业每日资讯,掌握DeepSeek及相关技术发展脉络
