您的位置 首页 大模型测评

DeepSeek Harness深度测评:一切皆插件的Agent运行时如何重塑AI编程

💜 火山引擎 · 专属邀请

🎁 注册领免费Token
🤖 豆包大模型 新用户领50万Token
💻 DeepSeek系列 单模型日赠500万额度
📊 全模型支持 语音/视觉/向量全可用
💡 新用户注册领模型资源包
✅ 零门槛体验主流大模型推理服务
✅ 支持语音/图像/向量多场景调用
🎯 长期免费额度持续可用
💎 福利说明:新用户注册并关联账号,即可领取免费Token额度
立即注册 领免费Token →
扫码领取福利 扫码咨询 领取免费Token

2026年8月13日,DeepSeek在发布V4 Pro正式版的同时开源了首款Agent产品——DeepSee…

DeepSeek Harness深度测评封面

2026年8月13日,DeepSeek在发布V4 Pro正式版的同时开源了首款Agent产品——DeepSeek Harness(简称DSH,命令行名dsh)。MIT协议、一切皆插件、三天GitHub星标突破10万、社区插件仓库超1000个。这不是简单的”DeepSeek版Claude Code”,而是一套基于Cordis依赖注入内核的可重组Agent运行时,将模型、工具、会话、沙箱、循环、调度乃至UI全部拆解为可自由替换的插件。本文基于最新开源仓库、官方文档、社区实测和Composio第三方横评数据,对DeepSeek Harness进行全面深度测评。


一、产品定位:不是DeepSeek版Codex,是Agent运行时

如果把AI模型比作一匹马,Harness就是你驾驭这匹马所需要的全部工程装备。模型是大脑,负责思考与生成;Harness是手脚和工具,负责让AI真正操作文件、执行命令、调用服务,把一件任务从头做到尾。DeepSeek在2025年和2026年初一直被定位为”模型公司”——以性价比震惊市场。这次发布标志着战略转向:DeepSeek不再只卖大脑,开始建造身体。

据报道,DeepSeek于2026年3月聘请了前Jane Street工程师崔天宇专门领导Harness开发,表明这是一次有预谋、有资源的战略投入而非仓促的副产品。选择MIT协议开源而非闭源,延续了DeepSeek以免费+低门槛策略获取生态主导权的打法——与其在单一基准测试周期中获胜,不如成为开发者默认使用的框架。


二、八层可替换架构:一切皆插件的真实含义

“Everything is a plugin”不是营销话术,而是字面意思。DSH将Agent运行时拆解为八个独立可替换的层,全部通过Cordis依赖注入系统连接。整个产品由50多个独立的Cordis插件构成,所有插件地位完全平等,不存在任何特权核心——没有不可或缺、无法替换的底层核心代码。

层级覆盖范围可替换性
推理层(Inference)模型适配器和词汇表处理(ctx.llm)支持40+家模型提供商
工具层(Tools)工具注册表、模式定义、策略执行、结果处理工具可自由增减
状态层(State)仅追加的会话事件日志,支持持久化、回放和分叉可切换存储后端
控制层(Control)Agent注册表和循环驱动器——目标、轮次、步骤管理Agent循环本身可替换
执行层(Execution)文件系统、Shell、子进程、终端和沙箱提供者沙箱方案可选
组合层(Composition)配置文件、打包、补丁和运行时覆盖Agent配置可自由组装
体验层(Experience)内置Web应用、对话节点和设置界面UI可完全替换
框架层(Framework)Cordis本身——依赖注入系统,支持可逆注册连DI底层都能换

2.1 Cordis内核:从QQ机器人到Agent框架

Cordis是从Koishi(国内老牌QQ机器人框架)中抽出来的微内核,作者是GitHub上的Shigma。它只管三件事:加载插件、卸载插件、管理插件之间的依赖,本身不提供任何Agent能力。核心技术叫”可逆副作用”——每个插件注册时产生的所有副作用都会被追踪,卸载时自动回收,不留垃圾、不漏内存。翻译成使用体验就是热插拔:装插件、卸插件、换整套UI,都不用重启。

Cordis配套论文《A Programming Paradigm for Spatiotemporal Composability》(面向时空可组合性的编程范式)由DeepSeek联合北京大学研发,赋予了这套架构学术可信度。独立技术评测认为,DeepSeek Harness在组合性方面比OpenCode更灵活、比Pi的非模块化核心更激进——它是目前最彻底的插件化Agent框架。


三、四种工作模式:从极简测试到创造插件

模式核心特点开箱工具适合谁
标准模式工具最全,开箱即用文件编辑、Shell、搜索、Skills、规划、子Agent绝大多数人,默认推荐
PTC模式程序化工具调用,模型写代码编排多次调用Code Mode SDK,十次来回合并成一次执行批量自动化、Token成本敏感用户
极简模式最小工具集,减少干扰仅一个持久bash+一个文件编辑器官方跑模型基准测试用
创造模式AI可检查和改装自身运行时允许Agent检查插件环境,现场生成新工具开发自定义插件和Agent的进阶玩家

实测中,AI在创造模式下生成了一个”统计汉字个数”的工具,耗时约3分钟,当场可用。另有媒体测试让DSH创建一个名为”事实核查员”的Agent,专门检查文章里的事实错误,约11分钟完成创建,新会话中可直接调用。DeepSeek自己用极简模式测试了V4-Flash模型——这本身就是对其工具链的自用验证。

建议:第一次使用先开极简模式,让它在一个小目录里干一件简单的活,感受它的节奏;熟悉了再切标准模式。PTC和创造模式等你想折腾插件的时候再碰。Node.js版本必须22.19+或24+,低版本会报一堆看不懂的错。


四、插件生态爆发:3天1000+仓库,广告与去广告同时存在

社区反应速度令人惊叹。8月13日当晚实测时一个目录收录了288个插件仓库;到8月14日,GitHub上打dsh-plugin标签的仓库已超过1000个。目前已有两个主要插件目录:awesome-deepseek-harness(0xsline维护,带安装命令)和Awesome DSH Plugin(中英双语,分类更细)。

4.1 必装插件Top 10

#插件名功能
1iPolloWork Design Studio画布式可视化文档编辑器,原生集成在DSH对话中
2Mirage DSH统一挂载本地目录、内存存储和远程资源到路径树
3DSH Web UI任务看板、Git图谱、手机远程、Token统计全家桶
4Modlens截图/图表转OCR文本+布局信息,给纯文本模型加”眼睛”
5DSH TUIClaude Code风格全屏终端,流式输出+TPS表
6DSH Better Sidebar侧边栏改造成工作台:文件编辑器+终端+Git面板
7DSH Vision Toolkit图片问答、长截图OCR、UI还原、像素对比
8DSH Agent Teams创建Agent团队、分配任务、共享状态——多Agent协作
9Graph Memory跨会话图结构记忆,支持PageRank、社区检测、向量搜索
10DSH Ads给界面加复古中文网站风格广告(已有人做了屏蔽插件)

最绝的是DSH Ads这个插件——给Web界面加上复古中文网站风格的广告和弹窗。按实测报道,目录里紧挨着一个专门屏蔽它的插件。广告是插件,去广告也是插件,生态自己先完成了一轮攻防。此外还有远程渠道插件(QQ机器人、微信bot、飞书bot、企业微信bot、Telegram),装上后DSH就变成在各平台被@的机器人。沙箱也有多种社区隔离方案可选,从轻量容器到内核级强制访问控制都有。


五、缓存经济学:99%命中率的架构必然性

DSH最惊人的实测数据来自缓存命中率。有开发者跑了一个插件开发任务:6轮、115步、LLM累计思考16分20秒,输入15.4M Token,缓存命中99%——1540万输入Token里只有不到1%是真正新发给模型的。更有网友用它生成小程序,14.5M Token,缓存命中率高达99.9%,最后只花了5毛钱。同一任务对比:Codex花了7块多,DSH只要2块左右。

99%的命中率不是手动调出来的,而是DSH架构天然喂出来的:系统提示词、工具定义、已注入的Skill、会话历史全部排在消息序列最前面,且只要不在中途切模型/切模式,它们字节级不变——这就是前缀缓存最理想的命中对象。这是”模型+Harness一起设计”带来的结构性优势,第三方Agent框架难以复制。

但需要注意的是,V4 Pro从8月16日起实行峰谷定价。高峰时段输出从每百万Token 6元涨到27元(约4.5倍),空闲时段为高峰的一半。独立分析发现,即使空闲时段也是旧价的2.28倍,高峰时段是4.55倍——这是真正涨价而非折扣重组。但99%的缓存命中率意味着实际成本只有全miss的零头,缓存就是省钱的命根子。

计费项低谷价格(元/M)高峰价格(元/M)旧价
缓存命中输入0.30.30.025
缓存未命中输入393
输出8276

六、实测报告:能干活,但得盯着

6.1 简单任务:几乎无差距

让标准模式和极简模式分别制作一个咖啡馆网页,结果几乎没拉开差距。标准模式选了棕色主视觉,极简模式用了墨绿色,但页面结构、功能模块和交互都比较接近。至少在简单任务里,工具更多并不等于结果一定更好。

6.2 复杂任务:上限不低,但需人工验收

让DSH用Three.js制作鲁布·戈德堡机关(金属球滚下斜坡→撞倒多米诺骨牌→触发摆锤→弹起小方块)。第一版因果链就断了——小球没滚下来,骨牌却自己倒了。指出问题后,第二版修正了物理效果。更复杂的3D机械陀飞轮测试中,DSH跑了40多分钟,最终交付了打不开的成品——因为两个任务在同一文件夹运行,另一个任务覆盖了陀飞轮的首页文件。排除问题后,成品完成度较高。

6.3 横向对比:同一模型,三种工具

任务DSHCodexWorkBuddy
数据看板首次2.5h未完成;加视觉插件后3分钟完成,数据最全约8分钟完成,部分数字重叠约30分钟,图表渲染错误
3D滑索游戏约13分钟交付最快,但角色没挂在绳索上未测试约23分钟,首次交付空白页

七、Composio 8框架横评:Harness本身已成为评测变量

第三方AI基础设施公司Composio于2026年8月做了一组对照测试:把同一个DeepSeek V4-Flash模型分别接入8套不同Agent框架,跑同一批30个真实多步任务。结果证明Harness本身已成为评测变量——同一个模型在不同框架下的成功率可以从47%到67%,差距比换一个模型还大。

指标最佳最差差距
任务通过率Pi Agent 67%OpenCode 47%20个百分点
每成功任务成本Pi Agent 约$0.028Claude Code 约$0.195近7倍
中位完成时间Claude Code 122.7sOh My Pi 272.4s2.2倍

这组数据揭示了一个行业级结论:当模型能力趋同时,Agent框架(即Harness)对最终产出质量的影响可能比模型选择更大。这解释了为什么DeepSeek在发布模型的同时要开源Agent运行时——因为”模型+Harness打包”的垂直整合才是2026年AI竞争的核心维度。


八、竞品对比:DSH vs Claude Code vs Codex

维度DeepSeek HarnessClaude CodeOpenAI Codex
模型绑定V4系列+40家提供商绑定Claude绑定GPT
开源程度MIT全开源+论文闭源CLIApache 2.0(云端API)
运行环境本地/自托管本地终端云端沙箱
扩展方式一切皆插件(含主循环)hooks+MCP有限扩展
会话审计轨迹视图,可逐字节重建消息树,不可还原云端
数据隐私全部在本地本地(需上传API)云端处理
插件生态1000+社区仓库(3天)有限有限
缓存优化99%命中率(架构天然)未公开未公开
成熟度v0.1.0-rc.5(预览版)多年生产验证成熟

DSH用灵活性和开放性交换了Claude Code的成熟度和产品打磨。想完全掌控Agent技术栈、或需要在单一界面后运行多个模型提供商的团队,DSH提供了Claude Code设计上不具备的灵活性。但想要一个有长期生产验证记录的成品产品,目前Claude Code仍是更稳妥的选择。


九、优缺点总结

优势

  • 架构最彻底的插件化:8层全部可替换,连依赖注入底层本身都能换,目前最激进的模块化Agent框架
  • 99%缓存命中率:架构天然产生前缀缓存最优命中,成本仅为Codex的三分之一到七分之一
  • 全程轨迹审计:每次运行可逐字节重建,开发者可回到模型当时看到的真实上下文定位问题
  • 模型无关:支持40+家提供商,切换模型是配置变更而非代码重写
  • MIT协议无限制:可fork、可商用、可二次开发,无任何商业限制
  • 插件生态爆发:3天1000+社区仓库,覆盖工具、UI、远程渠道、安全、记忆等全场景
  • 数据完全本地:数据不出境,适合国企/军工/金融等合规场景

短板

  • 仍是预览版:v0.1.0-rc.5,明确警告会有破坏性变更,不适合直接用于生产环境
  • 沙箱默认不强制:支持沙箱提供者,但安全配置是部署选择而非强制默认
  • V4 Pro基准为自报数据:大幅提升的方向可信(跨5项一致),但精确幅度未经第三方独立验证
  • 安全披露较薄:无针对Harness本身的模型卡或前沿安全框架评估,薄于Google/Anthropic同类工具
  • 复杂任务需人工验收:鲁布·戈德堡机关第一版因果链断裂、3D陀飞轮文件被覆盖——长任务和并行执行仍存在可靠性问题
  • API涨价在即:V4 Pro峰谷定价后实际成本是旧价的2.28-4.55倍,尽管缓存命中率高,但非Agent场景成本上升明显
  • 项目新、大规模验证不足:不同于Claude Code多年生产验证,Harness发布仅数天

注意:DSH目前处于开发者预览阶段,明确警告会有API破坏性变更。生产环境部署应预期需要持续追踪breaking changes,而非将当前API视为稳定。Node.js必须22.19+或24+版本,低版本会报不明确错误。Windows用户优先使用Web UI模式。


十、行业意义:AI竞争从”谁的模型更聪明”到”谁的系统能干活”

DeepSeek Harness的发布标志着AI行业竞争焦点的根本转移。Composio的8框架横评数据证明了一个关键事实:同一个模型在不同框架下的成功率差距(47%-67%)比换一个模型还大。这意味着Agent运行时本身已成为影响最终产出质量的核心变量——不再是”谁的模型更聪明”,而是”谁的Harness更高效地组装模型、工具和上下文”。

DeepSeek的垂直整合策略——V4 Pro模型+Harness运行时+MIT开源+插件生态——与Claude有Code、OpenAI有Codex、xAI有Cursor的趋势一致:各家都在向”模型+Agent框架”的垂直整合方向走。DeepSeek的独特之处在于选择了最彻底的开放:MIT协议全开源、模型无关、一切皆插件。这是一个赌注:成为开发者默认使用的Agent基础设施,比赢得任何单一基准测试周期更重要。


写在最后:DeepSeek Harness是2026年AI行业最具架构野心的Agent框架发布。它不是在Claude Code后面追赶,而是选择了一条完全不同的路:将Agent运行时的每一层——从模型推理到工具调用,从会话状态到UI界面——全部拆解为可自由替换的插件,连依赖注入底层本身都不例外。99%的缓存命中率、3天1000+社区插件、Composio横评证明的框架级影响力——这些数据共同说明一个事实:当模型能力趋同时,Harness(Agent运行时)正在成为决定最终产出质量的核心变量。对于想完全掌控Agent技术栈、需要模型无关性、或需要私有化部署的开发者,DSH是目前最灵活的选择。但它的短板同样明确:预览版阶段、安全披露较薄、复杂任务仍需人工验收。DSH不是”完成品”,而是”基础设施”——DeepSeek不是在卖一个产品,而是在铺设一块让其他人建造城市的地基。


延伸阅读

本文来自网络,不代表无矩AI立场,转载请注明出处:https://iaipie.com/deepseek-harness%e6%b7%b1%e5%ba%a6%e6%b5%8b%e8%af%84%ef%bc%9a%e4%b8%80%e5%88%87%e7%9a%86%e6%8f%92%e4%bb%b6%e7%9a%84agent%e8%bf%90%e8%a1%8c%e6%97%b6%e5%a6%82%e4%bd%95%e9%87%8d%e5%a1%91ai%e7%bc%96/

作者: ncomer

🤖 阿里云 · 大模型 AI 套餐

通义千问 + HappyHorse 视频生成 + 百炼平台一站式部署

🎁 通过本链接额外 15% 优惠 🎬 HappyHorse 视频模型 | 💬 通义千问 | ☁️ 百炼平台

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

联系我们

联系我们

0890-88881680

在线咨询: QQ交谈

邮箱: 23935379@qq.com

工作时间:周一至周五,9:00-17:30,节假日休息

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部