DeepSeek 这次玩了个大的。梁圣上午刚发 V4 Pro 正式版,晚上 Harness 就跟进了。模型和编排框架同日上线,这节奏确实不给人留缓冲期。
我花 3 小时把 DeepSeek Harness 从头到尾跑了一遍,以下是实测报告。
一、快速上手指南
安装命令很直接,通过 npm 官方包即可获取:
npm install @deepseek-ai/dsh
实测安装版本为 0.1.0-rc.6。安装完成后,可通过以下命令验证:
dsh --help
dsh --profile headless "your task"
dsh web
dsh web 会启动 Web UI,浏览器中即可访问图形化界面。
二、核心功能架构解析
Harness 的定位很清晰——一套完整的 Agent 执行框架。从功能模块来看,它覆盖了 Agent 落地的全部核心能力:
文件系统操作:读取和修改工作区文件
命令执行:在沙箱环境中运行 Shell 命令
网络检索:搜索网页、调用外部工具
Skills 管理:可插拔的技能扩展机制
任务编排:计划管理、上下文维护、多子代理协同
会话与权限:会话追踪、权限控制、运行轨迹记录
界面设计走的是极简路线,但功能入口一个不少。
三、四种运行模式:该选哪个?
这是 Harness 最有意思的设计——四种模式覆盖了从通用到专用的全部场景:
模式
定位
适用场景
标准模式
全能均衡型,功能最完整
默认首选,覆盖 90% 日常需求
PTC 模式
标准模式 + TypeScript 程序化工具调用
批量任务、多步骤重复操作
极简模式
仅 Bash + str_replace_editor
纯本地代码修改,不要花哨功能
创造模式
自定义 Agent 预设的元模式
打造专属 Agent,面向特定场景
官方反复强调的设计理念是「一切皆插件」——模型、工具、Skills、会话、文件系统、沙箱、多 Agent 协作,甚至 UI 本身都可以拆开重组。比如你可以通过插件给 Harness 加一个任务进度面板,运行时直接显示在界面里,不用时随时停用。
这套架构的扩展性值得后续单独深挖。
四、实测 Case 1:3D 黑洞引力模拟器
统一使用 DeepSeek V4 Pro 模型,接入 Claude Harness、DeepSeek Harness 和 Hermes Harness 进行横向对比。
结果汇总:
Harness
耗时
效果评估
Claude Harness
25 min
视觉效果最佳,交互需求全部实现
DeepSeek Harness
40 min
视觉效果炫酷,黑洞质量/时间/速度变化丝滑
Hermes Harness
42 min
效果零散,细节缺失
这个 Case 的关键结论是:Harness 本身对模型任务执行的影响显著。同样的模型、不同的编排框架,输出质量存在实质差异。
DeepSeek Harness 在速度上与 Claude 还有差距,但效果基本持平。考虑到当前还是预览版,这个表现已经超出预期。
五、实测 Case 2:创造模式实战——门店宣传助手
创造模式的核心逻辑是:先配 Agent,再让 Agent 干活。我把这个模式跑了一遍,验证它能不能落地。
预设配置:创建了一个面向小店老板(不懂代码)的宣传网页生成 Agent,以标准模式为基础,保留文件读写、命令执行、网页检索等能力,额外约束了三点:
开始前最多问 3 个关键问题(店名、主营产品、宣传风格)
网页必须适配手机浏览
完成后自动启动检查并反馈文件清单
踩坑实录:任务执行过程中,Agent 一度陷入 Bash noop 死循环——思考链里已经意识到应该调用 preset_ops,但下一步又回到同一个占位动作。手动终止后追问原因,它改用文件系统路径继续操作,最终生成了预设文件并通过加载检查。
最终效果:新建会话后,「门店宣传助手」直接出现在模式选择列表中。我只给了一句不完整的需求("帮我给新开的甜品店做一个宣传网页"),它主动补问了 3 个关键信息,完成网页生成+检查,总用时 3 分钟。
创造模式的价值判断:偶尔做一次网页,标准模式足够。但如果你经常处理同类任务(比如每周给不同客户出宣传页),预设好规则后每次都能省掉重复沟通成本。适合创作者、小团队,以及想研究 Agent 工具链配置的人。
六、实测 Case 3:复杂数据处理压测
最后跑了一个数据量较大的处理任务。将 DeepSeek V4 Pro 分别接入 WorkBuddy 和原生 Harness,执行几乎相同的任务。
WorkBuddy(处理四川卷下) :33 分钟完成,不仅跑通了流程,还主动发现了已有处理流程中的问题并给出修改建议。
DeepSeek 原生 Harness(处理四川卷上) :跑了 20 分钟后报错中断,重新继续后总计耗时近 50 分钟完成。产出数据质量与前者一致,没问题。
坦白说,这个结果没达到预期。原本以为模型接入自家框架会有加成,实际在稳定性(首次报错)和执行效率(50min vs 33min)上都不如接入成熟平台。
七、总结与展望
三小时测下来,我对 DeepSeek Harness 的判断是这样的:
亮点:
四种模式的设计思路清晰,覆盖场景完整
「一切皆插件」的架构理念扩展性强
创造模式确实能落地,不是噱头
任务执行质量没问题,效果与 Claude 持平
待改进:
执行效率明显偏低(同样任务比成熟平台慢 30-50%)
稳定性有隐患(复杂任务首次执行报错)
个别场景存在死循环问题
DeepSeek 官方明确表示当前是公测阶段。模型能力已经证明了上限,Harness 需要的是时间打磨稳定性和效率。我会持续关注正式版的表现。