DeepSeek Harness 原生 Agent 框架首发深度评测:从安装到实战,3 小时压测全记录

简介: DeepSeek Harness是其全新Agent执行框架,支持四种运行模式、插件化扩展与Web UI。实测显示任务质量媲美Claude,但效率与稳定性待优化。目前处于公测阶段,潜力巨大。

DeepSeek 这次玩了个大的。梁圣上午刚发 V4 Pro 正式版,晚上 Harness 就跟进了。模型和编排框架同日上线,这节奏确实不给人留缓冲期。

我花 3 小时把 DeepSeek Harness 从头到尾跑了一遍,以下是实测报告。

一、快速上手指南
安装命令很直接,通过 npm 官方包即可获取:

npm install @deepseek-ai/dsh
实测安装版本为 0.1.0-rc.6。安装完成后,可通过以下命令验证:

dsh --help
dsh --profile headless "your task"
dsh web
dsh web 会启动 Web UI,浏览器中即可访问图形化界面。

二、核心功能架构解析
Harness 的定位很清晰——一套完整的 Agent 执行框架。从功能模块来看,它覆盖了 Agent 落地的全部核心能力:

文件系统操作:读取和修改工作区文件
命令执行:在沙箱环境中运行 Shell 命令
网络检索:搜索网页、调用外部工具
Skills 管理:可插拔的技能扩展机制
任务编排:计划管理、上下文维护、多子代理协同
会话与权限:会话追踪、权限控制、运行轨迹记录
界面设计走的是极简路线,但功能入口一个不少。

三、四种运行模式:该选哪个?
这是 Harness 最有意思的设计——四种模式覆盖了从通用到专用的全部场景:

模式
定位
适用场景
标准模式
全能均衡型,功能最完整
默认首选,覆盖 90% 日常需求
PTC 模式
标准模式 + TypeScript 程序化工具调用
批量任务、多步骤重复操作
极简模式
仅 Bash + str_replace_editor
纯本地代码修改,不要花哨功能
创造模式
自定义 Agent 预设的元模式
打造专属 Agent,面向特定场景
官方反复强调的设计理念是「一切皆插件」——模型、工具、Skills、会话、文件系统、沙箱、多 Agent 协作,甚至 UI 本身都可以拆开重组。比如你可以通过插件给 Harness 加一个任务进度面板,运行时直接显示在界面里,不用时随时停用。

这套架构的扩展性值得后续单独深挖。

四、实测 Case 1:3D 黑洞引力模拟器
统一使用 DeepSeek V4 Pro 模型,接入 Claude Harness、DeepSeek Harness 和 Hermes Harness 进行横向对比。

结果汇总:

Harness
耗时
效果评估
Claude Harness
25 min
视觉效果最佳,交互需求全部实现
DeepSeek Harness
40 min
视觉效果炫酷,黑洞质量/时间/速度变化丝滑
Hermes Harness
42 min
效果零散,细节缺失
这个 Case 的关键结论是:Harness 本身对模型任务执行的影响显著。同样的模型、不同的编排框架,输出质量存在实质差异。

DeepSeek Harness 在速度上与 Claude 还有差距,但效果基本持平。考虑到当前还是预览版,这个表现已经超出预期。

五、实测 Case 2:创造模式实战——门店宣传助手
创造模式的核心逻辑是:先配 Agent,再让 Agent 干活。我把这个模式跑了一遍,验证它能不能落地。

预设配置:创建了一个面向小店老板(不懂代码)的宣传网页生成 Agent,以标准模式为基础,保留文件读写、命令执行、网页检索等能力,额外约束了三点:

开始前最多问 3 个关键问题(店名、主营产品、宣传风格)
网页必须适配手机浏览
完成后自动启动检查并反馈文件清单
踩坑实录:任务执行过程中,Agent 一度陷入 Bash noop 死循环——思考链里已经意识到应该调用 preset_ops,但下一步又回到同一个占位动作。手动终止后追问原因,它改用文件系统路径继续操作,最终生成了预设文件并通过加载检查。

最终效果:新建会话后,「门店宣传助手」直接出现在模式选择列表中。我只给了一句不完整的需求("帮我给新开的甜品店做一个宣传网页"),它主动补问了 3 个关键信息,完成网页生成+检查,总用时 3 分钟。

创造模式的价值判断:偶尔做一次网页,标准模式足够。但如果你经常处理同类任务(比如每周给不同客户出宣传页),预设好规则后每次都能省掉重复沟通成本。适合创作者、小团队,以及想研究 Agent 工具链配置的人。

六、实测 Case 3:复杂数据处理压测
最后跑了一个数据量较大的处理任务。将 DeepSeek V4 Pro 分别接入 WorkBuddy 和原生 Harness,执行几乎相同的任务。

WorkBuddy(处理四川卷下) :33 分钟完成,不仅跑通了流程,还主动发现了已有处理流程中的问题并给出修改建议。

DeepSeek 原生 Harness(处理四川卷上) :跑了 20 分钟后报错中断,重新继续后总计耗时近 50 分钟完成。产出数据质量与前者一致,没问题。

坦白说,这个结果没达到预期。原本以为模型接入自家框架会有加成,实际在稳定性(首次报错)和执行效率(50min vs 33min)上都不如接入成熟平台。

七、总结与展望
三小时测下来,我对 DeepSeek Harness 的判断是这样的:

亮点:

四种模式的设计思路清晰,覆盖场景完整
「一切皆插件」的架构理念扩展性强
创造模式确实能落地,不是噱头
任务执行质量没问题,效果与 Claude 持平
待改进:

执行效率明显偏低(同样任务比成熟平台慢 30-50%)
稳定性有隐患(复杂任务首次执行报错)
个别场景存在死循环问题
DeepSeek 官方明确表示当前是公测阶段。模型能力已经证明了上限,Harness 需要的是时间打磨稳定性和效率。我会持续关注正式版的表现。

相关文章
|
22天前
|
缓存 JavaScript Shell
DeepSeek Harness 终于来了:开源,一切皆插件
DeepSeek Harness 开源首夜我装好了。本文给四种下载方式、四模式区别、插件生态实测,以及一段 99% 缓存命中率的真实账单
DeepSeek Harness 终于来了:开源,一切皆插件
|
16天前
|
人工智能 JavaScript 测试技术
实测DeepSeek Harness:AI到底能替测试开发做多少工作?
本文实测DeepSeek Harness(dsh)在测试开发五大环节中的替代能力:需求解析(50%)、用例设计(70%)、脚本编写(60%)、执行调度(30%)、缺陷定位(40%),加权综合替代度约50%-67%。AI擅长重复劳动,判断力仍属人类。
|
15天前
|
人工智能 JavaScript 测试技术
DeepSeek Harness爆火,测试开发的下一个“版本答案”找到了!
DeepSeek于2026年8月开源Agent执行底座Harness,6天获16.7万星。它并非模型,而是“AI操作系统”:以插件化架构解耦模型与工具,支持多厂商LLM,实现“一切皆插件”。专为测试开发等工程场景设计,推动从写脚本到编排Agent的范式升级。
|
23天前
|
机器学习/深度学习 人工智能 缓存
Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分
Grok 4.6是xAI于2026年8月发布的1.5万亿参数大模型,专注长程智能体任务,AI指数61分追平GPT-5.6 Sol;回合效率领先(仅需53步),定价$2/$6(百万Token),但超20万Token即翻倍。
|
20天前
|
开发工具 Swift git
DeepSeek Harness 插件推荐:4 款开源神器让写代码直接起飞
DeepSeek Harness 插件推荐:ModLens 视觉、Web UI 全家桶、Mac 原生与 GenUI 渲染,4 款开源插件给纯文本模型补齐短板。
2144 7
DeepSeek Harness 插件推荐:4 款开源神器让写代码直接起飞
|
19天前
|
人工智能 架构师 测试技术
测试新人用Workbuddy写的用例,居然比3年老员工考虑的边界还全
Workbuddy赋能测试新人:无需比前辈更懂业务,只需更会“问”。上传PRD+一句指令,10分钟生成126条全覆盖用例(含边界、并发、多条件组合等老员工“没时间想”的场景),审核仅需1小时。工具差距,而非能力差距。
|
21天前
|
机器学习/深度学习 算法 5G
金融RAG实战:RRF融合算法如何让检索准确率提升40%
当RAG系统在监管审计时被问'这个答案是怎么检索出来的',向量检索给不出可复现的答案。本文从源码层面解析BM25+TF-IDF双路检索+RRF融合的算法原理,做到零向量依赖、确定性可复现、Hit@1=100%。
|
21天前
|
人工智能 架构师 测试技术
我把Claude Code接进测试仓库的第一天,它自动补齐了80%的单测缺口,覆盖率从41%跳到78%
本文分享某互联网公司测试架构师如何用Claude Code高效提升历史项目测试覆盖率:面对35万行代码、41%覆盖率的遗留系统,团队摒弃手写测试,转而“指挥”AI批量生成精准单元测试。四轮迭代后,覆盖率跃升至78%,新增1200+条高质量测试,人工投入降至0.5人天/周。核心在于“读报告→分模块→给规范→严审核”的AI协同范式。
|
1月前
|
人工智能 安全 测试技术
Skill 和 MCP 到底有什么区别?哪个更适合我
本文澄清Skill与MCP本质互补:MCP是AI连接外部系统的“USB-C协议”,解决“能不能连”;Skill是AI执行任务的“操作手册”,解决“会不会做”。二者分属底层通信与上层流程,非二选一。真实场景中常需协同使用。