DeepSeek Harness 原生 Agent 框架首发深度评测:从安装到实战,3 小时压测全记录

简介: DeepSeek Harness是其全新Agent执行框架,支持四种运行模式、插件化扩展与Web UI。实测显示任务质量媲美Claude,但效率与稳定性待优化。目前处于公测阶段,潜力巨大。

DeepSeek 这次玩了个大的。梁圣上午刚发 V4 Pro 正式版,晚上 Harness 就跟进了。模型和编排框架同日上线,这节奏确实不给人留缓冲期。

我花 3 小时把 DeepSeek Harness 从头到尾跑了一遍,以下是实测报告。

一、快速上手指南
安装命令很直接,通过 npm 官方包即可获取:

npm install @deepseek-ai/dsh
实测安装版本为 0.1.0-rc.6。安装完成后,可通过以下命令验证:

dsh --help
dsh --profile headless "your task"
dsh web
dsh web 会启动 Web UI,浏览器中即可访问图形化界面。

二、核心功能架构解析
Harness 的定位很清晰——一套完整的 Agent 执行框架。从功能模块来看,它覆盖了 Agent 落地的全部核心能力:

文件系统操作:读取和修改工作区文件
命令执行:在沙箱环境中运行 Shell 命令
网络检索:搜索网页、调用外部工具
Skills 管理:可插拔的技能扩展机制
任务编排:计划管理、上下文维护、多子代理协同
会话与权限:会话追踪、权限控制、运行轨迹记录
界面设计走的是极简路线,但功能入口一个不少。

三、四种运行模式:该选哪个?
这是 Harness 最有意思的设计——四种模式覆盖了从通用到专用的全部场景:

模式
定位
适用场景
标准模式
全能均衡型,功能最完整
默认首选,覆盖 90% 日常需求
PTC 模式
标准模式 + TypeScript 程序化工具调用
批量任务、多步骤重复操作
极简模式
仅 Bash + str_replace_editor
纯本地代码修改,不要花哨功能
创造模式
自定义 Agent 预设的元模式
打造专属 Agent,面向特定场景
官方反复强调的设计理念是「一切皆插件」——模型、工具、Skills、会话、文件系统、沙箱、多 Agent 协作,甚至 UI 本身都可以拆开重组。比如你可以通过插件给 Harness 加一个任务进度面板,运行时直接显示在界面里,不用时随时停用。

这套架构的扩展性值得后续单独深挖。

四、实测 Case 1:3D 黑洞引力模拟器
统一使用 DeepSeek V4 Pro 模型,接入 Claude Harness、DeepSeek Harness 和 Hermes Harness 进行横向对比。

结果汇总:

Harness
耗时
效果评估
Claude Harness
25 min
视觉效果最佳,交互需求全部实现
DeepSeek Harness
40 min
视觉效果炫酷,黑洞质量/时间/速度变化丝滑
Hermes Harness
42 min
效果零散,细节缺失
这个 Case 的关键结论是:Harness 本身对模型任务执行的影响显著。同样的模型、不同的编排框架,输出质量存在实质差异。

DeepSeek Harness 在速度上与 Claude 还有差距,但效果基本持平。考虑到当前还是预览版,这个表现已经超出预期。

五、实测 Case 2:创造模式实战——门店宣传助手
创造模式的核心逻辑是:先配 Agent,再让 Agent 干活。我把这个模式跑了一遍,验证它能不能落地。

预设配置:创建了一个面向小店老板(不懂代码)的宣传网页生成 Agent,以标准模式为基础,保留文件读写、命令执行、网页检索等能力,额外约束了三点:

开始前最多问 3 个关键问题(店名、主营产品、宣传风格)
网页必须适配手机浏览
完成后自动启动检查并反馈文件清单
踩坑实录:任务执行过程中,Agent 一度陷入 Bash noop 死循环——思考链里已经意识到应该调用 preset_ops,但下一步又回到同一个占位动作。手动终止后追问原因,它改用文件系统路径继续操作,最终生成了预设文件并通过加载检查。

最终效果:新建会话后,「门店宣传助手」直接出现在模式选择列表中。我只给了一句不完整的需求("帮我给新开的甜品店做一个宣传网页"),它主动补问了 3 个关键信息,完成网页生成+检查,总用时 3 分钟。

创造模式的价值判断:偶尔做一次网页,标准模式足够。但如果你经常处理同类任务(比如每周给不同客户出宣传页),预设好规则后每次都能省掉重复沟通成本。适合创作者、小团队,以及想研究 Agent 工具链配置的人。

六、实测 Case 3:复杂数据处理压测
最后跑了一个数据量较大的处理任务。将 DeepSeek V4 Pro 分别接入 WorkBuddy 和原生 Harness,执行几乎相同的任务。

WorkBuddy(处理四川卷下) :33 分钟完成,不仅跑通了流程,还主动发现了已有处理流程中的问题并给出修改建议。

DeepSeek 原生 Harness(处理四川卷上) :跑了 20 分钟后报错中断,重新继续后总计耗时近 50 分钟完成。产出数据质量与前者一致,没问题。

坦白说,这个结果没达到预期。原本以为模型接入自家框架会有加成,实际在稳定性(首次报错)和执行效率(50min vs 33min)上都不如接入成熟平台。

七、总结与展望
三小时测下来,我对 DeepSeek Harness 的判断是这样的:

亮点:

四种模式的设计思路清晰,覆盖场景完整
「一切皆插件」的架构理念扩展性强
创造模式确实能落地,不是噱头
任务执行质量没问题,效果与 Claude 持平
待改进:

执行效率明显偏低(同样任务比成熟平台慢 30-50%)
稳定性有隐患(复杂任务首次执行报错)
个别场景存在死循环问题
DeepSeek 官方明确表示当前是公测阶段。模型能力已经证明了上限,Harness 需要的是时间打磨稳定性和效率。我会持续关注正式版的表现。

相关文章
人工智能 缓存 前端开发
5897 14
人工智能 JavaScript 开发工具
2453 2
|
11天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
2027 121
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
缓存 JavaScript Shell
1022 1
|
12天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1577 13
|
9天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
缓存 人工智能 算法
572 0
|
18天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1979 10
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
10天前
|
人工智能 API 开发工具
2026 零基础本地 AI 漫剧完整实操教程(8G 笔记本显卡可用|附可直接复制命令与代码)
本方案提供完全离线、本地运行的漫剧全自动制作流程:RTX3060/4050 8G显卡即可驱动,涵盖Qwen写分镜→ComfyUI统一角色绘图→LTX2.3图生微动画→Qwen3-TTS本地配音→FFmpeg自动合成,全程无水印、免API、不限次。专为低显存优化,解决变脸、闪烁、爆内存三大痛点。(239字)