2026测试人必看:DeepSeek Harness是什么?

简介: DeepSeek Harness(dsh)v0.1是DeepSeek开源的Agent运行时框架,践行“一切皆插件”理念,以Cordis元框架支撑热插拔、可回溯的模块化架构。Model + Harness = Agent,模型专注推理,Harness负责执行——读文件、调命令、跑测试、编排多步任务。内置Trajectory全链路追踪、四种运行模式及丰富测试插件(如dsh-test-runner),开箱即用,10分钟可跑通首个自动化任务。

从安装到跑通,一篇讲清楚这个让测试圈失眠的Agent框架

01 一个新物种正在测试圈蔓延
2026年8月13日,DeepSeek发布了DeepSeek Harness(简称dsh)v0.1开发者预览版,并以MIT协议开源了全部代码。

GitHub仓库公开不到两小时,star破万;12小时突破5万星。到8月17日,已发布0.1.0-rc.7版本,星标突破14.9万,fork 1.5万。

被开发者称为“Agent领域的Linux时刻”。

与此同时,测试圈的反应很微妙。一方面,大量测试工程师在社交媒体上表达焦虑:“这东西能自己跑测试,我们怎么办?”另一方面,真正去下载试用的人并没有想象中多。

为什么?

因为很多人看了半天新闻,还是没搞清楚——Harness到底是什么?它和之前那些AI工具有什么本质区别?对测试岗位到底意味着什么?

这篇不聊虚的,直接从技术角度拆解。

02 先说清楚:Harness这个词到底什么意思
Harness,直译是“马具”——套在马身上、让人能驾驭它的那套缰绳和皮具。

在Agent工程语境里,它指的是包裹在模型外面的那一整圈运行时:主循环怎么转、工具怎么注册与调度、上下文怎么组装与裁剪、会话怎么持久化、代码在哪个沙箱里跑、失败了怎么恢复。

DeepSeek官方给了一个很干脆的等式:

Model + Harness = Agent

模型是“大脑”,负责思考和推理。Harness是“手脚”,负责让模型真正动手干活——读文件、调工具、执行命令、持续完成任务。

以前你调DeepSeek API拿到的是颗“大脑”,现在它顺手递给你一套“手脚和神经系统”。

这个区别很关键。以前你问AI一个问题,它给你一段文字回答。现在你给Harness一个目标,它自己规划步骤、调用工具、执行操作、验证结果,把整件事干完。

产品定位上,它直接对标Claude Code。但两者有一个根本区别:Claude Code是一个“成品工具”,装完就能用。Harness是一个“开发者底层工具”——它不打算给你一个一键可用的终端助手,而是给你一套能自己搭建Agent技术栈的底座。

用DeepSeek内部的说法,他们不是在做一个“更好的Copilot”,而是在做一个“能让开发者自己造Agent的基础设施”。

03 Harness最核心的设计:一切皆插件
Harness最核心的设计理念只有五个字:一切皆插件(Everything is a Plugin)。

这不是一句营销话术。

过去的Agent框架像一个固定浇筑的大楼——核心Harness是固定的,用户只能在边缘加插件。DeepSeek Harness把这栋固定的大楼拆成了一盒乐高。

不只是外围能力可以插件化,连模型适配器、工具注册表、会话日志、Agent Loop本身,全都可以替换。

官方用了一句非常硬核的话:“不存在需要打补丁的特权内核”——扩展dsh的方式就是把插件挂载到其他插件旁边。

什么意思?就是说你不用fork官方代码仓库去改核心逻辑,所有扩展都通过插件机制完成。你想换掉整个Agent的运行方式,写个插件就行,不用动源码。

支撑这套架构的底层,是一个叫Cordis的元框架。它来自DeepSeek与北京大学联合发表的论文《A Programming Paradigm for Spatiotemporal Composability》。

Cordis最初解决的是插件卸载问题——插件被拔掉以后,它对系统产生的影响(注册的监听器、占用的资源、修改的状态)要一起消失。在DSH里,这套机制解决的是:如果Agent未来真的要修改自己的Harness,修改之后还能撤回,以及依赖关系还能继续正常工作。

用工程语言说:这是一个支持热插拔、可回溯、依赖可管理的插件系统。不是简单的“装个插件就能用”,而是“装上去的插件随时可以完整卸掉,不留下任何副作用”。

04 对测试人来说,这三个功能最值得关注
第一,Trajectory(轨迹)。

模型看到的一切——系统提示词、推理过程、工具调用和结果、子Agent的调度——全部记录在一份只增不改的会话日志里。

相当于Agent的每次运行都自带一个黑匣子。出了问题,你可以完整复盘它到底看到了什么、为什么这么做。这对测试来说非常关键——你不仅要看结果对不对,还要能追溯过程。

第二,四种运行模式。

标准模式:开箱即用,文件编辑+Shell+搜索+子Agent,功能最完整。代码模式(PTC):模型写TypeScript程序,把多步工具操作合并成一次执行。极简模式:只保留一个持久bash和一个文件编辑器,官方用它跑V4-Flash的Code Agent基准测试。创造模式:让你在内存里测试Cordis插件,把它们组合成新的模式。

对测试来说,极简模式+代码模式最值得研究。前者省Token、适合批量跑测试,后者效率高、适合复杂任务。

第三,插件生态。

发布不到24小时,社区已经收录了288个插件仓库。到发布第五天,以“dsh-plugin”为标签的公开仓库超过700个。

其中有两个对测试尤其相关:

dsh-test-runner:让Agent一次工具调用完成“改代码→跑测试→修”的完整闭环,自动探测测试框架、执行测试、返回结构化摘要(通过/失败统计+失败用例名称与错误信息)
dsh-plugin-playwright:基于Playwright的浏览器自动化工具,Agent可以读取页面内容、点击控件、填写表单、滚动与导航,同时保留登录态、会话和Cookie
05 安装与配置:10分钟跑通第一个任务
第一步:检查Node.js环境

Harness需要Node.js版本≥22。

node --version
如果版本不够,去Node.js官网下载LTS版本安装。装完后重新打开终端。

第二步:安装DSH

npx @deepseek-ai/dsh web
这条命令自动下载并启动Web UI。首次运行需要等一两分钟。

验证安装:

dsh --version
看到版本号(当前是0.1.0-rc.7)就成功了。

不想折腾命令行的,还有两个选择:

桌面版:GitHub上有社区打包的版本(~238 MB),解压即用
Docker:docker run -d --name dsh -p 3080:3080 ghcr.io/huoxue1/deepseek-harness:latest
第三步:启动Web UI

npx @deepseek-ai/dsh web
浏览器打开http://127.0.0.1:3080。

第四步:配置API Key

点击设置(Settings)→模型(Models),在DeepSeek卡片中输入API Key并保存。密钥保存在本地,不会被上传。

还没有API Key?去DeepSeek开放平台注册创建。

第五步:选择工作区

点击“选择工作区”,选一个你想让Agent操作的项目文件夹。选完之前,会话输入框是不可用的。

第六步:跑通第一个任务

新建会话,输入:

帮我把这个项目的结构梳理一下,列出主要的包和功能
Agent会开始工作:读文件、执行命令、维护执行计划。每个操作在Web UI中实时可见。会话自动持久化,可以随时恢复。

06 四个真实使用案例
案例一:财报解读。

有开发者让Harness读取桌面上的腾讯财报文件,整理关键数据,并总结值得关注的变化。信息抓取得比较准,总结也比较到位。整个过程不需要手动复制粘贴,Agent自己完成了文件读取和数据提取。

案例二:网页搭建。

让标准模式和极简模式分别为一家咖啡店制作单页官网,包含品牌介绍、饮品菜单、营业时间和门店信息。两种模式都顺利完成了任务。

案例三:测试自动化闭环。

安装dsh-test-runner插件后,让Agent执行“把当前目录的测试跑一遍,失败的全修好”。它会自动探测框架、执行测试、分析失败原因、修复、再验证。

案例四:星际争霸对战。

有人把Harness接到一个星际争霸环境里,让它自己打一局。Agent自己规划运营策略、调配资源、造兵进攻。打赢了。虽然只是简单模式,但证明了Harness的潜力远不止写代码。

07 避坑指南
坑1:Node.js版本不对。 DSH要求≥22。检查方法:node --version。

坑2:终端没刷新。 装完Node.js或npm包后,一定要重新打开终端。很多“找不到命令”的问题就是这个原因。

坑3:API Key没配置就发消息。 报MISSING_CREDENTIAL错误。先去设置里填好。

坑4:没选工作区。 输入框灰色不可用,不是bug,是设计。

坑5:等稳定版再学。 官方明确提示“未来将出现破坏兼容性的变更”,正在快速迭代。等稳定了再学就落后了。

坑6:直接把API Key贴到截图或公开仓库里。 这是安全问题,不要犯。

08 最后说几句
DeepSeek Harness不是第一个Agent框架,也不会是最后一个。

但它的出现改变了游戏规则。以前你要做一个能跑测试的Agent,需要自己搭框架、写调度逻辑、处理工具注册。现在Harness把这些全包了,你需要做的只是写插件。

对于测试工程师来说,这意味着一个清晰的分水岭:只会手动执行测试的人,被替代只是时间问题。但会用Agent框架搭建测试体系的人,价值反而在提升。

工具在变,对质量负责这件事,永远需要人。

现在打开终端,输入npx @deepseek-ai/dsh web,自己跑一遍就知道了。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

相关文章
人工智能 缓存 前端开发
6348 20
人工智能 JavaScript 开发工具
3346 5
缓存 JavaScript Shell
1581 2
开发工具 Swift git
1183 1
Shell API 调度
895 2
|
13天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
2139 121
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
14天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1808 13
安全 机器人 API
650 2
缓存 人工智能 算法
735 1

热门文章

最新文章