从安装到跑通,一篇讲清楚这个让测试圈失眠的Agent框架
01 一个新物种正在测试圈蔓延
2026年8月13日,DeepSeek发布了DeepSeek Harness(简称dsh)v0.1开发者预览版,并以MIT协议开源了全部代码。
GitHub仓库公开不到两小时,star破万;12小时突破5万星。到8月17日,已发布0.1.0-rc.7版本,星标突破14.9万,fork 1.5万。
被开发者称为“Agent领域的Linux时刻”。
与此同时,测试圈的反应很微妙。一方面,大量测试工程师在社交媒体上表达焦虑:“这东西能自己跑测试,我们怎么办?”另一方面,真正去下载试用的人并没有想象中多。
为什么?
因为很多人看了半天新闻,还是没搞清楚——Harness到底是什么?它和之前那些AI工具有什么本质区别?对测试岗位到底意味着什么?
这篇不聊虚的,直接从技术角度拆解。
02 先说清楚:Harness这个词到底什么意思
Harness,直译是“马具”——套在马身上、让人能驾驭它的那套缰绳和皮具。
在Agent工程语境里,它指的是包裹在模型外面的那一整圈运行时:主循环怎么转、工具怎么注册与调度、上下文怎么组装与裁剪、会话怎么持久化、代码在哪个沙箱里跑、失败了怎么恢复。
DeepSeek官方给了一个很干脆的等式:
Model + Harness = Agent
模型是“大脑”,负责思考和推理。Harness是“手脚”,负责让模型真正动手干活——读文件、调工具、执行命令、持续完成任务。
以前你调DeepSeek API拿到的是颗“大脑”,现在它顺手递给你一套“手脚和神经系统”。
这个区别很关键。以前你问AI一个问题,它给你一段文字回答。现在你给Harness一个目标,它自己规划步骤、调用工具、执行操作、验证结果,把整件事干完。
产品定位上,它直接对标Claude Code。但两者有一个根本区别:Claude Code是一个“成品工具”,装完就能用。Harness是一个“开发者底层工具”——它不打算给你一个一键可用的终端助手,而是给你一套能自己搭建Agent技术栈的底座。
用DeepSeek内部的说法,他们不是在做一个“更好的Copilot”,而是在做一个“能让开发者自己造Agent的基础设施”。
03 Harness最核心的设计:一切皆插件
Harness最核心的设计理念只有五个字:一切皆插件(Everything is a Plugin)。
这不是一句营销话术。
过去的Agent框架像一个固定浇筑的大楼——核心Harness是固定的,用户只能在边缘加插件。DeepSeek Harness把这栋固定的大楼拆成了一盒乐高。
不只是外围能力可以插件化,连模型适配器、工具注册表、会话日志、Agent Loop本身,全都可以替换。
官方用了一句非常硬核的话:“不存在需要打补丁的特权内核”——扩展dsh的方式就是把插件挂载到其他插件旁边。
什么意思?就是说你不用fork官方代码仓库去改核心逻辑,所有扩展都通过插件机制完成。你想换掉整个Agent的运行方式,写个插件就行,不用动源码。
支撑这套架构的底层,是一个叫Cordis的元框架。它来自DeepSeek与北京大学联合发表的论文《A Programming Paradigm for Spatiotemporal Composability》。
Cordis最初解决的是插件卸载问题——插件被拔掉以后,它对系统产生的影响(注册的监听器、占用的资源、修改的状态)要一起消失。在DSH里,这套机制解决的是:如果Agent未来真的要修改自己的Harness,修改之后还能撤回,以及依赖关系还能继续正常工作。
用工程语言说:这是一个支持热插拔、可回溯、依赖可管理的插件系统。不是简单的“装个插件就能用”,而是“装上去的插件随时可以完整卸掉,不留下任何副作用”。
04 对测试人来说,这三个功能最值得关注
第一,Trajectory(轨迹)。
模型看到的一切——系统提示词、推理过程、工具调用和结果、子Agent的调度——全部记录在一份只增不改的会话日志里。
相当于Agent的每次运行都自带一个黑匣子。出了问题,你可以完整复盘它到底看到了什么、为什么这么做。这对测试来说非常关键——你不仅要看结果对不对,还要能追溯过程。
第二,四种运行模式。
标准模式:开箱即用,文件编辑+Shell+搜索+子Agent,功能最完整。代码模式(PTC):模型写TypeScript程序,把多步工具操作合并成一次执行。极简模式:只保留一个持久bash和一个文件编辑器,官方用它跑V4-Flash的Code Agent基准测试。创造模式:让你在内存里测试Cordis插件,把它们组合成新的模式。
对测试来说,极简模式+代码模式最值得研究。前者省Token、适合批量跑测试,后者效率高、适合复杂任务。
第三,插件生态。
发布不到24小时,社区已经收录了288个插件仓库。到发布第五天,以“dsh-plugin”为标签的公开仓库超过700个。
其中有两个对测试尤其相关:
dsh-test-runner:让Agent一次工具调用完成“改代码→跑测试→修”的完整闭环,自动探测测试框架、执行测试、返回结构化摘要(通过/失败统计+失败用例名称与错误信息)
dsh-plugin-playwright:基于Playwright的浏览器自动化工具,Agent可以读取页面内容、点击控件、填写表单、滚动与导航,同时保留登录态、会话和Cookie
05 安装与配置:10分钟跑通第一个任务
第一步:检查Node.js环境
Harness需要Node.js版本≥22。
node --version
如果版本不够,去Node.js官网下载LTS版本安装。装完后重新打开终端。
第二步:安装DSH
npx @deepseek-ai/dsh web
这条命令自动下载并启动Web UI。首次运行需要等一两分钟。
验证安装:
dsh --version
看到版本号(当前是0.1.0-rc.7)就成功了。
不想折腾命令行的,还有两个选择:
桌面版:GitHub上有社区打包的版本(~238 MB),解压即用
Docker:docker run -d --name dsh -p 3080:3080 ghcr.io/huoxue1/deepseek-harness:latest
第三步:启动Web UI
npx @deepseek-ai/dsh web
浏览器打开http://127.0.0.1:3080。
第四步:配置API Key
点击设置(Settings)→模型(Models),在DeepSeek卡片中输入API Key并保存。密钥保存在本地,不会被上传。
还没有API Key?去DeepSeek开放平台注册创建。
第五步:选择工作区
点击“选择工作区”,选一个你想让Agent操作的项目文件夹。选完之前,会话输入框是不可用的。
第六步:跑通第一个任务
新建会话,输入:
帮我把这个项目的结构梳理一下,列出主要的包和功能
Agent会开始工作:读文件、执行命令、维护执行计划。每个操作在Web UI中实时可见。会话自动持久化,可以随时恢复。
06 四个真实使用案例
案例一:财报解读。
有开发者让Harness读取桌面上的腾讯财报文件,整理关键数据,并总结值得关注的变化。信息抓取得比较准,总结也比较到位。整个过程不需要手动复制粘贴,Agent自己完成了文件读取和数据提取。
案例二:网页搭建。
让标准模式和极简模式分别为一家咖啡店制作单页官网,包含品牌介绍、饮品菜单、营业时间和门店信息。两种模式都顺利完成了任务。
案例三:测试自动化闭环。
安装dsh-test-runner插件后,让Agent执行“把当前目录的测试跑一遍,失败的全修好”。它会自动探测框架、执行测试、分析失败原因、修复、再验证。
案例四:星际争霸对战。
有人把Harness接到一个星际争霸环境里,让它自己打一局。Agent自己规划运营策略、调配资源、造兵进攻。打赢了。虽然只是简单模式,但证明了Harness的潜力远不止写代码。
07 避坑指南
坑1:Node.js版本不对。 DSH要求≥22。检查方法:node --version。
坑2:终端没刷新。 装完Node.js或npm包后,一定要重新打开终端。很多“找不到命令”的问题就是这个原因。
坑3:API Key没配置就发消息。 报MISSING_CREDENTIAL错误。先去设置里填好。
坑4:没选工作区。 输入框灰色不可用,不是bug,是设计。
坑5:等稳定版再学。 官方明确提示“未来将出现破坏兼容性的变更”,正在快速迭代。等稳定了再学就落后了。
坑6:直接把API Key贴到截图或公开仓库里。 这是安全问题,不要犯。
08 最后说几句
DeepSeek Harness不是第一个Agent框架,也不会是最后一个。
但它的出现改变了游戏规则。以前你要做一个能跑测试的Agent,需要自己搭框架、写调度逻辑、处理工具注册。现在Harness把这些全包了,你需要做的只是写插件。
对于测试工程师来说,这意味着一个清晰的分水岭:只会手动执行测试的人,被替代只是时间问题。但会用Agent框架搭建测试体系的人,价值反而在提升。
工具在变,对质量负责这件事,永远需要人。
现在打开终端,输入npx @deepseek-ai/dsh web,自己跑一遍就知道了。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。