2026年8月13日深夜,DeepSeek把一个叫Harness的东西扔上了GitHub。6天,16.7万星。
这个数字什么概念?Hacker News 740分,评论区吵了上千楼。测试圈更热闹——有人失眠,有人焦虑,有人连夜装上了。
我属于第三种。熬了一整夜测完,只想说一句:这东西跟你想的不一样。
一、先别慌,搞清楚Harness到底是啥
很多人第一次看到“Harness”这个词会懵。直译是“马具”——套在马身上那套缰绳。
这个比喻特别准:模型是马力很强的马,但你没法直接控制它往哪跑;Harness就是那套缰绳和车厢,负责把模型和组织文件、执行命令、调用工具、管理上下文这些“让马真正拉车干活”的组件绑在一起。
DeepSeek官网给了一个很干脆的等式:
Model + Harness = Agent
模型是大脑,负责思考和推理。Harness是手脚+神经系统——读文件、调工具、执行命令、持续完成任务。
以前你调API拿到的是颗“大脑”,现在它顺手递给你一套“手脚”。
但有个坑很多人踩了:DeepSeek V4是模型,DeepSeek Harness是让模型干活的“操作系统层”,它俩不是一回事。叫Code的(Claude Code、Codex)定位是AI编程助手;而Harness的定位是更底层的 “Agent执行底座” ——编码只是它官方预置的一套组合,你完全可以用它拼出跟编程毫无关系的Agent。
Claude Code、Codex这类产品本质上是把Harness那一层做成了闭源成品——工具、Skill、会话管理、沙箱全被厂商封装进一个壳里,你用的是精装房,墙不能拆、格局不能动。DeepSeek这次干的事,等于把这套房子的施工图和所有预制件都开源了,还告诉你“墙随便拆,零件随便换” 。
二、核心设计:“一切皆插件”不是营销话术
Harness最核心的设计理念只有五个字:一切皆插件(Everything is a Plugin) 。
这不是一句营销话术。
过去的Agent框架像一个固定浇筑的大楼——核心Harness是固定的,用户只能在边缘加插件。DeepSeek Harness把这栋固定的大楼拆成了一盒乐高。
不只是外围能力可以插件化,连模型适配器、工具注册表、会话日志、Agent Loop本身,全都可以替换。
官方用了一句非常硬核的话:
“不存在需要打补丁的特权内核”——扩展dsh的方式就是把插件挂载到其他插件旁边。
什么意思?你不用fork官方代码仓库去改核心逻辑,所有扩展都通过插件机制完成。你想换掉整个Agent的运行方式,写个插件就行,不用动源码。
支撑这套架构的底层,是一个叫Cordis的元框架。它来自DeepSeek与北京大学联合发表的论文《A Programming Paradigm for Spatiotemporal Composability》。这套设计已经在Koishi聊天机器人框架中运行了四年,超过4000个社区插件在生产环境中验证过。
更狠的一点:Harness在设计上完全不绑定DeepSeek自家模型。OpenAI、Anthropic、AWS Bedrock、Azure、Gemini全都能接。甚至可以把Claude Code和Codex作为子Agent调用——通过解析PATH里的对应二进制文件实现委托执行。这意味着你可以用Harness做上层编排,把Claude Code和Codex纳入更大的工作流,而不是取代它们。
三、30分钟上手:从安装到跑通第一个测试任务
先泼盆冷水:官方文档以架构说明为主,缺少一条从零上手的路径。打开GitHub仓库,全是AGENTS.md、architecture.md——对新手不太友好。
下面是我踩完坑整理出来的实操流程。
3.1 装Node.js(2分钟)
DeepSeek Harness需要Node.js环境,要求版本 ≥ 22。
node --version
如果看到v22.x或更高,OK。没有的话去Node.js官网下载LTS版本。
3.2 一条命令安装DSH(2分钟)
npx @deepseek-ai/dsh web
这条命令会自动下载并启动Web UI。首次运行需要等一两分钟下载依赖。
验证安装:
dsh --version
当前版本 0.1.0-rc.8
Windows用户注意:装完如果提示找不到命令,重新打开一次PowerShell。
不想折腾命令行的还有两个选择:
桌面版:社区打包的DeepSeekHarness-win32-x64压缩包,解压即用
Docker:docker run -d --name dsh -p 3080:3080 ghcr.io/huoxue1/deepseek-...
3.3 启动Web UI(1分钟)
npx @deepseek-ai/dsh web
打开浏览器访问 http://127.0.0.1:3080
界面风格从蓝色变成了黑色,LOGO从蓝鲸换成了黑鲸——据说这是要把Harness当独立生态经营的信号。
3.4 配置API Key(2分钟)
先去DeepSeek开放平台买Token、获取API Key。
配置方式:
export DEEPSEEK_API_KEY=sk-xxxx # Linux/macOS
$env:DEEPSEEK_API_KEY="sk-xxxx" # Windows PowerShell
不一定非要用DeepSeek的模型。Harness通过LLM适配器可以接OpenAI、Anthropic等各种模型。
3.5 四种运行模式选哪个?
点击对话框的模式选择,能看到四种预设:
模式
说明
适用场景
标准模式
功能完整的编码Agent,支持文件编辑、Shell、Skills、子Agent
日常开发,测试任务首选
PTC模式
先让模型生成脚本再执行
批量操作、需要预先审查的场景
极简模式
只有bash和文件编辑两个工具
基准测试,普通用户基本用不到
创造模式
可以创建自定义Agent预设
高级玩家——用Agent造Agent
测试任务直接选标准模式。
3.6 装测试插件,跑起来
社区已经有人做了dsh-test-runner插件——让Agent一次工具调用就能完成 “改代码→跑测试→修”的完整闭环。
安装方式:
dsh plugin --profile add dsh-test-runner
还有dsh-browser-playwright插件,基于Playwright的浏览器自动化工具。每次操作返回当前页面的可访问性快照(带ref标识),后续click/fill直接用ref定位,确定性强、token省。
截至8月18日,以dsh-plugin标签发布的社区插件已有数百个,公开仓库超过700个。
四、实测:AI到底能替测试开发干多少活?
有开发者把日常工作拆成五个环节,逐项交给dsh做了一遍:
需求解析(替代度约50%) :文档写得清楚,它提取得就齐——入参、出参、错误码都能列出来。但“库存为零不允许出库”这类没写进文档、只存在于业务方脑子里的规则,它不会凭空知道。
用例设计(替代度约70%) :最省人的一环。它给的是具体可执行的用例描述,不是“测试正常流程”这种正确的废话。边界值会主动凑成对(刚好等于阈值、刚过阈值各一条),异常场景也知道往负数、超长字符串、缺字段上想。
脚本编写(替代度约60%) :形态不错,会用fixture、会参数化,断言具体到状态码。但会偶发编出不存在的接口,或者假设错返回结构,每一条都要人看。
执行调度(替代度约30%) :短板很明显——响应速度偏慢;任务链一长就容易不稳,遇到过循环打转,反复读同一份日志不往前走。
缺陷定位(替代度约40%) :能从日志里圈出可疑点并给假设,但确认还得靠人。
综合替代度约50%-67% ——AI擅长重复劳动,判断力仍属人类。
五、为什么说它是测试开发的“版本答案”?
5.1 从“写脚本”到“管Agent”
过去测试开发的核心工作是写自动化脚本。现在Harness把执行层全包了——它自己读代码、自己跑测试、自己分析失败原因、把修复方案列出来。
你的价值从“写脚本”变成了“管Agent” :选什么模型、配什么插件、定义什么规则、怎么审计结果。
5.2 “一切皆插件”带来的工程化可能
Harness最被低估的一点:它不是消费品,是基础设施。
你可以:
把内部的测试框架封装成Harness插件
把公司自建的模型服务通过自定义接口接入
把Claude Code和Codex作为子Agent编排进同一个工作流
用Headless模式跑批量任务,适合CI/CD流水线
这些在Claude Code里根本做不到。
5.3 Trajectory全链路追踪,测试可观测性的新范式
Harness维护一份只追加写入的会话日志——所有抵达模型请求的内容都必须可从该日志中还原。恢复、分叉、回放、转录、遥测,全建立在这一事件流之上。
对测试来说这意味着什么? AI跑的每一步都有记录,出了问题随时复盘,相当于自带测试报告。你再也不用猜“AI当时是怎么想的”——Trajectory里全写着。
六、几个避坑指南
当前是开发者预览版,官方明确警告存在breaking changes,不保证向下兼容。别在生产环境乱搞。
模型成本要算清楚。V4系列API改为峰谷分时计价,高峰时段价格明显上浮。Harness跑长任务时token消耗不小,建议先用小模型试水。
生成的结果必须评审。实测中AI会编出不存在的接口、假设错返回结构。“生成完先跑一遍,红的先人工分类——是代码错还是用例错——再决定改哪边。”
选对预设很重要。写代码、做测试、修Bug,不同类型的任务适合不同的模式,选错了可能事倍功半。图快就用极简模式,正经干活用标准模式。
写在最后
Harness开源6天16.7万星,这个速度在开发者工具史上都是罕见的。有人把它叫做 “Agent领域的Linux时刻” 。
是不是Linux时刻不好说,但有一点是确定的:测试开发的玩法确实要变了。
以前你的核心竞争力是“能写自动化脚本”。以后这可能只是基本功。新的护城河是:你能不能搭一套让AI帮你跑测试的工程体系?能不能判断AI生成的结果靠不靠谱?能不能把测试经验和业务理解转化成Agent的规则和插件?
Harness给了你一把扳手。用它拧螺丝,还是用它造一台能自己拧螺丝的机器——取决于你。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。