DeepSeek Harness爆火,测试开发的下一个“版本答案”找到了!

简介: DeepSeek于2026年8月开源Agent执行底座Harness,6天获16.7万星。它并非模型,而是“AI操作系统”:以插件化架构解耦模型与工具,支持多厂商LLM,实现“一切皆插件”。专为测试开发等工程场景设计,推动从写脚本到编排Agent的范式升级。

2026年8月13日深夜,DeepSeek把一个叫Harness的东西扔上了GitHub。6天,16.7万星。

这个数字什么概念?Hacker News 740分,评论区吵了上千楼。测试圈更热闹——有人失眠,有人焦虑,有人连夜装上了。

我属于第三种。熬了一整夜测完,只想说一句:这东西跟你想的不一样。

一、先别慌,搞清楚Harness到底是啥
很多人第一次看到“Harness”这个词会懵。直译是“马具”——套在马身上那套缰绳。

这个比喻特别准:模型是马力很强的马,但你没法直接控制它往哪跑;Harness就是那套缰绳和车厢,负责把模型和组织文件、执行命令、调用工具、管理上下文这些“让马真正拉车干活”的组件绑在一起。

DeepSeek官网给了一个很干脆的等式:

Model + Harness = Agent

模型是大脑,负责思考和推理。Harness是手脚+神经系统——读文件、调工具、执行命令、持续完成任务。

以前你调API拿到的是颗“大脑”,现在它顺手递给你一套“手脚”。

但有个坑很多人踩了:DeepSeek V4是模型,DeepSeek Harness是让模型干活的“操作系统层”,它俩不是一回事。叫Code的(Claude Code、Codex)定位是AI编程助手;而Harness的定位是更底层的 “Agent执行底座” ——编码只是它官方预置的一套组合,你完全可以用它拼出跟编程毫无关系的Agent。

Claude Code、Codex这类产品本质上是把Harness那一层做成了闭源成品——工具、Skill、会话管理、沙箱全被厂商封装进一个壳里,你用的是精装房,墙不能拆、格局不能动。DeepSeek这次干的事,等于把这套房子的施工图和所有预制件都开源了,还告诉你“墙随便拆,零件随便换” 。

二、核心设计:“一切皆插件”不是营销话术
Harness最核心的设计理念只有五个字:一切皆插件(Everything is a Plugin) 。

这不是一句营销话术。

过去的Agent框架像一个固定浇筑的大楼——核心Harness是固定的,用户只能在边缘加插件。DeepSeek Harness把这栋固定的大楼拆成了一盒乐高。

不只是外围能力可以插件化,连模型适配器、工具注册表、会话日志、Agent Loop本身,全都可以替换。

官方用了一句非常硬核的话:

“不存在需要打补丁的特权内核”——扩展dsh的方式就是把插件挂载到其他插件旁边。

什么意思?你不用fork官方代码仓库去改核心逻辑,所有扩展都通过插件机制完成。你想换掉整个Agent的运行方式,写个插件就行,不用动源码。

支撑这套架构的底层,是一个叫Cordis的元框架。它来自DeepSeek与北京大学联合发表的论文《A Programming Paradigm for Spatiotemporal Composability》。这套设计已经在Koishi聊天机器人框架中运行了四年,超过4000个社区插件在生产环境中验证过。

更狠的一点:Harness在设计上完全不绑定DeepSeek自家模型。OpenAI、Anthropic、AWS Bedrock、Azure、Gemini全都能接。甚至可以把Claude Code和Codex作为子Agent调用——通过解析PATH里的对应二进制文件实现委托执行。这意味着你可以用Harness做上层编排,把Claude Code和Codex纳入更大的工作流,而不是取代它们。

三、30分钟上手:从安装到跑通第一个测试任务
先泼盆冷水:官方文档以架构说明为主,缺少一条从零上手的路径。打开GitHub仓库,全是AGENTS.md、architecture.md——对新手不太友好。

下面是我踩完坑整理出来的实操流程。

3.1 装Node.js(2分钟)
DeepSeek Harness需要Node.js环境,要求版本 ≥ 22。

node --version
如果看到v22.x或更高,OK。没有的话去Node.js官网下载LTS版本。

3.2 一条命令安装DSH(2分钟)
npx @deepseek-ai/dsh web
这条命令会自动下载并启动Web UI。首次运行需要等一两分钟下载依赖。

验证安装:

dsh --version

当前版本 0.1.0-rc.8

Windows用户注意:装完如果提示找不到命令,重新打开一次PowerShell。

不想折腾命令行的还有两个选择:

桌面版:社区打包的DeepSeekHarness-win32-x64压缩包,解压即用
Docker:docker run -d --name dsh -p 3080:3080 ghcr.io/huoxue1/deepseek-...
3.3 启动Web UI(1分钟)
npx @deepseek-ai/dsh web
打开浏览器访问 http://127.0.0.1:3080

界面风格从蓝色变成了黑色,LOGO从蓝鲸换成了黑鲸——据说这是要把Harness当独立生态经营的信号。

3.4 配置API Key(2分钟)
先去DeepSeek开放平台买Token、获取API Key。

配置方式:

export DEEPSEEK_API_KEY=sk-xxxx # Linux/macOS
$env:DEEPSEEK_API_KEY="sk-xxxx" # Windows PowerShell
不一定非要用DeepSeek的模型。Harness通过LLM适配器可以接OpenAI、Anthropic等各种模型。

3.5 四种运行模式选哪个?
点击对话框的模式选择,能看到四种预设:

模式
说明
适用场景
标准模式
功能完整的编码Agent,支持文件编辑、Shell、Skills、子Agent
日常开发,测试任务首选
PTC模式
先让模型生成脚本再执行
批量操作、需要预先审查的场景
极简模式
只有bash和文件编辑两个工具
基准测试,普通用户基本用不到
创造模式
可以创建自定义Agent预设
高级玩家——用Agent造Agent
测试任务直接选标准模式。

3.6 装测试插件,跑起来
社区已经有人做了dsh-test-runner插件——让Agent一次工具调用就能完成 “改代码→跑测试→修”的完整闭环。

安装方式:

dsh plugin --profile add dsh-test-runner
还有dsh-browser-playwright插件,基于Playwright的浏览器自动化工具。每次操作返回当前页面的可访问性快照(带ref标识),后续click/fill直接用ref定位,确定性强、token省。

截至8月18日,以dsh-plugin标签发布的社区插件已有数百个,公开仓库超过700个。

四、实测:AI到底能替测试开发干多少活?
有开发者把日常工作拆成五个环节,逐项交给dsh做了一遍:

需求解析(替代度约50%) :文档写得清楚,它提取得就齐——入参、出参、错误码都能列出来。但“库存为零不允许出库”这类没写进文档、只存在于业务方脑子里的规则,它不会凭空知道。

用例设计(替代度约70%) :最省人的一环。它给的是具体可执行的用例描述,不是“测试正常流程”这种正确的废话。边界值会主动凑成对(刚好等于阈值、刚过阈值各一条),异常场景也知道往负数、超长字符串、缺字段上想。

脚本编写(替代度约60%) :形态不错,会用fixture、会参数化,断言具体到状态码。但会偶发编出不存在的接口,或者假设错返回结构,每一条都要人看。

执行调度(替代度约30%) :短板很明显——响应速度偏慢;任务链一长就容易不稳,遇到过循环打转,反复读同一份日志不往前走。

缺陷定位(替代度约40%) :能从日志里圈出可疑点并给假设,但确认还得靠人。

综合替代度约50%-67% ——AI擅长重复劳动,判断力仍属人类。

五、为什么说它是测试开发的“版本答案”?
5.1 从“写脚本”到“管Agent”
过去测试开发的核心工作是写自动化脚本。现在Harness把执行层全包了——它自己读代码、自己跑测试、自己分析失败原因、把修复方案列出来。

你的价值从“写脚本”变成了“管Agent” :选什么模型、配什么插件、定义什么规则、怎么审计结果。

5.2 “一切皆插件”带来的工程化可能
Harness最被低估的一点:它不是消费品,是基础设施。

你可以:

把内部的测试框架封装成Harness插件
把公司自建的模型服务通过自定义接口接入
把Claude Code和Codex作为子Agent编排进同一个工作流
用Headless模式跑批量任务,适合CI/CD流水线
这些在Claude Code里根本做不到。

5.3 Trajectory全链路追踪,测试可观测性的新范式
Harness维护一份只追加写入的会话日志——所有抵达模型请求的内容都必须可从该日志中还原。恢复、分叉、回放、转录、遥测,全建立在这一事件流之上。

对测试来说这意味着什么? AI跑的每一步都有记录,出了问题随时复盘,相当于自带测试报告。你再也不用猜“AI当时是怎么想的”——Trajectory里全写着。

六、几个避坑指南

  1. 当前是开发者预览版,官方明确警告存在breaking changes,不保证向下兼容。别在生产环境乱搞。

  2. 模型成本要算清楚。V4系列API改为峰谷分时计价,高峰时段价格明显上浮。Harness跑长任务时token消耗不小,建议先用小模型试水。

  3. 生成的结果必须评审。实测中AI会编出不存在的接口、假设错返回结构。“生成完先跑一遍,红的先人工分类——是代码错还是用例错——再决定改哪边。”

  4. 选对预设很重要。写代码、做测试、修Bug,不同类型的任务适合不同的模式,选错了可能事倍功半。图快就用极简模式,正经干活用标准模式。

写在最后
Harness开源6天16.7万星,这个速度在开发者工具史上都是罕见的。有人把它叫做 “Agent领域的Linux时刻” 。

是不是Linux时刻不好说,但有一点是确定的:测试开发的玩法确实要变了。

以前你的核心竞争力是“能写自动化脚本”。以后这可能只是基本功。新的护城河是:你能不能搭一套让AI帮你跑测试的工程体系?能不能判断AI生成的结果靠不靠谱?能不能把测试经验和业务理解转化成Agent的规则和插件?

Harness给了你一把扳手。用它拧螺丝,还是用它造一台能自己拧螺丝的机器——取决于你。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

相关文章
人工智能 缓存 前端开发
8902 36
人工智能 JavaScript 开发工具
3685 9
开发工具 Swift git
1398 2
缓存 JavaScript Shell
1712 2
Shell API 调度
939 3
人工智能 JavaScript 测试技术
1229 0
安全 机器人 API
752 2
|
17天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1951 13
|
15天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
2208 121
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考