当AI开始自己写代码、自己跑测试、自己修Bug,你的下一步该怎么走?
01 一个让我失眠的对话
前天晚上,一个做了6年测试的老同事给我发了条消息,附带一个GitHub链接:
“兄弟,你看这个了吗?DeepSeek刚开源的Harness,12小时5万星。”
我点开看了一眼,回了一句:“看了。你有什么想法?”
他沉默了一会儿,回过来一段语音,声音有点哑:
“我试了一下。一行命令装好,让它跑我们项目的测试——它自己读代码、自己执行、自己分析失败原因,然后把修复方案给我列出来了。整个过程,我就坐在旁边看着。”
“我感觉……我这个岗位好像不需要我了。 ”
我听完,没说话。
因为他说的是真的。
2026年8月13日,DeepSeek Harness正式开源。这一天,整个测试行业被划了一道分水岭。
02 痛点:你还在写测试脚本,AI已经开始“自己跑+自己修”了
先看一下DeepSeek Harness的官方定位。
根据DeepSeek官网(https://www.deepseek.com/harness/)的介绍,DeepSeek Harness(简称dsh)是DeepSeek AI开发的开源agent harness(智能体框架)。官方给出的定义是一句话:Agent = Model + Harness。模型是“大脑”,负责思考和推理;Harness是“手脚”,负责让模型真正动手干活——读文件、调工具、执行命令、在真实环境中持续工作。
而它的核心理念只有五个字:一切皆插件(Everything is a Plugin)。
听起来很抽象?说一个最让测试人后背发凉的事实——
DeepSeek Harness内置了标准、极简、代码、创造四种预设模式。在极简模式下,它已经可以完成完整的代码Agent任务。官方文档明确指出,模型的每一个能力都是插件,可以随时被替换或重新组合——模型、工具、技能、会话、沙箱、存储、循环、调度,甚至UI本身,全都是插件。
社区已经有人用Harness做出了让Agent一次工具调用就能完成“改代码→跑测试→修”的完整闭环。
你以前手动写的那些测试脚本、手工排查的那些失败用例,现在AI用一条命令就能自动化闭环了。
这不是“辅助工具”,这是一个可以独立完成测试全流程的数字员工。
03 核心思路:官网深度拆解——Harness到底强在哪?
我们先从DeepSeek官网和GitHub仓库的官方信息入手,拆解一下这个让测试人恐慌的东西到底厉害在哪。
第一,它不是一个聊天机器人,它是一个能“把事做完”的Agent。
传统AI模型——你问一句,它回一句。Harness不一样:你给它一个任务,它会自己规划、自己调用工具、自己执行、自己验证结果,直到把整件事干完。
官网明确写道:“Harness让agent理解其环境、使用工具,并在真实世界中持续工作” 。它不是给你建议,是替你干活。
第二,它能看到“轨迹”,所有操作都可追溯。
Harness有一个叫Trajectory(轨迹) 的设计——模型看到的一切、推理过程、工具调用和结果、每一次上下文注入,全部记录在一份只增不改的会话日志里。
相当于Agent的每次运行都自带一个黑匣子。出了问题,你可以完整复盘它到底看到了什么、为什么这么做。
这对测试来说意味着什么?它不仅是执行者,还自带“测试报告”和“操作日志”。
第三,它的架构彻底颠覆了传统Agent框架。
根据DeepSeek官方架构文档,产品的每一部分都是插件,包括模型适配器、工具注册表、会话日志,以及agent loop(智能体循环)本身,因此每一部分都可以从配置替换。
过去的Agent框架像一个固定浇筑的大楼——核心Harness是固定的,用户只能在外围加插件。
DeepSeek Harness把这栋“固定的大楼”拆成了一盒乐高。不只是外围能力可以插件化,连核心组件都可插拔。不存在需要打补丁的特权内核——扩展dsh的方式就是把插件挂载到其他插件旁边。
用大白话理解:Harness自己就是由插件拼出来的。
而这一切的背后,是DeepSeek与北京大学联合发表的论文《A Programming Paradigm for Spatiotemporal Composability》所提出的Cordis动态组件框架。它解决的核心问题是:如果Agent未来真的要修改自己的Harness,修改之后还能撤回,以及被修改组件背后的依赖关系还能继续正常工作。
这意味着什么?意味着测试领域的每一个细分场景——接口测试、性能测试、UI自动化、安全测试——都可能被插件化、被自动化、被Agent化。
04 公开课:我们一次性讲透DeepSeek Harness
8月20日(周四)晚20:00,我们邀请到思寒老师,用2小时帮你一次性搞懂DeepSeek Harness的所有核心能力。
课程核心内容:
第一部分:DeepSeek Agent架构深度拆解
Harness的底层设计逻辑——“一切皆插件”到底是怎么实现的
Cordis插件元框架如何驱动整个Agent运行
四种预设模式(标准/极简/代码/创造)分别适用什么场景
第二部分:主流智能体全面对比
DeepSeek Agent vs Opencode:架构思路的根本差异
DeepSeek Agent vs Codex / Claude Code:Token使用量和运行效率的真实对比
DeepSeek Agent vs Workbuddy / Openclaw:开源vs闭源、本地vs云端的不同定位
第三部分:DeepSeek Harness插件体系全解析
插件体系总览:模型、工具、技能、会话、沙箱、存储、循环、调度——全部可插拔
Web自动化插件:如何让Agent自动完成网页操作和浏览器交互
App自动化插件:移动端自动化测试的Agent化方案
视觉驱动自动化插件:让纯文本模型“看懂”图片——图片描述、OCR文字提取、UI布局分析、视觉问答
05 真实案例:Harness已经能做到什么?
说几个我亲眼看到的案例。
案例一:一夜5万星。
2026年8月13日晚,DeepSeek Harness开发者预览版(v0.1)正式面向全球开发者开放测试,并同步以MIT协议开放源代码。截至8月14日下午,GitHub上已经获得了4.5万星。截至8月17日,已突破13.5万星。
案例二:代码Agent实测。
发布当晚,有开发者装上Harness后让它干了两件活:照着The Verge的风格重构一个官网,再调GitHub接口画出自己的涨星曲线。两件活都交付了,全程token不到3块钱。
案例三:插件生态爆发。
发布不到24小时,社区带dsh-plugin标签的插件仓库已经攒到288个。有人给它换上Windows XP的复古皮肤,有人做了表情包插件。
Harness不是“未来的趋势”,这是“正在发生的事实”。
06 避坑指南:面对Harness,测试人的5个错误反应
坑1:恐慌式逃避——“AI太强了,我转行算了”
Harness目前还是v0.1开发者预览版,官方明确提示“未来将出现破坏兼容性的变更” 。它“能干活,但得盯着”。恐慌转行是最差的选择。 你现在积累的测试经验和业务理解,恰恰是AI最缺的。
坑2:鸵鸟心态——“这东西离我还远”
Harness发布不到12小时就有5万星,不到5天突破13.5万星。这不是“未来的趋势”,这是“正在发生的事实”。
坑3:只会用、不会改
Harness最核心的设计是“一切皆插件”——模型、工具、界面、审批策略全部可以拆下来换掉。只会用现成的插件、不会自己改插件的人,迟早会被“会用+会改”的人替代。
坑4:只盯着技术,忽视业务理解
AI能跑测试、能修Bug,但它不知道业务的优先级、不知道风险的权重、不知道哪些问题必须人工介入。官方安全政策也明确指出:“始终仔细审查Agent生成的代码和测试内容,确保其准确性” 。
测试工程师的核心价值正在从“执行者”转向“决策者” 。看不懂业务、做不了风险评估的人,才是真正危险的。
坑5:等“稳定版”再学
Harness目前是v0.1开发者预览版,正在快速迭代。等它稳定了再学,你就已经落后了。
07 写在最后
2026年8月13日,DeepSeek Harness开源。
GitHub上13.5万颗星不是凭空来的。288个插件不是凭空来的。Hacker News TOP 1不是凭空来的。
Harness不会让测试工程师消失,但它会让“只会执行”的测试工程师消失。
就像Excel没有让会计消失,但让“只会打算盘”的会计消失了。
未来的测试工程师,不是和AI比谁跑得快,而是和AI比谁看得准、想得深、决策得好。
工具在变,但“对质量负责”这件事,永远需要人。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。