当AI开始自己跑测试、自己修Bug的时候,你的位置还在吗?
01 一个让我失眠的对话
前天晚上,一个做了6年测试的老同事给我发了条消息,附带一个GitHub链接:
“兄弟,你看这个了吗?DeepSeek刚开源的Harness,12小时5万星。”
我点开看了一眼,回了一句:“看了。你有什么想法?”
他沉默了一会儿,回过来一段语音,声音有点哑:
“我试了一下。一行命令装好,让它跑我们项目的测试,它自己读代码、自己执行、自己分析失败原因,然后把修复方案给我列出来了。整个过程,我就坐在旁边看着。”
“我感觉……我这个岗位好像不需要我了。 ”
我听完,没说话。
因为他说的是真的。
02 痛点:你还在写测试脚本,AI已经开始“自己跑+自己修”了
先说一下DeepSeek Harness到底是什么。
2026年8月13日晚,DeepSeek正式发布了它的第一个Agent产品——DeepSeek Harness(简称DSH)v0.1开发者预览版,并以MIT协议开源了全部代码。
GitHub仓库公开不到两小时,star破万;12小时,突破5万星。这个速度是此前被称为“史上增长最快仓库”OpenClaw的80倍。
被开发者称为“Agent领域的Linux时刻”。
它干了什么?
DeepSeek官方给的定义是一句话:Model + Harness = Agent。模型是“大脑”,负责思考和推理;Harness是“手脚”,负责让模型真正动手干活——读文件、调工具、执行命令、持续完成任务。
而它的核心理念只有四个字:一切皆插件。
听起来很抽象?说一个最让测试人后背发凉的功能——
它可以自己跑测试,自己修失败项。
社区已经有人做了一个叫dsh-test-runner的插件,让Agent一次工具调用就能完成“改代码→跑测试→修”的完整闭环:自动探测测试框架、执行测试、只返回结构化摘要(通过/失败统计+失败用例名称与错误信息),省token、少一轮。
你以前手动写的那些测试脚本、手工排查的那些失败用例,现在AI用一条命令就能自动化闭环了。
这不是“辅助工具”,这是一个可以独立完成测试全流程的数字员工。
03 核心思路:Harness不是“帮你干活”,是“替你干活”
我来拆解一下这个让测试人恐慌的东西到底厉害在哪。
第一,它不是一个聊天机器人,它是一个能“把事做完”的Agent。
传统AI模型——你问一句,它回一句。Harness不一样:你给它一个任务,它会自己规划、自己调用工具、自己执行、自己验证结果,直到把整件事干完。
实测中,有人让它“照着The Verge的风格重构一个官网,再调GitHub接口画出自己的涨星曲线”——两件活都交付了,全程花掉的token不到3块钱。
第二,它能看到“轨迹”,所有操作都可追溯。
Harness有一个叫Trajectory(轨迹) 的设计——模型看到的一切、推理过程、工具调用和结果、每一次上下文注入,全部记录在一份只增不改的会话日志里。
相当于Agent的每次运行都自带一个黑匣子。出了问题,你可以完整复盘它到底看到了什么、为什么这么做。
这对测试来说意味着什么?它不仅是执行者,还自带“测试报告”和“操作日志”。
第三,它的插件生态爆炸式增长。
发布不到24小时,社区已经收录了288个插件仓库。模型、工具、界面、审批策略,甚至驱动整个Agent运转的主循环本身,全都可以拆下来换掉。
内测阶段的开发者几天里做了约三百个插件,有人给它换上Windows XP的复古皮肤,有人做了表情包插件。
这意味着什么?意味着测试领域的每一个细分场景——接口测试、性能测试、UI自动化、安全测试——都可能被插件化、被自动化、被Agent化。
04 具体影响:测试人的哪几层技能正在被替代?
我按测试工程师的技能层级,拆解一下Harness已经触及了哪些领域:
第一层:测试执行(已被替代)
“帮我把测试跑一遍并修复失败项”——这句话在Harness里就是一行命令。传统手工执行测试、手工排查失败用例的工作,已经完全可以交给Agent。
第二层:测试脚本编写(正在被替代)
Harness内置了标准、极简、代码、创造四种预设模式。标准模式功能最完整,适合直接干活;PTC模式可以通过代码组合多步工具调用,适合批量、结构化任务。
以前需要一个测试干一周的自动化脚本编写,现在AI辅助下可能几小时就搞定了。
第三层:测试框架搭建(正在被挑战)
Harness的“一切皆插件”理念——模型适配器、工具、会话日志、界面和Agent Loop都可以通过插件树组合与替换。
这意味着测试框架的搭建逻辑正在被重构。 以前你需要从零搭一个自动化框架,现在你只需要组合插件。
第四层:测试策略与风险评估(暂时安全,但需要升级)
AI能跑测试、能修Bug,但它分不清哪3条用例才是关键。它不知道业务风险在哪里、不知道哪些模块出了问题会影响营收、不知道灰度阶段该重点监控什么指标。
这部分,目前还是人的战场。
05 真实案例:一个测试主管的24小时
说一个我亲眼看到的事。
我认识的一个测试团队主管,在Harness发布的第二天就装上了。他做了这样一个实验——
选了一个中等复杂度的项目,让团队里一个3年经验的测试工程师手动完成“跑一遍回归测试+分析失败用例+修复”的全流程。同时,他用Harness跑同样的任务。
结果:工程师用了半天,Harness用了不到1小时。
“它不是完美的,”他跟我说,“有些修复方案需要人工确认,有些上下文它理解得不够准确。但效率差距已经大到不能忽视了。”
更让他焦虑的是另一件事:
“我以前招人,看的是会不会写自动化脚本、会不会搭框架。现在我忽然意识到——这些技能,AI都会了。 那我以后招人看什么?”
这个问题,问到了所有测试管理者的痛点上。
还有一个细节更扎心:DeepSeek内部早在今年3月就组建了Harness团队,负责人崔添翼是90后,拥有6枚ACM亚洲区域赛金牌,曾在顶级量化机构JaneStreet任职九年。8月1日他在X上招募Harness内测人员,引来了近800位报名者,横跨18个赛道。
这场变革不是突然发生的,是有预谋的、有组织的、有顶级人才押注的。
06 避坑指南:测试人面对Harness的5个错误反应
坑1:恐慌式逃避——“AI太强了,我转行算了”
Harness确实能干很多活,但它目前还是个“毛坯”:界面对不写代码的人算不上友好,开发者预览版的毛边随处可见。它“能干活,但得盯着”。极端自由带来的架构门槛,让未完全熟悉软件系统架构的工程师用起来捉襟见肘。
恐慌转行是最差的选择。 你现在积累的测试经验和业务理解,恰恰是AI最缺的。
坑2:鸵鸟心态——“这东西离我还远”
Harness发布不到12小时就有5万星,288个插件仓库在24小时内涌现。DeepSeek内部Harness团队人员仍然非常紧缺,每天都在面试。
这不是“未来的趋势”,这是“正在发生的事实”。
坑3:只会用、不会改
Harness最核心的设计是“一切皆插件”——模型、工具、界面、审批策略全部可以拆下来换掉。只会用现成的插件、不会自己改插件的人,迟早会被“会用+会改”的人替代。
坑4:只盯着技术,忽视业务理解
AI能跑测试、能修Bug,但它不知道业务的优先级、不知道风险的权重、不知道哪些问题必须人工介入。
测试工程师的核心价值正在从“执行者”转向“决策者”。看不懂业务、做不了风险评估的人,才是真正危险的。
坑5:等“稳定版”再学
Harness目前是v0.1开发者预览版,官方明确说“核心插件和基础接口未来几个月会快速演化”。等它稳定了再学,你就已经落后了。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。