回看测试这个职业的十几年,你会发现一部被浪潮反复追赶的历史。
脚本自动化来的时候,有人说手工测试要完了;持续交付来的时候,有人说不懂流水线的测试要完了;大模型来的时候,又有人说不懂评测的要完了。
这一次,浪潮的名字叫 DeepSeek Harness:上线半小时破1万星,约42小时破10万星,目前超过15万星,被称为"GitHub 史上最快涨星项目"之一。它的终极目标更是直接——让 Agent 在运行中自己编写、安装、替换插件,实现自进化。
老问题再一次摆上台面:测试开发的下一站,到底在哪里?
我的答案,是三个判断。
判断一:测试对象,从"死的"变成"活的"
这是最根本的一个判断。
传统测试的一切方法,都建立在一个默认前提上:被测物是静态的。今天提交的代码,明天不会自己变样,用例结论可以放心复用。
而 dsh 指向的方向恰好相反。它的愿景是 Self-Evolving Agent Harness:Agent 能自检运行状态、即时编写并安装插件、在后续任务中复用;错误的修改,靠 Revertible Effects 机制留下的"反向方法"按相反顺序撤回。换句话说,昨天的系统和今天的系统,内部组件可能已经不一样了。
行业已经意识到了这一点:测试对象正从静态代码,变成会自我演化的系统。
对象活了,方法就得跟着活。未来的测试工作会向三个新坐标迁移:验边界——它能改什么;验回滚——改错了收得回来吗;验收敛——不同的改法,会不会走到同一个终点。dsh 自己的三个机制——可回滚副作用、响应式环境依赖、收敛性——恰好为这三类验证提供了原型。
判断二:质量职能,从下游上移到架构
第二个判断:测试不再只是研发流程的末端。
原因很现实:在一个会自进化的系统里,"能不能安全地进化"不是测出来的,是设计出来的。dsh 的底层由 Cordis 插件治理框架驱动,对应论文专门讨论"时空可组合性"——这就是在架构层面,把"演化可治理"当成一等公民来设计。
过去测试人反复追问的问题——能不能回滚、可不可控、一不一致——如今出现在框架作者的设计文档里。质量的话语权,正在上移。
这对测试开发人不是坏消息,而是重新定价:能参与定义演化规则的人,比只会执行用例的人,贵得多。
判断三:人与机器,在"定义目标"上重新分工
第三个判断:分工将被改写,但改写的不是"谁干活",而是"谁负责什么"。
dsh 的实测能力已经覆盖文件操作、命令执行、检索、Skills、任务编排、会话管理——执行层面的活,Agent 正在批量接管。而人退守到三件事上:定义目标、划定边界、验收结果。
这也间接回答了"失业论":机器拿走的是执行,人守住的是定义和验收。执行越强,验收越值钱——因为执行越强,跑偏的代价越大。
当然,愿景要打折着看。dsh 目前仍处于 developer preview 阶段,官方明确警告会有破坏性变更;实测响应偏慢、复杂长任务稳定性不足、API 成本随任务长度放大;业内也不乏"软件自进化是伪命题"的质疑。下一站清晰,但路还长。
路长,恰恰是人的机会。
写在最后:下一站,是长期主义
十几年的浪潮史反复证明一条规律:每一轮技术浪潮,淘汰的都不是测试这个职业,而是旧版本的测试人。脚本自动化送走了只会点点点的时代,也造就了测试开发工程师;这一轮 AI 浪潮会送走纯执行者,也会造就质量架构师。
所以,下一站不是某项具体技术,而是三种姿势:
对新对象保持敏感——被测物一旦变活,方法论必须第一时间更新;
对定义问题保持训练——会提问的人,永远比会答题的人稀缺;
对时间保持耐心——浪潮来得快,但站上浪潮的,都是提前学会游泳的人。
星数从1万涨到15万,只用了几周;一个职业的进化,却要以年为单位。与其盯着别人的涨星曲线,不如经营自己的成长曲线。
测试开发的下一站,不在浪潮的对岸,就在浪潮之上。
本文整理自霍格沃兹测试开发学社的原创分享,愿每个测试开发人都找到自己的下一站,我们下一篇见。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。