GitHub最新披露的大规模Rust迁移里,AI Agent写了大部分代码。这会让很多测试工程师紧张:开发都能大批量生成,自动化测试还有价值吗?
答案取决于你的工作定义。
如果价值是“根据接口文档写一段requests代码”,这部分确实会迅速被压缩。如果价值是“在不确定的变更中证明系统仍然可发布”,AI代码越多,这种能力越稀缺。
可以把职业迁移拆成四级:
- 脚本级:能调接口、断言字段、输出报告。
- 框架级:能管理数据、环境、并发、失败重跑与CI。
- 评测级:能定义Outcome、Behavior、Latency、Cost和Stability指标。
- Harness级:能把Trace、回放、权限、故障注入和发布门禁连成持续质量系统。
前两级不会消失,但会变成基础能力。真正拉开差距的,是能否从业务中抽出不变量,能否设计不被实现“带偏”的预言机,能否把线上失败变成下一版的回归用例。
对已经做了5年接口自动化的人,不需要把过去全部推翻。你可以按下面的映射表升级现有能力:
| 传统测试能力 | AI测开中的新用法 |
|---|---|
| 接口契约 | Tool Schema、MCP工具输入输出兼容 |
| 数据驱动 | Evaluation Dataset与分层样本 |
| 日志排查 | Trace、Trajectory与工具调用归因 |
| 故障注入 | 模型超时、工具拒绝、重复事件 |
| 持续集成 | Agent Regression与多目标Quality Gate |
学习时最容易走的弯路,是连续看很多Agent概念,却没有一份能运行的评测报告。更好的方式是围绕一个熟悉业务往深做:比如退款Agent,先测金额,再测工具顺序、权限范围、重试副作用、延迟和成本。
一个可执行的四周练习是:第一周用Python做工具契约和业务断言;第二周收集Agent Trace并写行为断言;第三周注入超时、重复事件和权限拒绝;第四周把回归集接入CI,输出一份发布报告。
这也是霍格沃兹测试开发学社在AI测开和Python测开路线里更值得投入的方向:不是和AI比谁写得快,而是学会给AI生成的变更建立可证明、可回归、可发布的质量证据。