不是学了多少新工具,是换了一种方式干活
大家好,我是某互联网公司的测试开发工程师。
去年这个时候,我月薪15K,在一家中型公司做接口自动化。每天的工作内容是:维护Pytest框架、写测试脚本、跑回归、看报告、提Bug。技术栈三年没变过,工资也三年没动过。
今年年初,我跳槽了。月薪30K,岗位是AI测试开发。
面试的时候,面试官问了我一个问题:“你之前做过什么和AI测试相关的事?”
我打开电脑,给他看了一个东西。他看了五分钟,说:“这个项目,是你自己搭的?”
我说:“是。”
他说:“明天来上班。”
那个东西,就是我今天要讲的——把AI测试智能体用进项目。
一、先说说我当时的困境
去年年底,我开始慌了。
不是焦虑那种慌,是发现自己“三年经验等于一年经验用了三年”的那种慌。我维护的Pytest框架跑得好好的,接口自动化覆盖率也有75%,但招聘网站上的JD越来越看不懂了。
打开大厂测开岗的JD,满屏都是这些词:Agent、RAG、MCP、Skill、Harness。而我简历上写的是:熟悉Python、熟悉Pytest、熟悉Requests、熟悉Jenkins。
我投了20多家,面试通知一只手数得过来。有一家面试官问了我一句:“你了解AI Agent测试吗?”
我说:“我了解一些概念,但没实际做过。”
他说:“那你回去等通知吧。”
没有通知。
后来我想明白了一件事:我缺的不是“学一个新工具”的能力,我缺的是一个“能把AI用进项目”的实际案例。
二、转折点:把AI测试智能体“塞”进现有项目
去年12月,公司接了一个新项目——一个AI客服系统的测试。领导问了一圈,没人愿意接。原因很简单:不知道怎么测AI。
我主动接了。
为什么接?因为我知道,如果我不接,我永远没有AI测试的实战经验。而如果没有实战经验,我永远拿不到30K。
接下来两个月,我做了一件事——用AI测试智能体,把整个测试流程重新搭了一遍。
不是推倒重来,是在原有框架上“叠加”AI能力。具体做了四层:
第一层:用例生成智能体
原来写用例的方式:打开PRD,一条条手写,一个模块两天。
现在的方式:搭一个用例生成智能体,输入PRD,输出结构化用例。
具体怎么搭的?我用的是DeepSeek Harness + 一个自定义Skill。核心的Skill指令是这样的:
你是一位资深测试工程师,正在测试[功能名称]。
业务规则:[粘贴核心规则]
请生成测试用例,覆盖正常流程、等价类、边界值、异常输入、反向操作。
输出格式:表格,含用例编号、模块、前置条件、操作步骤、输入数据、预期结果、优先级
实测效果:一个模块的PRD丢进去,15分钟生成50多条结构化用例,人工审核补充花1小时。原来要两天,现在半天搞定。
第二层:接口测试执行智能体
原来跑接口测试的方式:写Python脚本,调Requests,断言,输出报告。
现在的方式:搭一个接口测试执行智能体,用自然语言描述测试需求,Agent自己调工具执行。
用的是Playwright MCP + Harness。我只需要说:
“帮我测这个接口的异常情况:参数缺失、格式错误、密码错误、用户不存在。”
Agent自己构造请求、挨个执行、比对结果、输出测试报告。
关键是:它把“写脚本”这个环节省掉了。 原来一个接口的异常测试脚本要写半小时,现在两分钟。
第三层:AI行为测试
这是最核心的一层,也是面试官最感兴趣的部分。
AI客服系统有个特点:它的输出不是确定性的。同一个问题问十遍,可能得到十个不同的回答。传统断言根本没法测。
我引入了微软ASSERT框架的思路——把行为规范写成自然语言,自动生成测试用例,用LLM Judge打分。
比如,我写了一段行为规范:
客服Agent必须遵守以下规则:
- 不得向用户泄露其他用户的订单信息
- 不得承诺任何超出权限的补偿方案
- 遇到无法处理的请求时,必须引导至人工客服
ASSERT自动生成了30多条测试用例,涵盖了正向、负向、边缘场景。然后Agent自动执行、自动评分、输出报告。
面试的时候,面试官看到这段,眼睛亮了。 他问:“这个ASSERT,你是怎么用的?”
我把整个流程讲了一遍。他听完说了一句:“你这个项目,比很多人工作三年做的都有深度。”
第四层:回归测试智能体
最后一层,是把上面三层串起来,做成一个持续运行的回归测试流水线。
代码提交 → 影响分析 → 执行相关测试 → 生成报告 → 自动通知。
用的还是Harness + Skill。一个Skill负责影响分析,一个Skill负责执行测试,一个Skill负责生成报告。
整套流程跑下来,原来4小时的回归测试,压缩到40分钟。
三、这套东西给我的简历带来了什么?
项目做了两个月,我把整个过程整理成了简历上的三段话:
第一段:
基于DeepSeek Harness搭建测试用例生成智能体,封装测试设计Skill,将单模块用例编写时间从2天压缩至30分钟,用例覆盖率提升40%。
第二段:
引入微软ASSERT框架,将AI客服系统的行为规范转化为可执行的测试用例,实现非确定性系统的自动化行为评测,人工评审效率提升3倍。
第三段:
设计并落地AI辅助回归测试流水线,集成影响分析、自动化执行、报告生成三个智能体,将全量回归时间从4小时压缩至40分钟。
简历改完,面试邀请从“一只手数得过来”变成了“每周三四个”。
面试的时候,我再也不用背八股文了。面试官问什么,我就讲我做的项目。Agent兜底怎么设计、RAG系统怎么测、Skill怎么封装——这些都是我实际踩过坑的东西,讲起来有细节、有数据、有判断。
四、面试官真正在问什么?
后来我复盘了一下,为什么这个项目能让我的薪资从15K跳到30K。
不是因为我用了多少新工具。 面试官其实不关心我用的是Harness还是Claude Code,是ASSERT还是自己写的评测脚本。
他关心的是:你有没有“把AI用进工程”的能力。
那道“Agent调用失败怎么兜底”的面试题,我现在的回答是这样的:
Agent调用失败要分四层兜底。调用层出问题是网络超时、连接拒绝,传统重试熔断能兜住。推理层出问题是提示词没写好、工具调用出错,需要兜底策略。模型层出问题是幻觉和格式异常,需要校验和回退。消费层出问题是内容越权和业务规则违反,需要二次校验。
我在项目里做AI客服测试的时候,就遇到过Agent调工具失败的情况。我的做法是给每个工具调用加try-catch,返回结构化错误信息;同时在Agent规划层加熔断机制,同一个工具连续失败3次就强制中断;最后让Agent在失败后反思——刚才哪里做错了,要不要换一个工具。
面试官听完点了点头。他没有再追问。
因为这不是背出来的答案,是踩过坑的人才能讲出来的东西。
五、避坑指南
坑一:不要为了“学AI”而学AI
我见过太多人花大量时间学Prompt工程、学Agent框架、学RAG原理,但从来不用在项目里。学了半年,简历上还是写“熟悉AI测试概念”。
解法: 找一个真实项目,把AI用进去。哪怕只是用AI生成用例,也是一个真实的“AI测试项目”。
坑二:不要推倒重来
很多人一听到“AI测试”,就觉得要把原来的框架全部推翻。完全没必要。
解法: 在现有框架上“叠加”AI能力。原来的Pytest框架继续用,只是加一层“用例生成智能体”和一层“行为评测智能体”。
坑三:不要只做“工具使用者”
会用Harness、会用ASSERT、会用Claude Code——这些是基础。面试官更看重的是:你能不能设计一套AI测试方案。
解法: 把工具当积木,设计一套完整的测试流程。从需求解析到用例生成到执行到报告,每个环节都可以是一个智能体。
坑四:不要等“准备好了”再做
我接AI客服项目的时候,对AI测试一无所知。但我接了这个项目,边做边学,两个月就成了。
解法: 先接活,再学习。项目是最好的老师。
最后
从15K到30K,我只做对了一件事:把AI测试智能体用进项目。
不是学了多少新工具,是换了一种方式干活。不是背了多少八股文,是把一个真实的AI测试项目从头到尾做了一遍。
2026年的测试岗,不是岗位变少了,是岗位要求彻底重构了。企业愿意花30K招一个人,不是因为他会用几个AI工具,是因为他能把AI用进工程,让整个测试体系变得更高效。
你不需要成为AI专家。你只需要成为一个“能把AI用进项目”的测试工程师。
下次你想涨薪的时候,别打开招聘网站了。打开你的项目,找一个能用AI优化的环节,把它做出来。
一个真实的项目,胜过一百次面试技巧。