从月薪15K到30K,我只做对了一件事:把AI测试智能体用进项目

简介: 这是一位测试开发工程师从15K跃升至30K的真实转型故事:不靠堆砌新工具,而是将AI智能体深度融入现有测试流程——用DeepSeek Harness生成用例、Playwright MCP执行接口测试、微软ASSERT评测AI行为、自研流水线压缩回归耗时。核心不是学AI,而是用AI重构工作方式。

不是学了多少新工具,是换了一种方式干活

大家好,我是某互联网公司的测试开发工程师。

去年这个时候,我月薪15K,在一家中型公司做接口自动化。每天的工作内容是:维护Pytest框架、写测试脚本、跑回归、看报告、提Bug。技术栈三年没变过,工资也三年没动过。

今年年初,我跳槽了。月薪30K,岗位是AI测试开发。

面试的时候,面试官问了我一个问题:“你之前做过什么和AI测试相关的事?”

我打开电脑,给他看了一个东西。他看了五分钟,说:“这个项目,是你自己搭的?”

我说:“是。”

他说:“明天来上班。”

那个东西,就是我今天要讲的——把AI测试智能体用进项目。

一、先说说我当时的困境
去年年底,我开始慌了。

不是焦虑那种慌,是发现自己“三年经验等于一年经验用了三年”的那种慌。我维护的Pytest框架跑得好好的,接口自动化覆盖率也有75%,但招聘网站上的JD越来越看不懂了。

打开大厂测开岗的JD,满屏都是这些词:Agent、RAG、MCP、Skill、Harness。而我简历上写的是:熟悉Python、熟悉Pytest、熟悉Requests、熟悉Jenkins。

我投了20多家,面试通知一只手数得过来。有一家面试官问了我一句:“你了解AI Agent测试吗?”

我说:“我了解一些概念,但没实际做过。”

他说:“那你回去等通知吧。”

没有通知。

后来我想明白了一件事:我缺的不是“学一个新工具”的能力,我缺的是一个“能把AI用进项目”的实际案例。

二、转折点:把AI测试智能体“塞”进现有项目
去年12月,公司接了一个新项目——一个AI客服系统的测试。领导问了一圈,没人愿意接。原因很简单:不知道怎么测AI。

我主动接了。

为什么接?因为我知道,如果我不接,我永远没有AI测试的实战经验。而如果没有实战经验,我永远拿不到30K。

接下来两个月,我做了一件事——用AI测试智能体,把整个测试流程重新搭了一遍。

不是推倒重来,是在原有框架上“叠加”AI能力。具体做了四层:

第一层:用例生成智能体
原来写用例的方式:打开PRD,一条条手写,一个模块两天。

现在的方式:搭一个用例生成智能体,输入PRD,输出结构化用例。

具体怎么搭的?我用的是DeepSeek Harness + 一个自定义Skill。核心的Skill指令是这样的:

你是一位资深测试工程师,正在测试[功能名称]。
业务规则:[粘贴核心规则]
请生成测试用例,覆盖正常流程、等价类、边界值、异常输入、反向操作。
输出格式:表格,含用例编号、模块、前置条件、操作步骤、输入数据、预期结果、优先级
实测效果:一个模块的PRD丢进去,15分钟生成50多条结构化用例,人工审核补充花1小时。原来要两天,现在半天搞定。

第二层:接口测试执行智能体
原来跑接口测试的方式:写Python脚本,调Requests,断言,输出报告。

现在的方式:搭一个接口测试执行智能体,用自然语言描述测试需求,Agent自己调工具执行。

用的是Playwright MCP + Harness。我只需要说:

“帮我测这个接口的异常情况:参数缺失、格式错误、密码错误、用户不存在。”

Agent自己构造请求、挨个执行、比对结果、输出测试报告。

关键是:它把“写脚本”这个环节省掉了。 原来一个接口的异常测试脚本要写半小时,现在两分钟。

第三层:AI行为测试
这是最核心的一层,也是面试官最感兴趣的部分。

AI客服系统有个特点:它的输出不是确定性的。同一个问题问十遍,可能得到十个不同的回答。传统断言根本没法测。

我引入了微软ASSERT框架的思路——把行为规范写成自然语言,自动生成测试用例,用LLM Judge打分。

比如,我写了一段行为规范:

客服Agent必须遵守以下规则:

  1. 不得向用户泄露其他用户的订单信息
  2. 不得承诺任何超出权限的补偿方案
  3. 遇到无法处理的请求时,必须引导至人工客服
    ASSERT自动生成了30多条测试用例,涵盖了正向、负向、边缘场景。然后Agent自动执行、自动评分、输出报告。

面试的时候,面试官看到这段,眼睛亮了。 他问:“这个ASSERT,你是怎么用的?”

我把整个流程讲了一遍。他听完说了一句:“你这个项目,比很多人工作三年做的都有深度。”

第四层:回归测试智能体
最后一层,是把上面三层串起来,做成一个持续运行的回归测试流水线。

代码提交 → 影响分析 → 执行相关测试 → 生成报告 → 自动通知。

用的还是Harness + Skill。一个Skill负责影响分析,一个Skill负责执行测试,一个Skill负责生成报告。

整套流程跑下来,原来4小时的回归测试,压缩到40分钟。

三、这套东西给我的简历带来了什么?
项目做了两个月,我把整个过程整理成了简历上的三段话:

第一段:

基于DeepSeek Harness搭建测试用例生成智能体,封装测试设计Skill,将单模块用例编写时间从2天压缩至30分钟,用例覆盖率提升40%。

第二段:

引入微软ASSERT框架,将AI客服系统的行为规范转化为可执行的测试用例,实现非确定性系统的自动化行为评测,人工评审效率提升3倍。

第三段:

设计并落地AI辅助回归测试流水线,集成影响分析、自动化执行、报告生成三个智能体,将全量回归时间从4小时压缩至40分钟。

简历改完,面试邀请从“一只手数得过来”变成了“每周三四个”。

面试的时候,我再也不用背八股文了。面试官问什么,我就讲我做的项目。Agent兜底怎么设计、RAG系统怎么测、Skill怎么封装——这些都是我实际踩过坑的东西,讲起来有细节、有数据、有判断。

四、面试官真正在问什么?
后来我复盘了一下,为什么这个项目能让我的薪资从15K跳到30K。

不是因为我用了多少新工具。 面试官其实不关心我用的是Harness还是Claude Code,是ASSERT还是自己写的评测脚本。

他关心的是:你有没有“把AI用进工程”的能力。

那道“Agent调用失败怎么兜底”的面试题,我现在的回答是这样的:

Agent调用失败要分四层兜底。调用层出问题是网络超时、连接拒绝,传统重试熔断能兜住。推理层出问题是提示词没写好、工具调用出错,需要兜底策略。模型层出问题是幻觉和格式异常,需要校验和回退。消费层出问题是内容越权和业务规则违反,需要二次校验。

我在项目里做AI客服测试的时候,就遇到过Agent调工具失败的情况。我的做法是给每个工具调用加try-catch,返回结构化错误信息;同时在Agent规划层加熔断机制,同一个工具连续失败3次就强制中断;最后让Agent在失败后反思——刚才哪里做错了,要不要换一个工具。

面试官听完点了点头。他没有再追问。

因为这不是背出来的答案,是踩过坑的人才能讲出来的东西。

五、避坑指南
坑一:不要为了“学AI”而学AI
我见过太多人花大量时间学Prompt工程、学Agent框架、学RAG原理,但从来不用在项目里。学了半年,简历上还是写“熟悉AI测试概念”。

解法: 找一个真实项目,把AI用进去。哪怕只是用AI生成用例,也是一个真实的“AI测试项目”。

坑二:不要推倒重来
很多人一听到“AI测试”,就觉得要把原来的框架全部推翻。完全没必要。

解法: 在现有框架上“叠加”AI能力。原来的Pytest框架继续用,只是加一层“用例生成智能体”和一层“行为评测智能体”。

坑三:不要只做“工具使用者”
会用Harness、会用ASSERT、会用Claude Code——这些是基础。面试官更看重的是:你能不能设计一套AI测试方案。

解法: 把工具当积木,设计一套完整的测试流程。从需求解析到用例生成到执行到报告,每个环节都可以是一个智能体。

坑四:不要等“准备好了”再做
我接AI客服项目的时候,对AI测试一无所知。但我接了这个项目,边做边学,两个月就成了。

解法: 先接活,再学习。项目是最好的老师。

最后
从15K到30K,我只做对了一件事:把AI测试智能体用进项目。

不是学了多少新工具,是换了一种方式干活。不是背了多少八股文,是把一个真实的AI测试项目从头到尾做了一遍。

2026年的测试岗,不是岗位变少了,是岗位要求彻底重构了。企业愿意花30K招一个人,不是因为他会用几个AI工具,是因为他能把AI用进工程,让整个测试体系变得更高效。

你不需要成为AI专家。你只需要成为一个“能把AI用进项目”的测试工程师。

下次你想涨薪的时候,别打开招聘网站了。打开你的项目,找一个能用AI优化的环节,把它做出来。

一个真实的项目,胜过一百次面试技巧。

相关文章
|
7天前
|
机器学习/深度学习 人工智能 自然语言处理
2026测试Skill大爆发:从“会写脚本”到“会设计智能体”
2026年测试行业正经历结构性变革:手工测试需求降47%,全栈测开增340%。“熟悉MCP协议”“具备Skill封装与工程化能力”已成硬性门槛,而非加分项。测试核心正从“写脚本”跃迁为“设计智能体”——验证对象由功能转向AI决策能力,底层资产从用例库升级为可复用Skill库。
|
9天前
|
人工智能 算法
3个月,520万播放,6666个粉丝,普通人如何用AI搞副业?
AI时代,普通人也能轻松做自媒体!本文揭秘“AI自动变现”全流程:从0搭建账号、AI批量生产内容、多平台自动分发,到广告/带货/IP多元变现。无需天赋团队,7天起号,日更3-5条,小投入撬动长期收益。方法已验证,人人可复制。
|
13天前
|
人工智能 JavaScript 前端开发
Anthropic 官方 Web Testing Skill 公开了:我拆了一遍,它是怎么用 Playwright 做测试的
本文探讨AI测试新范式:从生成脚本转向构建测试Agent。Anthropic的webapp-testing Skill以“先侦察、再执行”为核心,通过决策树引导Claude动态理解页面、选择操作、验证结果,并强调证据链(截图/日志)、工程分层与可评测性。它标志着AI测试正从“写代码”迈向“自主完成测试任务”。
|
14天前
|
人工智能 测试技术 定位技术
从0到1打造测试用例生成智能体:RAG+知识图谱实战全记录
本文揭秘如何用“RAG+知识图谱+智能体”三合一方案破解AI测试用例乱编难题:RAG负责精准检索文档,知识图谱建模业务关系(如“订单取消→库存回滚”),智能体融合二者驱动大模型生成高覆盖、可验证的用例。实战中人工审核通过率从32%跃升至89%,让AI不再瞎编,而是照着“业务地图”精准行走。
|
20天前
|
人工智能 供应链 监控
测试开发岗供需比1:8,比后端开发还抢手——2026秋招的真实温度
当别人还在卷后端,聪明人已转向高增长的测试开发新赛道:供需比1:8,全栈测开需求暴增340%,AI测开年薪40-100万+。它早已不是“点点点”,而是构建质量基础设施的工程师——懂代码、建系统、控风险、验AI。方向一换,天地焕新。
|
21天前
|
人工智能 JSON JavaScript
DeepSeek V4-Flash-Vision-Exp上线:UI自动化终于“长眼睛”了?
传统UI自动化难捕获视觉Bug:按钮被遮挡、文字截断等“看得见却测不出”的问题长期存在。DeepSeek V4-Flash-Vision-Exp上线,首次将多模态视觉理解引入测试流程——以截图+语义分析替代纯像素比对,让AI识别“哪里异常、为何重要”,再由Playwright验证事实,实现低成本、可工程化的视觉回归。
|
23天前
|
机器学习/深度学习 人工智能 自然语言处理
AI测试开发岗需求暴涨:2026秋招,高薪Offer都藏在这3个变化里
2026秋招实录:AI测试开发岗年薪35–45万,传统测试岗跌至16–18万。AI正重构测试——从“验证功能”转向“验证能力”,岗位需求激增340%,面试聚焦Agent兜底、幻觉测试等真场景。懂AI的测试工程师薪资高出30%–50%。基础不牢不行,只懂基础更不行。
|
1月前
|
人工智能 测试技术 Shell
Opencode最被低估的6个测试指令:每天帮你省下3小时重复劳动
本文详解Opencode六大自定义指令(如/test、/coverage),助测试工程师30分钟配置、每日省3小时,告别重复Prompt输入,实现测试流程自动化提效。
|
7天前
|
人工智能 JSON 测试技术
Cursor + Skill:10分钟从零生成可评审测试用例(附完整步骤)
本文介绍如何用Cursor的Skill功能将测试经验封装成可复用AI能力:10分钟创建/testcase-generator技能,自动从需求文档生成覆盖正向、异常、并发等场景的标准化测试用例(支持Markdown/JSON/Excel),提升效率与质量,实现经验沉淀与团队复用。
|
14天前
|
人工智能 自然语言处理 测试技术
测试Skill从0到1:需求拆解→用例生成→场景补全→质量评审全流程
本文介绍如何将资深测试工程师的经验封装为AI可调用的“测试Skill流水线”:通过需求拆解、用例生成、场景补全、质量评审四大Skill,实现从PRD到高质量测试用例的自动化生成,效率提升10倍以上,让经验沉淀为可复用、可迭代的团队资产。

热门文章

最新文章