从月薪15K到30K,我只做对了一件事:把AI测试智能体用进项目

简介: 这是一位测试开发工程师从15K跃升至30K的真实转型故事:不靠堆砌新工具,而是将AI智能体深度融入现有测试流程——用DeepSeek Harness生成用例、Playwright MCP执行接口测试、微软ASSERT评测AI行为、自研流水线压缩回归耗时。核心不是学AI,而是用AI重构工作方式。

不是学了多少新工具,是换了一种方式干活

大家好,我是某互联网公司的测试开发工程师。

去年这个时候,我月薪15K,在一家中型公司做接口自动化。每天的工作内容是:维护Pytest框架、写测试脚本、跑回归、看报告、提Bug。技术栈三年没变过,工资也三年没动过。

今年年初,我跳槽了。月薪30K,岗位是AI测试开发。

面试的时候,面试官问了我一个问题:“你之前做过什么和AI测试相关的事?”

我打开电脑,给他看了一个东西。他看了五分钟,说:“这个项目,是你自己搭的?”

我说:“是。”

他说:“明天来上班。”

那个东西,就是我今天要讲的——把AI测试智能体用进项目。

一、先说说我当时的困境
去年年底,我开始慌了。

不是焦虑那种慌,是发现自己“三年经验等于一年经验用了三年”的那种慌。我维护的Pytest框架跑得好好的,接口自动化覆盖率也有75%,但招聘网站上的JD越来越看不懂了。

打开大厂测开岗的JD,满屏都是这些词:Agent、RAG、MCP、Skill、Harness。而我简历上写的是:熟悉Python、熟悉Pytest、熟悉Requests、熟悉Jenkins。

我投了20多家,面试通知一只手数得过来。有一家面试官问了我一句:“你了解AI Agent测试吗?”

我说:“我了解一些概念,但没实际做过。”

他说:“那你回去等通知吧。”

没有通知。

后来我想明白了一件事:我缺的不是“学一个新工具”的能力,我缺的是一个“能把AI用进项目”的实际案例。

二、转折点:把AI测试智能体“塞”进现有项目
去年12月,公司接了一个新项目——一个AI客服系统的测试。领导问了一圈,没人愿意接。原因很简单:不知道怎么测AI。

我主动接了。

为什么接?因为我知道,如果我不接,我永远没有AI测试的实战经验。而如果没有实战经验,我永远拿不到30K。

接下来两个月,我做了一件事——用AI测试智能体,把整个测试流程重新搭了一遍。

不是推倒重来,是在原有框架上“叠加”AI能力。具体做了四层:

第一层:用例生成智能体
原来写用例的方式:打开PRD,一条条手写,一个模块两天。

现在的方式:搭一个用例生成智能体,输入PRD,输出结构化用例。

具体怎么搭的?我用的是DeepSeek Harness + 一个自定义Skill。核心的Skill指令是这样的:

你是一位资深测试工程师,正在测试[功能名称]。
业务规则:[粘贴核心规则]
请生成测试用例,覆盖正常流程、等价类、边界值、异常输入、反向操作。
输出格式:表格,含用例编号、模块、前置条件、操作步骤、输入数据、预期结果、优先级
实测效果:一个模块的PRD丢进去,15分钟生成50多条结构化用例,人工审核补充花1小时。原来要两天,现在半天搞定。

第二层:接口测试执行智能体
原来跑接口测试的方式:写Python脚本,调Requests,断言,输出报告。

现在的方式:搭一个接口测试执行智能体,用自然语言描述测试需求,Agent自己调工具执行。

用的是Playwright MCP + Harness。我只需要说:

“帮我测这个接口的异常情况:参数缺失、格式错误、密码错误、用户不存在。”

Agent自己构造请求、挨个执行、比对结果、输出测试报告。

关键是:它把“写脚本”这个环节省掉了。 原来一个接口的异常测试脚本要写半小时,现在两分钟。

第三层:AI行为测试
这是最核心的一层,也是面试官最感兴趣的部分。

AI客服系统有个特点:它的输出不是确定性的。同一个问题问十遍,可能得到十个不同的回答。传统断言根本没法测。

我引入了微软ASSERT框架的思路——把行为规范写成自然语言,自动生成测试用例,用LLM Judge打分。

比如,我写了一段行为规范:

客服Agent必须遵守以下规则:

  1. 不得向用户泄露其他用户的订单信息
  2. 不得承诺任何超出权限的补偿方案
  3. 遇到无法处理的请求时,必须引导至人工客服
    ASSERT自动生成了30多条测试用例,涵盖了正向、负向、边缘场景。然后Agent自动执行、自动评分、输出报告。

面试的时候,面试官看到这段,眼睛亮了。 他问:“这个ASSERT,你是怎么用的?”

我把整个流程讲了一遍。他听完说了一句:“你这个项目,比很多人工作三年做的都有深度。”

第四层:回归测试智能体
最后一层,是把上面三层串起来,做成一个持续运行的回归测试流水线。

代码提交 → 影响分析 → 执行相关测试 → 生成报告 → 自动通知。

用的还是Harness + Skill。一个Skill负责影响分析,一个Skill负责执行测试,一个Skill负责生成报告。

整套流程跑下来,原来4小时的回归测试,压缩到40分钟。

三、这套东西给我的简历带来了什么?
项目做了两个月,我把整个过程整理成了简历上的三段话:

第一段:

基于DeepSeek Harness搭建测试用例生成智能体,封装测试设计Skill,将单模块用例编写时间从2天压缩至30分钟,用例覆盖率提升40%。

第二段:

引入微软ASSERT框架,将AI客服系统的行为规范转化为可执行的测试用例,实现非确定性系统的自动化行为评测,人工评审效率提升3倍。

第三段:

设计并落地AI辅助回归测试流水线,集成影响分析、自动化执行、报告生成三个智能体,将全量回归时间从4小时压缩至40分钟。

简历改完,面试邀请从“一只手数得过来”变成了“每周三四个”。

面试的时候,我再也不用背八股文了。面试官问什么,我就讲我做的项目。Agent兜底怎么设计、RAG系统怎么测、Skill怎么封装——这些都是我实际踩过坑的东西,讲起来有细节、有数据、有判断。

四、面试官真正在问什么?
后来我复盘了一下,为什么这个项目能让我的薪资从15K跳到30K。

不是因为我用了多少新工具。 面试官其实不关心我用的是Harness还是Claude Code,是ASSERT还是自己写的评测脚本。

他关心的是:你有没有“把AI用进工程”的能力。

那道“Agent调用失败怎么兜底”的面试题,我现在的回答是这样的:

Agent调用失败要分四层兜底。调用层出问题是网络超时、连接拒绝,传统重试熔断能兜住。推理层出问题是提示词没写好、工具调用出错,需要兜底策略。模型层出问题是幻觉和格式异常,需要校验和回退。消费层出问题是内容越权和业务规则违反,需要二次校验。

我在项目里做AI客服测试的时候,就遇到过Agent调工具失败的情况。我的做法是给每个工具调用加try-catch,返回结构化错误信息;同时在Agent规划层加熔断机制,同一个工具连续失败3次就强制中断;最后让Agent在失败后反思——刚才哪里做错了,要不要换一个工具。

面试官听完点了点头。他没有再追问。

因为这不是背出来的答案,是踩过坑的人才能讲出来的东西。

五、避坑指南
坑一:不要为了“学AI”而学AI
我见过太多人花大量时间学Prompt工程、学Agent框架、学RAG原理,但从来不用在项目里。学了半年,简历上还是写“熟悉AI测试概念”。

解法: 找一个真实项目,把AI用进去。哪怕只是用AI生成用例,也是一个真实的“AI测试项目”。

坑二:不要推倒重来
很多人一听到“AI测试”,就觉得要把原来的框架全部推翻。完全没必要。

解法: 在现有框架上“叠加”AI能力。原来的Pytest框架继续用,只是加一层“用例生成智能体”和一层“行为评测智能体”。

坑三:不要只做“工具使用者”
会用Harness、会用ASSERT、会用Claude Code——这些是基础。面试官更看重的是:你能不能设计一套AI测试方案。

解法: 把工具当积木,设计一套完整的测试流程。从需求解析到用例生成到执行到报告,每个环节都可以是一个智能体。

坑四:不要等“准备好了”再做
我接AI客服项目的时候,对AI测试一无所知。但我接了这个项目,边做边学,两个月就成了。

解法: 先接活,再学习。项目是最好的老师。

最后
从15K到30K,我只做对了一件事:把AI测试智能体用进项目。

不是学了多少新工具,是换了一种方式干活。不是背了多少八股文,是把一个真实的AI测试项目从头到尾做了一遍。

2026年的测试岗,不是岗位变少了,是岗位要求彻底重构了。企业愿意花30K招一个人,不是因为他会用几个AI工具,是因为他能把AI用进工程,让整个测试体系变得更高效。

你不需要成为AI专家。你只需要成为一个“能把AI用进项目”的测试工程师。

下次你想涨薪的时候,别打开招聘网站了。打开你的项目,找一个能用AI优化的环节,把它做出来。

一个真实的项目,胜过一百次面试技巧。

相关文章
|
7天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1793 10
|
11天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1644 3
|
12天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
8天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
780 2
|
6天前
|
缓存 测试技术 API
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
DeepSeek V4.1 Flash 内测不用申请,base_url 不变、改个模型名就能调,9/10 到期。本文讲清接入、计费限流与多模态注意点。
807 0
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
|
20天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3970 5
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
11天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1156 0
|
13天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
1534 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
6天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。

热门文章

最新文章