为什么团队用了 AI 之后,测试质量反而下降了!

简介: AI提效≠质量提升!本文揭示:AI生成用例虽快,但261条中仅26.4%可直接使用,多数需人工修正甚至完全错误。问题不在AI本身,而在“裸奔式”使用——忽视验证成本、缺失业务上下文、混淆生成与质检。测试人的核心价值正从执行转向判断:AI负责快,人负责对。

一、AI 提效之后,往往先崩的是质量

前两天刷到一篇同行的复盘。

「AI 提效半年后,我们的测试团队规模反而更大了」

用AI 提效半年,人数不降,反而变更多了?

这位老哥是认真做过团队实践的,观察写得很扎实。提测质量肉眼可见地下滑,需求做漏了,单位时间里测试捞出来的 bug 反而变多,最后测试团队加了 23% 的人,还是喊不够用。

然后我去自己的微信或和星球群里翻了翻聊天记录,发现类似的吐槽就没停过。

有个同学说,以前开发提测,至少自己心里有数,现在提上来的代码,开发自己都讲不清里面干了啥。

还有个说得更直白。产品经理拿 AI 写需求文档,开发拿 AI 总结需求文档,然后用 AI 把总结写成代码。

一条链路跑下来,全程无人知晓。

坦率的讲,我一点都不意外。

我做过一次公开的实测,拿一套电商项目的需求文档,让 AI 批量生成测试用例。

效率确实吓人。人工要写两天的用例,AI 几分钟出了两三百条,格式工整,字段齐全,看起来专业得不行。

然后我对其中一组 261 条用例做了质量评审。用我自研的评审 Skill,五个维度打分,七项量化指标,逐条过。

结果是什么呢。

261 条里,评审完能直接用的,只有 26.4%。

一半以上要人工改了才能用,还有两成干脆是错的。预期结果写着「页面展示正确」,提示信息是一对空引号,标题说测 A 功能,步骤里跑的却是 B。

你想想看,最气人的地方在哪。

AI 生成的东西,长了一张「好像都对」的脸。

这也是为什么我后来专门造了两个 Skill。一个 review-testcase,专门审 AI 生成的用例,一个 api-testscript-optimizer,专门给 AI 生成的脚本做体检。

经常有同学问我,AI 都能生成用例了,你为什么还要做质检工具。

现在你有答案了。因为裸奔的 AI 产出,真的会出事。

把这件事想透,其实就一句话。

AI 把「生成」的成本打到了接近零,但「验证」的成本,一分钱没降。

以前一个开发一天写 500 行代码,他自己至少读过每一行。现在 AI 一天给他 5000 行,他还是一个人,还是那双眼睛。

产量翻了十倍,质检员没变。

生产线提速了,质检工序还在用手搓。

更麻烦的是,AI 的错误和人的错误不是一个物种。人会犯懒,会漏写边界,这些毛病测试摸得很熟,闭着眼都知道往哪捞。AI 的错误是幻觉,是自信满满地编一个不存在的接口字段,是用一本正经的语气写错业务逻辑。

人的错误会心虚,AI 的错误永远理直气壮。

这才是最消耗测试的。

二、锅不在 AI,在用法和业务

写到这里,你可能以为我接下来要批判 AI 了。

还真不是。我得给它说句公道话。

质量下降这个锅,归根到底,并不是AI的错,更不是AI 能力不行,你想想我们是怎么用它的。

质量下降,我认真扒了一遍,核心就两个原因。一个是用法,一个是业务。

先说用法

同一个 AI,在不同人手里,是两件完全不同的东西。

会用的同学,把需求拆成小块一点点喂,把团队的历史坑、业务规则、边界条件全部交代清楚,出来的东西自己先过一遍,改完再验。AI 在他手里是个越用越顺手,业务上下文喂得越多,产出越来越贴合实际。

不会用的同学,需求文档原封不动整个丢进去,出来什么用什么。AI 的产出在他那里没有草稿这个概念,直接是成品。他甚至没意识到,AI 是在拿通用知识猜他的业务,猜中是运气,猜错是日常,而且猜错的部分,长得特别像对的。

再说业务

业务这块,AI 的表现是分裂的。

增删改查、表单流程、标准后台这类活,套路固定,模式成熟,AI 交付的质量确实能打。很多团队用 AI 用得风生水起,基本都赢在这类场景,他们的「AI 真香」,是真的。

但业务一复杂,特别是诸如管理后台这类,光开关就有几百个,金融计费、库存扣减、订单状态流转,还有十年老系统里那些没写在任何文档里的隐藏规则,这些知识根本不在 AI 的脑子里,在老员工的脑子里。人拿到一条用例能脑补出背后的门道,但AI 看不懂就是真看不懂。

所以你看,同一个 AI,有人用出五倍提效,有人用出一堆线上事故。差别从来不在工具,在用法,在把它塞进了什么业务。

说到底,提效省下来的时间,本来就有一大块该花在验证上,只是被我们顺手也省掉了。

省掉的那部分,迟早变成 bug 连本带利地还回来。

其实测试人自己身上,就挂着一面镜子。

十几年前自动化测试刚铺开的时候,一模一样的事情发生过一遍。一批团队火速把手工用例翻译成脚本,点了运行,绿灯,收工,感觉质量从此有保障了。

后来呢。脚本三天两头挂,挂了就重跑,维护不过来就放着烂,最后自动化变成一堆没人敢信的遗产。

整个行业用好几年才把这件事整明白。自动化测试,自动化的是执行,思考从来没有被自动化过。

现在AI时代,只是同一部电影,换了一批演员,重新上映。

所以聊到这里,我反倒觉得这事对测试人来说,听着不像坏消息。

生成越便宜,验证越值钱。AI 把代码和用例的产量打上去之后,整个团队最稀缺的,恰恰是那个能拍板说「这玩意到底对不对」的人。

三、给用 AI 提效的测试同学,几条实在建议

如果你正在被 AI 提测的质量折磨,下面这些是我自己每天在用的。不止用例生成,从上下文喂法到使用技巧,一次讲完。

1、把 AI 当新人带,上下文喂到位

别整篇需求一把梭。拆成小块,一次让它干一件事。团队的业务规则、历史坑点、字段约束、上线红线,这些「老员工默认知道」的东西,AI 一概不知道,你得白纸黑字喂给它。

喂得越多,它猜得越少。这是所有技巧里投入产出比最高的一条。

2、把AI 的产出当作是草稿,用不用决策留给人

哪怕它一次做对了九成,最后一成也得你亲手过。不是不信它,是过这最后一成的成本,本来就是你的岗位价值所在。

3、产出进流程前,必须过一道质检

用例也好脚本也好,这个环节不能省,谁劝都不好使。质检本身也要标准化,别靠手感 review,用维度,用指标,用 checklist,让每一次验收都有据可查。

4、让 AI 去干它真正擅长的活

用例生成只是入门。解读十年老系统、梳理没人看得懂的祖传代码、批量造测试数据、归因失败日志、把散落在聊天记录和口头交接里的业务规则整理成文档,这些活 AI 又快又稳。

这里有个进阶玩法。先让 AI 把老系统里的隐性知识挖出来整理好,再把这些上下文喂回去生成用例,质量和你硬丢一份需求文档过去,完全不是一个档次。

5、把 AI 犯过的每一个错,沉淀成回归用例

它编过一个不存在的字段,下次就拿这个考它。它的错题本越厚,它在你这个业务上就越老实。

6、复杂业务留一手,简单业务放手跑

增删改查这类标准场景,放心交给 AI,你抽查就行。计费、扣减、状态流转这类高风险路径,AI 出初稿,关键分支必须人肉再走一遍。

知道哪里能放手,比任何使用技巧都值钱。

AI 负责快,你负责对。

这两件事凑在一起,才有可能真正提效。

目录
相关文章
|
2月前
|
人工智能 JavaScript 测试技术
推荐一款开源工具:让 AI Agent 替你做 iOS、Android 自动化测试,能平替 Appium?
Appium统治移动端自动化测试12年,但脚本复杂、维护成本高。新开源工具agent-device(Callstack出品)开启范式革命:专为AI Agent设计,通过语义化元素引用(@e1)、全链路证据采集、探索→回放机制,让AI“看懂”界面自主操作,非Appium替代品,而是下一代智能测试基础设施。
470 0
|
1月前
|
人工智能 文字识别 JavaScript
AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
本文介绍`ui-testscript-enhancer`技能:自动为AI生成的UI测试脚本注入六大健壮性能力——智能等待、弹窗处理、iframe/Shadow DOM穿透、异常重试、失败截图录屏及验证码识别(集成ddddocr),5分钟将“能跑”的脚本升级为CI-ready的“跑得稳”生产级脚本。
281 2
AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
|
22天前
|
XML 人工智能 JSON
阿里开源:skill-up,一款Agent Skill 评测工具!
阿里开源的 skill-up 是首个专为 Agent Skill 设计的评测与演进工具,将软件测试方法论完整迁移:支持多引擎运行、声明式 YAML 用例、规则/脚本/LLM 三类断言,并内置自动修复与回归闭环。本地可跑,CI 可集成,让 Skill 质量可度量、可保障。
440 1
阿里开源:skill-up,一款Agent Skill 评测工具!
|
2月前
|
Web App开发 人工智能 jenkins
还在手写测试报告?推荐一款 AI 测试Skill:只需一句指令,自动生成专业定制化测试报告!
`api-report-generator`是一款AI驱动的接口测试报告生成工具,一句指令即可将执行数据自动转化为含11大专业分区、风险分级、优化建议及Allure联动的决策型HTML报告,告别“数字堆砌”,让报告真正有人看、能决策。
289 0
还在手写测试报告?推荐一款 AI 测试Skill:只需一句指令,自动生成专业定制化测试报告!
|
15天前
|
机器学习/深度学习 人工智能 自然语言处理
2026测试Skill大爆发:从“会写脚本”到“会设计智能体”
2026年测试行业正经历结构性变革:手工测试需求降47%,全栈测开增340%。“熟悉MCP协议”“具备Skill封装与工程化能力”已成硬性门槛,而非加分项。测试核心正从“写脚本”跃迁为“设计智能体”——验证对象由功能转向AI决策能力,底层资产从用例库升级为可复用Skill库。
|
19天前
|
人工智能 测试技术
公司从零开始推自动化测试,如何落地?
本文深度剖析团队自动化转型的底层逻辑:指出失败主因常是目标错位与管理缺位,而非技术本身。强调“三分技术、七分管理”,主张先对齐业务目标、小步试点、建立闭环与规范,并结合AI提效——但须严控生成质量与维护闭环。核心是将自动化打造成可持续演进的测试资产。
142 0
公司从零开始推自动化测试,如何落地?
|
21天前
|
人工智能 自然语言处理 API
阿里云百炼Token Plan最新AI模型订阅计划:个人版和企业版发布,最低39元1个月
阿里云百炼Token Plan是面向个人与企业用户的AI大模型订阅服务,按Credits计费,支持文本、图像、视频及第三方大模型(如Qwen、DeepSeek、Kimi等)。个人版39元/月起,企业版150元/席/月起,含不同档位Credits额度与Agent并发能力,可于阿里云CLUB中心领券优惠。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
121 1
|
1月前
|
Web App开发 人工智能 编解码
AI 测试提效 | UI 自动化测不出样式 bug?分享 ui-visual-assert + Skill 视觉断言与多浏览器适配方案
本文介绍 `ui-visual-assert` 技能:在 UI 自动化中补全视觉断言,解决 DOM 断言无法发现的样式错乱、布局偏移、响应式断裂、多浏览器渲染差异等问题。AI 自动生成截图比对脚本、响应式视口与跨浏览器配置,支持像素级校验与基线管理,实现“功能+视觉”全维度校验。
204 2
AI 测试提效 | UI 自动化测不出样式 bug?分享 ui-visual-assert + Skill 视觉断言与多浏览器适配方案
|
30天前
|
数据可视化
DeepSeek Harness 插件 DSH-Plugin 怎么安装?下载失败、下载慢?
DSH-Plugin Hub 是 DeepSeek Harness 官方插件市场,全新升级「装、卸、更、通知」闭环:一键安装(兼容命令行插件)、智能更新提醒、可视化卸载+自动重启提示、集成式通知中心。已收录4800+社区插件、4400+人工审核插件,官网:dsh-plugin.org。
1350 0
DeepSeek Harness 插件 DSH-Plugin 怎么安装?下载失败、下载慢?
|
2月前
|
Web App开发 人工智能 前端开发
10万人都在用的 top10 skills,我帮你试了!
Vercel推出的AI技能导航站skills.sh热度爆表,Top 10技能最高达240万热度!本文实测全榜,揭秘哪些真好用:find-skills是必备入口,frontend-design治“AI味”页面,tdd强制测试先行,grill-me灵魂拷问方案……按角色推荐组合,助你高效赋能AI助手。
868 0

热门文章

最新文章