为什么团队用了 AI 之后,测试质量反而下降了!

简介: AI提效≠质量提升!本文揭示:AI生成用例虽快,但261条中仅26.4%可直接使用,多数需人工修正甚至完全错误。问题不在AI本身,而在“裸奔式”使用——忽视验证成本、缺失业务上下文、混淆生成与质检。测试人的核心价值正从执行转向判断:AI负责快,人负责对。

一、AI 提效之后,往往先崩的是质量

前两天刷到一篇同行的复盘。

「AI 提效半年后,我们的测试团队规模反而更大了」

用AI 提效半年,人数不降,反而变更多了?

这位老哥是认真做过团队实践的,观察写得很扎实。提测质量肉眼可见地下滑,需求做漏了,单位时间里测试捞出来的 bug 反而变多,最后测试团队加了 23% 的人,还是喊不够用。

然后我去自己的微信或和星球群里翻了翻聊天记录,发现类似的吐槽就没停过。

有个同学说,以前开发提测,至少自己心里有数,现在提上来的代码,开发自己都讲不清里面干了啥。

还有个说得更直白。产品经理拿 AI 写需求文档,开发拿 AI 总结需求文档,然后用 AI 把总结写成代码。

一条链路跑下来,全程无人知晓。

坦率的讲,我一点都不意外。

我做过一次公开的实测,拿一套电商项目的需求文档,让 AI 批量生成测试用例。

效率确实吓人。人工要写两天的用例,AI 几分钟出了两三百条,格式工整,字段齐全,看起来专业得不行。

然后我对其中一组 261 条用例做了质量评审。用我自研的评审 Skill,五个维度打分,七项量化指标,逐条过。

结果是什么呢。

261 条里,评审完能直接用的,只有 26.4%。

一半以上要人工改了才能用,还有两成干脆是错的。预期结果写着「页面展示正确」,提示信息是一对空引号,标题说测 A 功能,步骤里跑的却是 B。

你想想看,最气人的地方在哪。

AI 生成的东西,长了一张「好像都对」的脸。

这也是为什么我后来专门造了两个 Skill。一个 review-testcase,专门审 AI 生成的用例,一个 api-testscript-optimizer,专门给 AI 生成的脚本做体检。

经常有同学问我,AI 都能生成用例了,你为什么还要做质检工具。

现在你有答案了。因为裸奔的 AI 产出,真的会出事。

把这件事想透,其实就一句话。

AI 把「生成」的成本打到了接近零,但「验证」的成本,一分钱没降。

以前一个开发一天写 500 行代码,他自己至少读过每一行。现在 AI 一天给他 5000 行,他还是一个人,还是那双眼睛。

产量翻了十倍,质检员没变。

生产线提速了,质检工序还在用手搓。

更麻烦的是,AI 的错误和人的错误不是一个物种。人会犯懒,会漏写边界,这些毛病测试摸得很熟,闭着眼都知道往哪捞。AI 的错误是幻觉,是自信满满地编一个不存在的接口字段,是用一本正经的语气写错业务逻辑。

人的错误会心虚,AI 的错误永远理直气壮。

这才是最消耗测试的。

二、锅不在 AI,在用法和业务

写到这里,你可能以为我接下来要批判 AI 了。

还真不是。我得给它说句公道话。

质量下降这个锅,归根到底,并不是AI的错,更不是AI 能力不行,你想想我们是怎么用它的。

质量下降,我认真扒了一遍,核心就两个原因。一个是用法,一个是业务。

先说用法

同一个 AI,在不同人手里,是两件完全不同的东西。

会用的同学,把需求拆成小块一点点喂,把团队的历史坑、业务规则、边界条件全部交代清楚,出来的东西自己先过一遍,改完再验。AI 在他手里是个越用越顺手,业务上下文喂得越多,产出越来越贴合实际。

不会用的同学,需求文档原封不动整个丢进去,出来什么用什么。AI 的产出在他那里没有草稿这个概念,直接是成品。他甚至没意识到,AI 是在拿通用知识猜他的业务,猜中是运气,猜错是日常,而且猜错的部分,长得特别像对的。

再说业务

业务这块,AI 的表现是分裂的。

增删改查、表单流程、标准后台这类活,套路固定,模式成熟,AI 交付的质量确实能打。很多团队用 AI 用得风生水起,基本都赢在这类场景,他们的「AI 真香」,是真的。

但业务一复杂,特别是诸如管理后台这类,光开关就有几百个,金融计费、库存扣减、订单状态流转,还有十年老系统里那些没写在任何文档里的隐藏规则,这些知识根本不在 AI 的脑子里,在老员工的脑子里。人拿到一条用例能脑补出背后的门道,但AI 看不懂就是真看不懂。

所以你看,同一个 AI,有人用出五倍提效,有人用出一堆线上事故。差别从来不在工具,在用法,在把它塞进了什么业务。

说到底,提效省下来的时间,本来就有一大块该花在验证上,只是被我们顺手也省掉了。

省掉的那部分,迟早变成 bug 连本带利地还回来。

其实测试人自己身上,就挂着一面镜子。

十几年前自动化测试刚铺开的时候,一模一样的事情发生过一遍。一批团队火速把手工用例翻译成脚本,点了运行,绿灯,收工,感觉质量从此有保障了。

后来呢。脚本三天两头挂,挂了就重跑,维护不过来就放着烂,最后自动化变成一堆没人敢信的遗产。

整个行业用好几年才把这件事整明白。自动化测试,自动化的是执行,思考从来没有被自动化过。

现在AI时代,只是同一部电影,换了一批演员,重新上映。

所以聊到这里,我反倒觉得这事对测试人来说,听着不像坏消息。

生成越便宜,验证越值钱。AI 把代码和用例的产量打上去之后,整个团队最稀缺的,恰恰是那个能拍板说「这玩意到底对不对」的人。

三、给用 AI 提效的测试同学,几条实在建议

如果你正在被 AI 提测的质量折磨,下面这些是我自己每天在用的。不止用例生成,从上下文喂法到使用技巧,一次讲完。

1、把 AI 当新人带,上下文喂到位

别整篇需求一把梭。拆成小块,一次让它干一件事。团队的业务规则、历史坑点、字段约束、上线红线,这些「老员工默认知道」的东西,AI 一概不知道,你得白纸黑字喂给它。

喂得越多,它猜得越少。这是所有技巧里投入产出比最高的一条。

2、把AI 的产出当作是草稿,用不用决策留给人

哪怕它一次做对了九成,最后一成也得你亲手过。不是不信它,是过这最后一成的成本,本来就是你的岗位价值所在。

3、产出进流程前,必须过一道质检

用例也好脚本也好,这个环节不能省,谁劝都不好使。质检本身也要标准化,别靠手感 review,用维度,用指标,用 checklist,让每一次验收都有据可查。

4、让 AI 去干它真正擅长的活

用例生成只是入门。解读十年老系统、梳理没人看得懂的祖传代码、批量造测试数据、归因失败日志、把散落在聊天记录和口头交接里的业务规则整理成文档,这些活 AI 又快又稳。

这里有个进阶玩法。先让 AI 把老系统里的隐性知识挖出来整理好,再把这些上下文喂回去生成用例,质量和你硬丢一份需求文档过去,完全不是一个档次。

5、把 AI 犯过的每一个错,沉淀成回归用例

它编过一个不存在的字段,下次就拿这个考它。它的错题本越厚,它在你这个业务上就越老实。

6、复杂业务留一手,简单业务放手跑

增删改查这类标准场景,放心交给 AI,你抽查就行。计费、扣减、状态流转这类高风险路径,AI 出初稿,关键分支必须人肉再走一遍。

知道哪里能放手,比任何使用技巧都值钱。

AI 负责快,你负责对。

这两件事凑在一起,才有可能真正提效。

目录
相关文章
|
19天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13114 84
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
7天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
2天前
|
缓存 人工智能 API
阿里云Qwen3.8‑Flash完整能力解析:模型特性、API调用实操与计费规则深度拆解
在AI应用快速落地的当下,开发者与企业选型大模型API,不再只单纯关注评测榜单分数,推理速度、上下文长度、多模态能力、工具调用稳定性以及实际调用成本,共同决定项目能否平稳上线。Qwen3.8‑Flash作为新一代多模态混合专家模型,主打高性能推理与低成本开销,面向编程开发、智能Agent工作流、超长文档解析、图文混合理解等高频场景,提供托管API服务,权重同时开放可供本地部署,兼容主流接口协议,能够无缝接入各类开发工具链。很多开发者在接入过程中,容易混淆普通按量Token计费、缓存计费、各类订阅计划之间的差异,造成实际账单超出预估。本文从模型底层架构、核心功能能力、适用场景、API调用实操、完
692 0
|
12天前
|
Web App开发 人工智能 API
16 个超火的 DeepSeek Harness 插件,大肥鱼已经落后 N 个版本了。。。
DeepSeek Harness 精选插件推荐合集,从图片识别、浏览器操控、多 Agent 协作到手机远程控制,一口气带你看完 DSH 社区热门的十几个插件,覆盖技能扩展、UI 界面增强、整活玩法三大类,让你的鲸鱼变得更强。
1736 4
|
13天前
|
人工智能 Java BI
【AI】DeepSeek Harness 安装、运行、管理插件
本文介绍了如何运行DeepSeek开源的Agent框架DeepSeek Harness(dsh)。主要内容包括:使用nvm安装适配的Node版本;通过代理加速克隆GitHub源码;使用pnpm安装依赖并启动项目;配置DeepSeek API Token;安装扩展功能的插件。该框架自带Web界面,支持模型适配、文件编辑等插件化功能
1918 1
|
人工智能 JavaScript 开发工具
DeepSeek Harness 本地安装与使用指南
DeepSeek Harness(DSH)是DeepSeek AI开源的Agent运行框架,支持本地文件操作、命令执行与工具调用。基于Cordis插件架构,具备高扩展性与强可控性,适合开发者搭建可控Agent环境或开展模型基准测试。当前为开发者预览版,需Node.js环境,推荐先用`npx @deepseek-ai/dsh web`快速体验。
5153 0
|
15天前
|
人工智能 JavaScript 测试技术
保姆级教程:DeepSeek Harness从安装到跑通测试,30分钟上手
DeepSeek Harness是DeepSeek开源的AI Agent运行时,主打“一行命令安装、5分钟跑通”。它让模型真正动手干活——读代码、跑测试、分析失败、生成修复方案。本文手把手教你30分钟从零上手,覆盖安装、配置、实测及避坑指南,助你快速掌握下一代AI编程范式。
|
8天前
|
人工智能 Linux iOS开发
Ollama使用教程:Ollama官网下载、Ollama本地部署大模型(2026最新)
Ollama 是一款免费开源的本地大模型运行工具,支持在 Windows/macOS/Linux 上离线运行 Qwen、DeepSeek、Llama 等主流开源模型,数据不出本机、隐私安全。提供 OpenAI 兼容 API,命令行一键拉取/运行/管理模型,无需联网,无调用限制,是开发者与 AI 爱好者部署本地 AI 助手的理想选择。(239 字)
|
14天前
|
人工智能 JavaScript 测试技术
从 0 到 1,DeepSeek Harness 保姆级安装与使用教程!
DeepSeek Harness是DeepSeek推出的开源Agent运行框架,秉持“一切皆插件”理念,支持模型、工具、技能、工作流等全模块自由替换与扩展。其核心Cordis内核实现动态插件管理,赋能Agent自进化。已成GitHub史上增速最快开源项目(15w+ Star),标志着国内大模型从拼价格转向重架构与生态的新拐点。
1349 6
从 0 到 1,DeepSeek Harness 保姆级安装与使用教程!

热门文章

最新文章