独家揭秘:拼多多测试团队如何用AI把回归时间从3天压到2小时

简介: 去年双十一大促前,拼多多测试团队通过AI驱动的智能回归系统,将3万用例压缩至千级,回归周期从3天缩短至2小时内。核心在于用“变更影响分析+历史缺陷建模+智能调度”替代人工决策,精准识别高风险用例,告别无效“陪跑”。

去年双十一大促封网前夜,一位在拼多多做测试的朋友发了条朋友圈:“终于不用再通宵等回归结果了。”

底下炸出一堆同行。因为做过大促的人都知道,全量回归跑三天是常态。业务那边催命一样问“能不能上了”,你只能说“还在跑用例”。

后来我找他深聊了一次,信息量很大。他们一条核心业务线,从3万条回归用例压到几千条,再通过智能调度,把整个回归周期从3天压缩到了2小时以内。

不是靠堆机器,是靠换思路。

目录

大促前的回归噩梦,为什么突然消失了
回归的瓶颈不是执行速度,是决策速度
拆开这个AI大脑,里面就三件事
一个真实场景:订单状态机改动,AI怎么挑用例
想落地,先别急着上模型
测试工程师的新分工:写用例,还是写规则
大促前的回归噩梦,为什么突然消失了
过去拼多多的大促回归流程,和大多数厂一样:全量拉一遍自动化用例集,夜间跑,白天修脚本,晚上再跑。三万个用例,分布式执行最快也要几十个小时,中间还要处理环境抖动、数据冲突、脚本失效。

真正的痛苦不是时间长。是你跑完一轮,发现失败的用例里80%是环境问题,剩下20%才可能是真缺陷。排查又耗掉半天,大促窗口已经快关了。

现在的做法是:代码一提交,AI自动分析变更影响面,从全量用例库里精准圈定一个最小必要集,按风险排序,然后在弹性容器集群里并发执行。高风险用例先跑,低风险的并行跑,结果实时推送。

全量回归是测试团队的体力遮羞布,AI把它扯下来了。

回归的瓶颈不是执行速度,是决策速度
以前大家总想着怎么把用例跑得更快。搞分布式、搞并发、搞执行机扩容。但很少有人问一个问题:这些用例,真的都需要跑吗?

拼多多那个团队做过统计,历次大促前回归发现的缺陷,91%集中在不到15%的用例覆盖范围内。剩下85%的用例,连续十几次回归零缺陷,纯属“陪跑”。

回归测试的核心瓶颈,从来不是执行速度,而是“该跑哪些”的决策速度。

人工决策的问题很明显:靠经验拍脑袋,要么怕漏测不敢减,要么减了不该减的。一个改动到底影响了哪些模块、哪些接口、哪些历史风险点,靠人脑已经算不过来了。

他们做的事,本质就是把“变更影响分析”这个决策过程,从人脑移交给了模型。

拆开这个AI大脑,里面就三件事
这个AI系统不神秘,拆开来看就三个核心引擎。

第一,变更影响分析引擎。

每次代码提交,系统通过AST解析和运行时调用链数据,自动生成一张“变更影响拓扑图”。改了一个下单接口的入参校验逻辑,拓扑图会告诉你:这个接口被哪些服务调用,这些服务又关联哪些前端页面和后台任务,最终波及哪些业务流程。

第二,用例-风险关联模型。

这一步是把历史数据变成知识。系统会把过去三年所有线上缺陷、回归发现的Bug,和当时的代码变更、用例执行结果做关联训练。学出来的模型能回答一个问题:上一次改这个函数的时候,哪些用例挂了?挂了的是什么类型的缺陷?这次类似的改动,同样类型的用例是不是应该优先跑?

第三,智能分群与调度。

圈定出来的用例集,不会无脑全跑。系统按风险等级分三群:高风险的串行先跑,确保核心链路优先验证;中低风险的并行跑,用弹性容器动态扩容。结果一出来,自动聚类失败原因,把环境问题、脚本问题和真实缺陷分开标记。

三个引擎串起来,是一条清晰的流水线:

挑不准用例,再快的执行都是浪费机器。

一个真实场景:订单状态机改动,AI怎么挑用例
说个具体的场景。有次他们改了订单状态机,新增了一个“部分发货”的中间状态。

人工评估影响面,通常会想到:正向的发货流程、确认收货流程、超时自动取消的定时任务。很容易漏掉的是退款逆向流程。部分发货状态下发起退款,金额怎么计算?已发货部分和未发货部分如何分摊?如果退款成功,状态机能不能正确扭转回“已取消”?

人工漏掉这个场景不奇怪,因为正向开发和测试的思维惯性就是盯着主流程。

但他们的AI模型在分析这次变更时,从历史缺陷库里匹配到一条记录:两年前一次状态机枚举值调整,曾导致退款金额计算异常,线上出了一次资损事故。模型自动把那次事故关联的用例簇标记为高风险,推荐优先执行。结果真的发现了一个类似问题——部分发货退款时,金额分摊的精度误差导致总退款多了1分钱。

这种事靠人很难想起来,但数据记得。

想落地,先别急着上模型
聊完我觉得这东西确实好,但中小团队怎么搞?朋友给的建议很实在,三步走。

第一步,先别想着搞AI。先把两件基础的事做了:代码提交和用例建立关联标签,每次提测时自动推荐一个用例集。这个推荐算法可以简单到“基于模块名映射+上一次回归结果”,花一两周就能跑通。

第二步,积累数据。每一次回归的结果、每一次线上缺陷,都结构化记录下来,尤其是“哪个变更导致了哪个用例失败”这个对应关系。这比什么模型都值钱。没有这个数据积累,上再好的AI也是空中楼阁。

第三步,等数据量够了,再引入轻量级模型做关联推荐。不需要自研,用开源方案结合embedding检索就能出效果。

他们也不是一开始就做这么重的。前两个版本就是靠规则+人工标签撑起来的,模型是后来喂了足够多的数据才真正起作用。

工程上的事,先解决有无,再解决好坏。

测试工程师的新分工:写用例,还是写规则
这套系统跑起来之后,他们团队里测试工程师的工作内容变了不少。

以前大量的时间花在“挑用例、排计划、盯执行、查脚本”上。现在这些事系统全干了。那测试工程师做什么?一部分人转去做测试策略设计——怎么给AI制定风险分级规则,怎么设计用例标签体系,怎么验证推荐模型的准确率。另一部分人把精力投到探索性测试和深度缺陷挖掘上,那些AI还没学会的事。

这件事最值得思考的地方是:AI没取代测试,但会写AI规则的测试工程师,正在把不会的那批甩开。

你是在每天被回归进度追着跑,还是在设计一套能让回归自动完成的规则体系?这是两条完全不同的职业路径。

你们团队现在一次全量回归跑多久?跑完的结果里,有多少用例已经连续十次没有发现过任何问题了?

相关文章
|
2月前
|
SQL 人工智能 算法
AI岗位渗透率升到37.56%:测试岗正在分成“新旧两种人”
2026秋招AI岗位渗透率达37.56%,测试岗正加速分层:传统执行岗溢价消失,懂AI应用、Agent工程、LLM评估的全栈测开人才需求暴增340%,薪资高30%-50%。转型,刻不容缓。
|
6天前
|
人工智能 自然语言处理 测试技术
客服Agent查到了别人的订单:接口全通过,测试到底漏了哪一步?
本文揭示客服Agent“查错单”事故根源:接口正常≠行为正确。聚焦MCP场景下测试升级,提出用3个行为断言+4类回归用例,从工具发现、选择、参数映射到失败停止,确保Agent调用合法、精准、可控。
|
14天前
|
人工智能 自然语言处理 测试技术
Google 开源 ARTEMIS:AI Agent 如何接管 Android 真机测试?
Google开源的ARTEMIS是一款AI驱动的Android自动化测试框架,支持自然语言指令、跨App长流程操作、多模态控件识别(Accessibility+OCR+视觉模型),原生集成MCP协议,可无缝接入Antigravity等AI编程环境,实现“描述目标→自主规划→真机执行→结果分析”闭环,标志着移动端测试迈向AI Agent时代。
|
14天前
|
运维 Kubernetes Java
一次私教辅导,从Mock工具到Sidecar:我帮学员拆通了接口自动化的关键一环
本文记录霍格沃兹测试开发学社一次18分钟私教实录:学员卡在接口自动化Mock难题,老师层层拆解——从独立Mock服务的侵入性困境,到K8s下IP变动、代码写死等痛点,最终引出Sidecar无侵入方案,并自然升华至“测试左移”本质:推动代码可测性改进。小问题,大启发。
|
20天前
|
人工智能 自然语言处理 前端开发
字节用半年让85%的AI用例跑进CI/CD,你的团队还在为“AI生成不能用”发愁?
本文剖析字节跳动NL2Test Agent成功落地的五大关键:聚焦“用例转译”而非替代、先闭环再优化、LLM与程序分工协作、精准治理上下文、优先生成稳定断言。对比失败案例,揭示AI测试成败核心在工程设计,而非模型能力。
|
27天前
|
机器学习/深度学习 人工智能 自然语言处理
2026测试Skill大爆发:从“会写脚本”到“会设计智能体”
2026年测试行业正经历结构性变革:手工测试需求降47%,全栈测开增340%。“熟悉MCP协议”“具备Skill封装与工程化能力”已成硬性门槛,而非加分项。测试核心正从“写脚本”跃迁为“设计智能体”——验证对象由功能转向AI决策能力,底层资产从用例库升级为可复用Skill库。
|
6天前
|
人工智能 供应链 架构师
为什么你们团队的AI测试没效果?缺的不是工具
本文揭示AI测试失败的根源:非工具之过,而在目标错位。作者指出三大症结——缺验收标准、止步“生成”、工具驱动而非问题驱动,并提出三步解法:定义量化指标、构建闭环链路、坚持问题导向。工具只是放大器,真正关键在于清晰的问题意识与工程化能力。
|
1月前
|
人工智能 JavaScript 前端开发
Anthropic 官方 Web Testing Skill 公开了:我拆了一遍,它是怎么用 Playwright 做测试的
本文探讨AI测试新范式:从生成脚本转向构建测试Agent。Anthropic的webapp-testing Skill以“先侦察、再执行”为核心,通过决策树引导Claude动态理解页面、选择操作、验证结果,并强调证据链(截图/日志)、工程分层与可评测性。它标志着AI测试正从“写代码”迈向“自主完成测试任务”。
|
11天前
|
安全 测试技术 开发工具
Grok 4.7进Copilot后,测试团队先别比谁更聪明:先测它会不会把任务做得更危险
本文探讨模型升级中易被忽视的质量风险,强调测试需兼顾结果(Outcome)与过程(Trajectory)。提出任务分层、策略约束、正反样本门禁、多轮等价评测及CI灰度机制,将模型切换转化为可观察、可审计、可回滚的工程实验。
|
12天前
|
人工智能 测试技术 Python
AI 测试开始被做成产品了:毕业生的第一个作品集,该往哪个方向选
针对计算机专业毕业生,四个月打造高含金量测试方向作品集:聚焦真实痛点,拒绝重复造轮子;强调“可复现”而非仅“可运行”——用一条命令、真实日志、CI记录与90秒演示,让面试官当场验证。小而完整,胜过全面。

热门文章

最新文章