简历写“做了大模型应用”,不如展示一次失败样本怎样进入回归集

简介: 本项目聚焦AI系统质量闭环,以退款客服Agent为场景,构建轻量但完整的评测驱动开发体系:涵盖20+可失败用例、Trace行为断言、语义+确定性双层评估、CI自动阻断红线回归。强调“证明规则持续成立”,而非仅展示聊天效果,助力应届生在面试中展现AI测试工程思维。

不少校招项目的结构都一样:接一个模型API,做一个聊天页面,再放几张“回答正确”的截图。面试官真正追问时,候选人却说不清换模型、改Prompt或更新知识库后,怎么证明系统没有退步。

Apple在WWDC26介绍Evaluations框架时强调,生成式AI打破了“同样输入必得同样输出”的传统单测契约,需要通过评测驱动开发持续改进。你不必复刻Apple平台,也能把这套思想做成一个应届生可完成的AI测试项目。

项目目标:不是做聊天机器人,而是做质量闭环

选择退款客服Agent作为业务。规则只保留四条:无订单号先追问;订单不属于用户要拒绝;超过退款时间说明原因;工具超时最多重试一次。Agent本身可以很简单,项目价值在于怎样证明规则持续成立。

最小目录和模块

cases保存20条正常、边界和失败请求;agent实现知识检索与退款工具;traces记录文档命中和工具调用;evaluators包含确定性断言与语义评分;reports比较基线版本和候选版本;CI运行评测并阻断红线失败。

每条用例不固定整段答案,而是定义必须出现的事实、禁止动作和预期工具。例如缺订单号时可以有不同问法,但不得直接执行退款。

def test_missing_order_id(run):
assert run.trace.count('refund_order') == 0
assert run.follow_up_fields == ['order_id']
assert run.final_status == 'need_more_info'
做一次真实迭代,项目才像工程

第一版只判断最终回答,结果Agent说“请提供订单号”但后台仍调用了退款工具。第二版加入Trace断言,发现了行为问题。第三版给工具加幂等键和权限校验,再把这条失败样本加入回归集。

保留三次报告:改了什么、哪条用例从通过变失败、如何定位、修复后有没有伤害其他场景。面试时,这条迭代链比一张漂亮架构图更有说服力。

报告至少展示四个维度

业务规则通过率、危险工具误调用数、重复运行稳定性、平均延迟与成本。总体分数可以变化,但越权退款、重复执行等红线必须为零。换模型时使用同一数据集和工具模拟器,避免环境差异污染结论。

简历怎么写

“设计退款Agent持续评测项目,维护20+业务与失败用例;基于Trace校验知识引用、工具选择、权限和幂等行为,通过CI比较Prompt/模型版本并阻断高风险回归。”

这句话的每一部分都应能现场演示。面试官若问语义评分不稳定怎么办,你可以回答:业务红线使用确定性断言,表达质量才交给模型裁判,并用人工抽样校准。

面试可能继续追问什么

为什么不用答案相似度;如何防止评测集污染;线上新Badcase怎样进入回归;工具调用有多条合法路径时怎么写断言;模型成本下降但风险上升是否发布。准备这些问题,你展示的就不是“会调用API”,而是具备AI测试开发的完整思路。

校招项目不需要大而全。只要一个真实业务、一组能失败的用例、一条可回放Trace和一次有证据的版本改进,就足以和普通聊天Demo拉开差距。

数据集怎样避免只包含“你已经会修”的题

把用例分为固定回归和隐藏挑战两部分。日常调Prompt只看固定回归;发布前再跑隐藏样本,防止不断针对已知答案调参。线上出现新Badcase时先归因,再选择是否加入固定集,避免同一种问题重复堆几十条。

每条样本记录来源、业务规则版本和最后更新时间。退款政策变化后,旧期望不能继续参与评分。面试时能讲清数据治理,会比单纯展示更多用例更加分。

给项目加一个人工校准环节

随机抽取模型裁判判定的通过与失败各5条,由人工按同一Rubric复核。若分歧集中在“回答是否清楚”,可以改进语义评分;若分歧涉及退款资格,就应把规则改成确定性断言。

这一步能回答面试官常问的问题:你怎么知道评测器本身是对的?答案不是模型更强,而是业务红线程序化、主观维度有人类校准、分歧会持续回写。

项目最终展示顺序也很重要:先演示一个漏检,再打开Trace定位,随后展示新增断言和版本对比,最后让CI阻断回归。四分钟内讲清一次质量闭环,比十分钟介绍技术栈更容易让人记住。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

相关文章
|
2天前
|
JSON 人工智能 测试技术
Playwright v1.63 把 reporter 做成插件:同一批红灯终于不用写三套报告
Playwright v1.63 首次将 reporter 升级为可编程接口,解耦采集、聚合、呈现三层职责:支持多 reporter 并行输出(如 line+json)、PluginInfo 挂载自定义面板、插件可读自身配置。核心价值是确立「单一事实源」——失败判定与指标计算只做一次,彻底解决三套报告口径不一、重复解析、改一处炸三处的顽疾。
|
2天前
|
人工智能 测试技术 定位技术
用 Agent Skills 重构测试流程:从用例生成到缺陷定位
本文介绍如何用Agent Skills重构支付网关回归测试流程:将传统断点式人工流程(需求→用例→执行→排查→Bug)拆解为四大可复用能力单元——需求拆解、用例生成、失败归因、缺陷定位,并通过CI流水线自动串联。实测周期从5天压缩至1.5天,关键在于把隐性经验封装为标准化、可复用、可验证的AI技能,实现“人只做最终判断”。
|
2天前
|
人工智能 自然语言处理 安全
阿里云百炼产品月报【2026年9月】
阿里云百炼本月重磅升级:Qwen3.8全模态实时模型上线,Token Plan取消周限额、新增Essential套餐及Agent Harness工具权益;Flow Agent预置模板即开即用,MCP广场上新46项服务,覆盖科研、金融、多媒体等场景;应用与Skill广场新增超30款模板及解决方案,控制台全面焕新,助力企业高效构建AI应用。
184 0
|
22天前
|
SQL 测试技术 数据库连接
我用ChatGPT把回归测试从3天压到3小时,提示词全公开
本文分享如何用ChatGPT优化电商后台回归测试:通过提示词引导,实现用例梳理、自动化脚本生成与日志分析三步提效,将3天人工测试压缩至3小时。强调其辅助定位而非替代人力,聚焦释放工程师精力于高价值工作。
|
18天前
|
SQL 人工智能 安全
Agent Harness 又要多一层?Jev 开始接管这些高频判断
Jev作为新型System One Model,专司Agent中高频、明确的判断任务(如工具路由、技能筛选、上下文过滤、安全守门与执行复核),将LLM从繁重决策中解放,推动Agent架构向“规则+决策模型+LLM+工具”多层协同演进。
|
18天前
|
人工智能 JSON 测试技术
Agent 里为什么不该什么都交给大模型?Jev 给了一个新答案
Jev是TypeSafe AI于2026年9月推出的首款“系统级决策模型”,专为AI工程化设计:不生成文本,专注分类、路由、评分等结构化判断,输出带置信度的类型化决策(如“高风险:92%”)。它响应快、成本低,填补Agent/RAG/测试平台中高频轻量判断的空白,推动AI架构从“一模型通吃”走向分层协同。
|
18天前
|
人工智能 自然语言处理 测试技术
Google 开源 ARTEMIS:AI Agent 如何接管 Android 真机测试?
Google开源的ARTEMIS是一款AI驱动的Android自动化测试框架,支持自然语言指令、跨App长流程操作、多模态控件识别(Accessibility+OCR+视觉模型),原生集成MCP协议,可无缝接入Antigravity等AI编程环境,实现“描述目标→自主规划→真机执行→结果分析”闭环,标志着移动端测试迈向AI Agent时代。
|
21天前
|
人工智能 监控 安全
DeepSeek Harness爆火,测试人能拿它做什么?这5个场景最实用
本文揭秘DeepSeek在测试领域的5大实战用法:用例生成、接口自动化、代码审查、单元测试、日志分析,辅以详细步骤与避坑指南。实测可减少60%-70%重复劳动,强调“AI代劳+人工审核”——替手不替脑。
|
24天前
|
人工智能 自然语言处理 前端开发
字节用半年让85%的AI用例跑进CI/CD,你的团队还在为“AI生成不能用”发愁?
本文剖析字节跳动NL2Test Agent成功落地的五大关键:聚焦“用例转译”而非替代、先闭环再优化、LLM与程序分工协作、精准治理上下文、优先生成稳定断言。对比失败案例,揭示AI测试成败核心在工程设计,而非模型能力。
|
1天前
|
人工智能 自然语言处理 运维
数字化转型指南:企业如何选择合适的智能客服系统?
智能客服选型正从“能答问”转向“能办事”。瓴羊Quick Service融合大模型与AI Agent,支持语义理解、任务闭环执行(查物流、改地址等)、全渠道统一接入及灵活部署,已服务5万+企业。选型需聚焦场景匹配、任务完成率与知识库运营,而非仅看问答准确率。

热门文章

最新文章