谁能找到更多的Bug?DeepTest 2026上的一场工具竞赛(下)

简介: ICSE 2026会议上的DeepTest研讨会举办了一场找Bug工具的竞赛;本篇简要介绍各参赛团队所提交的工具

本文的上半部分围绕DeepTest 2026研讨会所举办的测试工具竞赛,简要介绍了该竞赛的背景和赛事安排。在该竞赛的参赛团队中,有4个团队最终提交了测试工具。接下来将简要介绍一下这4个团队所提交的测试工具。

ATLAS

获评测总分第1名的测试工具ATLAS[1]由来自巴西PUC-Rio大学的团队开发。该团队在ATLAS中采用了以下多种策略:

  • 人在承受外界压力时容易遗忘或者简化处理一些知识;该团队受该现象的启发,让ATLAS在向汽车辅助驾驶LLM提问时增加紧迫语气,采用的方法包括在提问中增加“立刻”、“越快越好”等词语、使用短句提问、模仿司机在承受压力时的说话方式等;
  • 统计汽车用户手册中的哪些安全警示信息在已有提问中被采用过,并在后续提问中优先采用未被采用过的安全警示信息,以提高问题的多样性;
  • 对于那些已在提问中被多次采用过、但尚未导致回答错误的安全警示信息,套用其它的、导致过回答错误的提问方式,并重新提问;
  • 为了进一步提高提问的多样性,尝试在提问中添加填充词(例如“嗯”、“你知道吗”等)、改写已有提问、以及交叉组合两种提问的风格(优先选用导致过回答错误的提问)。

Exida

获评测总分第2名的测试工具Exida[2]由来自德国的Exida公司、宝马集团(BMW Group)、以及慕尼黑工业大学的人员共同开发。该团队为了减少提问触发安全警示的可能,采用了以下3个步骤:

  1. 生成需要查询汽车用户手册的场景——通过实验,挖掘出一些能够降低汽车辅助驾驶LLM发现险情能力的关键词(包括一些天气状况、目的地、驾驶行为、驾驶状况、与时间紧迫性相关的词语等);另外通过指令避免在生成场景时生成比较抽象的意图,以防止汽车辅助驾驶LLM通过查询资料库来补充缺失的上下文;
  2. 从上一步生成的场景中抽取用户意图;
  3. 将所生成场景中的片段、抽取出的用户意图、以及一些随机词语(提问开头语、紧急情况用语等)进行组合,并生成一批提问;使用Jaccard相似度过滤这些提问,以保障生成提问的多样性。

Exida在“错误率”这一评测指标上达到了各参赛工具中的最佳。

Warnless

获评测总分第3名的测试工具Warnless[3]由来自英国的伦敦大学学院(简称UCL)和德国的慕尼黑工业大学的人员共同开发。该团队发现:不同的安全警示信息在汽车辅助驾驶LLM的回答中被遗漏的可能性并不相同。因此,该团队开发的Warnless依据动态统计出的不同安全警示信息在LLM回答中被遗漏的概率,来指导后续提问对于安全警示信息的选择,使得较多导致过回答错误的安全警示信息后续有较大可能再次被选用。

在Warnless中,用于生成提问的提示语中包含了以下的信息:所选择的安全警示信息、与该安全警示信息相关的汽车部件信息、基于该安全警示信息的曾经生成的提问及回答效果、生成提问的任务描述、少量学习样本(Few-Shot Examples)等。开发团队在提示语的优化过程中采用了DSPy提示语优化工具。

CRISP

获评测总分第4名的测试工具CRISP[4]由来自宝马集团荷兰公司的人员开发。在生成测试提问时,CRISP首先基于所选择的安全警示信息提取出主题短语,然后补充相关的场景(例如天气、维修、汽车拖挂等),最终生成简短、具体的提问,以诱导汽车辅助驾驶LLM用简短的方式回答,增加汽车辅助驾驶LLM在回答中遗漏安全警示内容的机会。

CRISP还记录下每个安全警示信息是否造成错误回答,并在后续选择安全警示信息生成提问时,优先选择曾经造成过错误回答的安全警示信息。

在评测中,CRISP所发现的错误回答在绝对数量上位列各参赛工具的第1名,彰显了多样化测试方法在评测LLM应用中的重要性。

Random

基线工具Random根据随机选取的汽车用户手册中的安全警示信息,借助LLM生成测试提问。

下图中列出了上述各工具各自生成的一条提问[5];各提问针对的都是与“在汽车中安装婴儿座椅‌”相关的安全警示信息。

Table_2.jpg

参考资料

以下资料的使用许可协议均为CC BY 4.0
https://creativecommons.org/licenses/by/4.0/

[1] ATLAS: Adaptive Test Learning And Selection at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796500

[2] Exida Test Generator at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796501

[3] Warnless at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796503

[4] Contextual Risk-Driven Input Structuring for Probing (CRISP) at the DeepTest 2026 Tool Competition
https://doi.org/10.1145/3786154.3796502

[5] DeepTest Tool Competition 2026: Benchmarking an LLM-Based Automotive Assistant
https://arxiv.org/abs/2604.12615

目录
相关文章
|
1月前
|
消息中间件 网络协议 API
阿里云邮件推送(DirectMail)对接使用完全指南:从开通到生产级实践
本文系统性地介绍了阿里云邮件推送(DirectMail)服务的完整对接流程。首先从产品开通与基础概念入手,详细讲解了发信域名的配置方法与DNS解析要点。随后深入发信地址的创建、SMTP密码设置与回信地址验证等关键环节。文章重点剖析了邮件推送的三种核心发送方式——控制台、API接口与SMTP协议,并分别提供了Java和Python的完整代码示例。在邮件模板管理部分,详细说明了模板创建、变量替换与审核流程。此外,本文还涵盖了邮件标签、收件人列表、IP防护、异步通知等高级功能,以及数据统计与监控的最佳实践。最后,针对信誉等级、退信处理、频率限制等常见问题提供了实用的解决方案。无论你是初次接入邮件推送
|
5月前
|
人工智能 自然语言处理 语音技术
CLEF 2026赛道简介:PAN、FinMMEval、CheckThat!(下)
CLEF 2026竞赛包含16个赛道,本文的下半部分简要介绍其中的FinMMEval和CheckThat!赛道
405 5
|
5月前
|
人工智能 安全 算法
CLEF 2026赛道简介:PAN、FinMMEval、CheckThat!(上)
CLEF 2026竞赛包含16个赛道,本文分上下两部分介绍其中的3个赛道:PAN、FinMMEval和CheckThat!
650 1
|
1月前
|
人工智能 缓存 自然语言处理
阿里云百炼大模型按量付费、Token Plan团队版、Coding Plan、AI通用型节省计划计费规则与选型策略
本文系统梳理了阿里云百炼平台的全量计费规则,覆盖六大核心计费场景,帮助开发者与企业理清成本逻辑、避免超支。平台采用“开通免费、按需付费”基础模式,文本类按输入/输出Token分别计费,图像按张、视频按秒计费,新用户可领超7000万Tokens免费额度。同时详细说明三类订阅产品:Token Plan团队版三档坐席198元/月起,Coding Plan按调用次数计费支持额度滚动恢复,AI通用型节省计划1000元起购,全预付享最高折扣,清晰标注抵扣范围与优先级,为不同使用强度的用户提供精准成本参考。
|
1月前
|
人工智能 安全 Java
AI 编程时代的质量底座:SDD 规范驱动与 TDD 测试驱动深度实战
本文提出AI编程时代高效开发新范式:SDD(规范驱动开发)+TDD(测试驱动开发)组合。SDD定义清晰、结构化的行为契约,TDD通过测试固化契约并验证实现;AI专注中间代码生成,人聚焦需求理解与质量把控。实践表明,该方法可使线上bug率降72%、迭代速度提40%,真正兼顾效率与质量。
384 1
|
1月前
|
存储 缓存 安全
OpenClaw中文专用版TopClaw下载,3分钟免费安装部署!
TopClaw是OpenClaw官方中文版,专为国内用户优化:一键安装、全中文界面、本地存储、零配置。支持Win10/11、Mac(Intel/M1/M2),3分钟极速部署,免注册、纯免费、无隐私风险,新手也能轻松上手。
409 2
|
8月前
|
机器学习/深度学习 数据采集 自然语言处理
基于深度学习+NLP豆瓣电影数据爬虫可视化推荐系统
本研究构建基于深度学习与NLP的豆瓣电影数据系统,融合LSTM、BERT与CNN技术,实现高效爬取、情感分析、个性化推荐与动态可视化,提升影视数据分析效率与推荐精准度,推动产业智能化升级。
|
11月前
|
自然语言处理 计算机视觉 Python
SoccerNet 2025挑战赛:赛题整理(一)
介绍SoccerNet数据集和SoccerNet 2025挑战赛,并梳理SoccerNet 2025挑战赛中的赛题一
1515 96
|
2月前
|
SQL 人工智能 安全
别再让 AI 温柔地夸你的烂代码了:Code Review 提示词该这样写
AI代码审查不能只求“温柔”,而要像资深工程师一样犀利。本文揭示:模糊提示=无效审查,必须用高精度角色锚点(如Google Staff Engineer)、硬性约束(P0-P3风险分级、可运行重构代码)和结构化输出,让AI真正成为生产级审查助手。提示词,已是工程规范新一环。
543 0
别再让 AI 温柔地夸你的烂代码了:Code Review 提示词该这样写
|
2月前
|
供应链 安全 Linux
2026 年 5 月网络安全威胁复盘:Linux 漏洞、防御工具 0day 与供应链风险治理研究
本文剖析2026年5月全球网络空间五大高危威胁:Linux内核集中爆发CopyFail等漏洞、防御软件自身0day缺陷、路由器规模化僵尸网络、开发工具供应链投毒、高级精准钓鱼攻击。基于真实事件与PoC代码,提出覆盖终端、网络、供应链、人员的一体化主动防御框架,助力关键基础设施提升复合攻击抵御能力。(239字)
346 2