这段代码是AI写的吗?SemEval 2026任务13赛事回顾

简介: 中国团队在SemEval 2026任务13的比拼中获佳绩

SemEval(International Workshop on Semantic Evaluation)系列研讨会由ACL(Association for Computational Linguistics、国际计算语言学协会)下设的SIGLEX特别兴趣小组每年赞助并举办,其宗旨是提高自然语言语义分析领域的SOTA水平、并协助创建相关领域的高质量数据集。

SemEval每年组织计算语义分析方面的一系列竞赛;来自世界各地的参赛团队展示并比较各自的参赛系统。竞赛结果于每年的SemEval会议上进行交流总结。

SemEval 2026的各项竞赛已经结束。今年的竞赛包括13个任务(Tasks,可以理解为竞赛分项);多数任务中还包括多个子任务(Subtasks/Tracks,可以理解为竞赛小项)。

本文简要回顾一下SemEval 2026中任务13的赛题和竞赛结果。

任务13

识别AI生成的文本已经得到不少研究,但如何识别AI生成的软件代码,相关的研究还不是很多。准确地识别AI生成的软件代码,对于教育场景中学生编程作业的评判、工作面试场景中求职人员提交代码的评测、开发场景中软件代码质量和安全性的保障等无疑会起到关键作用[1]。

识别AI生成的代码过去常依靠查看代码中的命名、格式等,然而较新的代码生成模型可以模仿人在代码命名、代码格式、代码注释、代码结构等方面的风格,从而使得过去比较简单的识别手段难以奏效。

在这样的背景下,SemEval 2026中的任务13围绕AI生成软件代码的自动识别,设立了以下三个子任务[1]。

子任务A(Subtask A)

子任务A要求自动判断一段软件代码是AI生成的、还是人编写的。

该子任务中的代码数据不仅涉及C++、Python、Java等多种编程语言,还包含算法代码(类似于LeetCode的解题代码)、通用代码等多种类型的代码。评测阶段的代码数据相比开发阶段,覆盖更多种编程语言及更多种类型的代码,以检验参赛系统应对新的代码数据的能力。

子任务B(Subtask B)

子任务B要求自动判断一段代码是人编写的、还是哪个系列的模型生成的;需要识别的模型系列包括DeepSeek、Qwen、Yi(即“01”系列)、BigCode(即“StarCoder”系列)、Gemma、Phi、LLaMA、IBM-Granite、Mistral、以及OpenAI(即“GPT”系列)。

评测阶段的代码数据相比开发阶段,在每个模型系列中采用了更多版本的模型来生成代码。

子任务C(Subtask C)

子任务C要求自动判断一段软件代码属于以下哪一类:(1)完全由人编写的代码、(2)完全由AI生成的代码、(3)由人编写但由AI部分完成或重写的代码、(4)由AI模型基于提示语或强化训练而生成的、近似于人的编写风格的代码。

以上3个子任务的评测指标均采用Macro-F1。该指标首先计算每个数据分类的F1,然后取各个数据分类F1的平均值。

任务13的3个子任务均发布在了Kaggle竞赛平台上。3个子任务分别吸引了81个、34个和32个团队参赛。

任务13的比赛结果、以及参赛团队的解题思路都是怎样的?敬请阅读本文的下半部分。

参考文献

[1] SemEval-2026 Task 13: Detecting Machine-Generated Code with Multiple Programming Languages, Generators, and Application Scenarios

https://aclanthology.org/2026.semeval-1.445/

文献使用许可协议:CC BY 4.0

https://creativecommons.org/licenses/by/4.0/

目录
相关文章
|
25天前
|
机器学习/深度学习 数据采集 人工智能
这段代码是AI写的吗?SemEval 2026任务13赛事回顾(下)
中国团队在SemEval 2026任务13的比拼中获佳绩
83 0
|
1月前
|
机器学习/深度学习 自然语言处理 安全
谁能找到更多的Bug?DeepTest 2026上的一场工具竞赛(上)
ICSE 2026会议上的DeepTest研讨会举办了一场找Bug工具的竞赛
93 2
|
24天前
|
UED
用户体验能不能做好一点
连是用的那个model都不能直观的看到。
|
5月前
|
人工智能 自然语言处理 语音技术
CLEF 2026赛道简介:PAN、FinMMEval、CheckThat!(下)
CLEF 2026竞赛包含16个赛道,本文的下半部分简要介绍其中的FinMMEval和CheckThat!赛道
400 5
|
26天前
|
存储 消息中间件 人工智能
阿里云 Elasticsearch 日志采集与加工服务:让日志链路少一串组件,多一份稳定
阿里云 Elasticsearch 新版本推出日志采集与加工服务,将多源接入、流量缓冲、数据加工和可靠投递整合为云上托管能力,并与已有的写入优化、低成本存储和高性能查询能力形成完整链路,让海量日志处理变得更简单、更完整。 关键字: 阿里云 Elasticsearch、日志服务、日志采集与加工服务、读写分离、存算分离、并发查询、AI Agent
160 0
|
26天前
|
SQL 分布式计算 对象存储
Lake Search:ES x Paimon 让湖上多模态数据可搜可用
当图片、视频、文本和向量在 Paimon 中增长到 PB 级,传统“同步到湖外再建索引”的方式,会让搜索面临数据就绪慢、第二份事实数据成本高和版本治理复杂等问题。本文介绍阿里云 Elasticsearch 9.4 Search Lake 如何直接挂载与 Paimon 表版本关联的 Global Index,在不复制事实数据的前提下提供 BM25、kNN、结构化过滤、排序与聚合能力,并结合多模态样本湖场景拆解方案架构、Demo 及性能与成本取舍。 关键词:Search Lake、Apache Paimon、Elasticsearch 9.4、Global Index、OpenLake、多模态检索
238 0
|
5月前
|
人工智能 安全 算法
CLEF 2026赛道简介:PAN、FinMMEval、CheckThat!(上)
CLEF 2026竞赛包含16个赛道,本文分上下两部分介绍其中的3个赛道:PAN、FinMMEval和CheckThat!
635 1
|
11月前
|
自然语言处理 计算机视觉 Python
SoccerNet 2025挑战赛:赛题整理(一)
介绍SoccerNet数据集和SoccerNet 2025挑战赛,并梳理SoccerNet 2025挑战赛中的赛题一
1500 96
|
前端开发 JavaScript Android开发
《深度剖析:React Native与Flutter在社交应用中混合原生组件开发》
React Native通过JavaScript桥接机制调用原生组件,适合快速开发社交应用功能,如分享、相机等,但性能上可能在高并发场景下存在瓶颈。Flutter采用Dart语言和Skia引擎自绘制UI,跨平台一致性更强,热重载支持状态保留,提升开发效率,但在特定原生功能集成时需更多适配工作。两者各有优势:React Native社区成熟、上手容易;Flutter性能优越、代码统一。开发者需根据项目需求、团队技术栈及性能要求选择合适框架。
442 25
|
算法 搜索推荐 数据挖掘
二分查找法的应用场景
【10月更文挑战第9天】
1310 58