这段代码是AI写的吗?SemEval 2026任务13赛事回顾(下)

简介: 中国团队在SemEval 2026任务13的比拼中获佳绩

本文的上半部分简要介绍了SemEval 2026中任务13的赛题。接下来将继续介绍任务13的竞赛结果、以及参赛团队的部分解题思路。

任务13竞赛结果

来自中国电信的TeleAI团队参加了任务13全部三个子任务的角逐,最终获得了子任务A的第一名、子任务B的第一名、以及子任务C的第二名。子任务C的第一名由来自哈萨克斯坦的YoungDSMLKZ团队获得。子任务A的第二名由来自西班牙的Kaggle特级大师(Kaggle Grandmaster)Alejandro Mosquera获得。

TeleAI团队的技术方案[1]主要有以下特点:

  • 基于Qwen3-30B-A3B-Instruct,针对各子任务单独进行全参数微调;
  • 基于多个Checkpoints,进行软投票(Soft Voting)、硬投票(Hard Voting‌)、基于LightGBM的模型堆叠(Stacking)等多种模型集成;
  • 采用了多种数据预处理,包括对样本数量少的分类进行过采样、对长短不一的代码进行截断(Truncation)和填充(Padding)等;
  • 在推理阶段为各子任务单独进行提示语优化——在提示语中采用了详细的任务描述、分类描述、对预测结果的约束等,并对不同提示语通过剪枝和提前停止(Early Stopping)进行筛选。

各参赛团队采用较多的技术包括:

  • 基于CodeBERT、UniXcoder、Modern-BERT、CodeT5+等代码模型进行的微调、以及这些模型中的Embedding向量的使用;
  • 模型集成(Ensemble),包括logit层级的模型堆叠( Stacking)、XGBoost/CatBoost等;
  • 特征工程。

少数参赛团队还采用了以下的技术和思路。

多示例学习(Multiple Instance Learning)

经典的图像分类一般为一张图像赋予一个标签。然而在一些应用场景中,一张图像中的多个物体需要被“打包”赋予一个“包”的标签,例如一些医学图像需要被总结性地赋予一个“良性”或“恶性”的标签。这种多个物体被赋予一个总体标签的有监督学习就是“多示例学习”。

来自哈萨克斯坦的YoungDSMLKZ团队在此次竞赛中采用了以下的多示例学习的思路[2]:先将长段代码分成相互重叠的多个片段,各个片段经由UniXcoder代码模型产生编码表示,这些编码表示再经由max-pooling及CatBoost,最终形成整段代码的分类。

课程学习(Curriculum Learning)

机器学习中的课程学习是一种训练策略,该训练策略模仿人类在学习时通常采用的从简单到复杂的学习过程,将训练数据按一定顺序和进度进行组织,用于模型训练。

依照课程学习的思路,有的团队[3]通过在原始的代码数据集(干净数据集)中增加垃圾代码,形成有噪音数据集;然后先使用干净数据集进行模型微调,再使用有噪音数据集再次进行模型微调,最终达到了防止模型过拟合、提高模型鲁棒性的效果。

还有的团队[4]在模型训练中采用了3阶段的课程学习方法:

  • 第1阶段的模型训练侧重于不常见的、以及复杂的训练样本;
  • 第2阶段的模型训练使用原始的训练数据;
  • 第3阶段将训练数据与验证(Validation)数据合并,使用合并后的数据进行训练。

焦点损失函数(Focal Loss)

焦点损失函数的概念早在2017年就已被提出,其针对的问题是目标检测的训练中类别之间不平衡所形成的这样一类问题:样本多、容易被分类的类别在损失函数的计算中,通过积少成多,有可能形成较大的损失值占比。

为此,焦点损失函数在标准的交叉熵损失函数的基础上做了改进,使得容易被分类的类别在损失函数中具有较小的权重,从而使得难以被分类的类别在训练中得到更多重视。

焦点损失函数在此次部分参赛团队的模型训练中得到了使用。

参考文献

以下文献的使用许可协议均为CC BY 4.0
https://creativecommons.org/licenses/by/4.0/

[1] TeleAI at SemEval-2026 Task 13: Data-Centric Full-Parameter Fine-Tuning with Multi-Level Ensembling for Generated Code Detection
https://aclanthology.org/2026.semeval-1.38/

[2] YoungDSMLKZ at SemEval-2026 Task 13: MIL-UniXcoder with Meta-Stacking and Handcrafted Features for AI-Generated Code Detection
https://aclanthology.org/2026.semeval-1.137/

[3] Osint at SemEval-2026 Task 13: A Distribution-Aware Framework for Machine-Generated Code Detection and Multi-Source Authorship Attribution
https://aclanthology.org/2026.semeval-1.360/

[4] MALTO at SemEval-2026 Task 13: Detecting Human, AI, and Hybrid Code via Hard Negative Mining and Curriculum-Driven Ensembles
https://aclanthology.org/2026.semeval-1.304/

目录
相关文章
|
2月前
|
Arthas 监控 Java
Arthas trace 命令怎么用?一行定位最慢那行代码
Arthas trace 弥补 watch 只见结果不见过程的短板:追踪调用路径、统计耗时,快速定位慢接口与未执行分支
Arthas trace 命令怎么用?一行定位最慢那行代码
|
2月前
|
自然语言处理 安全 API
Agent Graph Engineering:从线性 Workflow 到可扩展 Agent 系统
本文介绍Agent图编排(Agent Graph Engineering)的核心思想:摒弃简单串行流程,以数据依赖关系构建节点(Agent/代码)与边(数据流)组成的有向图。强调清晰输入输出约定、并行执行、故障隔离、验证机制与动态循环设计,提升系统可组合性、稳定性与成本效率。
297 0
Agent Graph Engineering:从线性 Workflow 到可扩展 Agent 系统
|
2月前
|
机器学习/深度学习 人工智能 自然语言处理
GEO优化避坑指南:从业者必知的误区与对策
从搜索排名到生成式引用,内容价值的坐标系正在重置。本文不仅讲清坑在哪里,更给出能直接落地的改写示范、自审清单与监测步骤。
227 0
|
2月前
|
数据采集 存储 人工智能
DCMM 2.0 九大能力域技术架构深度解析:从 L2 到 L4 的评估升级路径
DCMM 2.0(GB/T 36073-2025)于2026年7月1日实施,能力域扩至9个、能力项增至33个、评估指标达486项。本文从技术架构视角深度解读九大能力域,结合五级成熟度、量化指标与企业实践,为数据架构师提供标准落地与架构设计的实战参考框架。
|
2月前
|
Web App开发 人工智能 缓存
自研 AOQ 协议,为多模态 AI 构建确定性传输底座
AOQ(AI Over QUIC)是专为多模态AI设计的自研传输协议,首创“实时+非实时”双模自适应机制,支持文本、音视频、文件全格式统一承载与强同步。基于QUIC深度优化,具备0-RTT建连、流级容错、智能带宽调度等能力,60%高丢包下仍保障流畅交互,突破弱网瓶颈,实现低延迟、高可靠、强同步三者兼得。
812 1
|
2月前
|
存储 缓存 安全
私有化知识库的异构存储架构实践:从CTO视角看企业级AI基础设施
本文从CTO视角剖析私有化AI知识库的异构存储实践,涵盖统一抽象层设计、混合云挂载、数据温度分层、物理级隔离及RAG协同优化等核心议题,融合真实企业部署经验,为构建安全、高效、低成本的企业级AI基础设施提供可落地的技术路径。(239字)
121 2
|
2月前
|
人工智能 自然语言处理 开发工具
Codex 实践系列 Vol.03:Codex 那些好用的 slash command
本文是Codex系列第三篇,聚焦真实项目协作:以AI志愿填报Demo为案例,详解`/status`、`/goal`、`/plan`等核心slash命令的实战用法——从确认环境、设定目标、规划修改,到聚焦文件、审查diff、复查逻辑、压缩长对话,系统提升AI编程的可控性与工程规范性。
279 2
Codex 实践系列 Vol.03:Codex 那些好用的 slash command
|
2月前
|
运维 监控 安全
Coding Agent 规则管理:CLAUDE.md、Skills、Hooks、Subagents 到底怎么选?
Claude Code 用分层设计把 Coding Agent 的规则拆成多种机制,让约束在合适的时机生效
284 1
Coding Agent 规则管理:CLAUDE.md、Skills、Hooks、Subagents 到底怎么选?
|
2月前
|
人工智能 JSON 自然语言处理
Agentforce Actions 创建与 UI 自定义指南
Agentforce Actions 创建方式与 UI 自定义完整指南。涵盖三种程序化创建方式(AuraEnabled 控制器/ Named Query API/ Apex @InvocableMethod)、Lightning Types 自定义 UI 体系(标准类型五步映射过程)、航班预订完整示例(从 Apex 类到输入/输出自定义 LWC 的改造前后对比)。
Agentforce Actions 创建与 UI 自定义指南
|
2月前
|
存储 JSON 前端开发
爱回收设备估价价格查询 API 接口全解析(含标准 JSON 返回示例)
爱回收设备估价价格查询 API 接口全解析(含标准 JSON 返回示例)