SoccerNet 2026赛题整理(上)

简介: 没进世界杯没关系,中国团队在足球视频理解的国际竞赛中获佳绩

一年一度的SoccerNet竞赛曾被比作足球视频理解领域的世界杯。SoccerNet竞赛创始于2021年,迄今已举办了六届,组织方团队主要来自欧洲、中东和中国的多家大学、科技企业和科研机构。

SoccerNet竞赛(https://www.soccer-net.org)的内容一般涉及足球比赛视频中的动作识别、摄像机校准、球员重识别(Re-Identification)和跟踪等,竞赛结果近年来每年在CVPR会议的CVsports研讨会上进行总结交流。

今年的SoccerNet竞赛(即SoccerNet 2026)已于四月下旬结束。 SoccerNet 2026吸引了全球四百多个团队参赛。中国的多个团队在此次多个赛道的角逐中获得了包括第一名在内的多项优胜名次。

SoccerNet 2026设立了以下五个赛道[1]。

球动作预测

球动作预测(Ball Action Anticipation,简称BAA)赛道要求根据30秒的足球比赛视频,预测接下来5秒内与球相关的动作的类别和发生时间;其中,动作类别有传球、头球、掷界外球、射门等10种。

Fig_1_1.jpg

评测指标的计算步骤如下:

  1. 先计算mAP@δ(mean Average Precision @ δ),其中,AP为单类动作预测的平均精确度(Average Precision),mAP为各类动作预测的AP的平均值;δ为时间预测的允许误差,有六个取值,分别为1, 2, 3, 4, 5, ∞,1到5代表1秒到5秒,∞代表不考虑时间预测的误差,只考虑动作类别预测的误差;
  2. 取六个mAP@δ值的平均值。

多数参赛方案在基线模型FAANTRA的基础上进行了改进,这些改进包括:

  • 将输入帧的分辨率从224p提高到448p或720p;
  • 使用更大的基座模型来处理更细粒度的视觉内容;
  • 集成多个基座模型、多种分辨率的预测;
  • 采用两阶段训练(例如先采用224p视频数据进行初步训练,再采用720p视频数据进行微调)等。

还有的参赛团队使用视觉-语言模型(VLM)提取视频中的足球战术信息,包括推进方向、控球情况、压迫情况、场上位置等,并将多维战术信息作为语义先验(Semantic Prior)用于补充已学到的视觉特征,辅助预测。

以球员为中心的球动作识别

以球员为中心的球动作识别(Player-Centric Ball Action Spotting,简称PCBAS)赛道要求围绕足球视频中与球相关的动作,识别出动作发生的时间、动作类别、以及执行动作的球员的球衣号码和所属球队;其中,动作类别有8种,包括传球、头球、掷界外球、射门、铲球等,所属球队有左边球队和右边球队两个分类。


Fig_1_2.jpg

评测指标采用的是Macro F1,即各类动作F1的平均值。在计算时,True Positive的定义是:

- 预测的动作发生时间与实际的动作发生时间相差在±12帧之内,并且
- 预测的动作类别、球员球衣号码和球员所属球队均准确。

各参赛团队采用了多种解题思路,包括:

  • 改进基线模型TAAD和DST——增加时间建模、替代视觉主干模型、用Per-Player Attention替代球员角色的向量编码等;
  • 球跟踪——用于提取以球为中心的特征、以及球员与球的交互信息;
  • 提取并应用场上战术特征;
  • 改进训练策略、处理不均衡样本、多模型集成等。

新视角合成

新视角合成(Novel View Synthesis,简称NVS)赛道要求根据同一个足球比赛场景中多张不同视角的图像,合成出该场景中新的视角下的图像。

Fig_1_3.jpg

用于竞赛排名的指标是PSNR。另外两个衡量生成图像质量的指标——SSIM和LPIPS不用于竞赛排名,但可供参赛团队参考。

基线模型采用了3D Gaussian Splatting(3DGS)和Triangle Splatting两个模型。

获得第一名的方案首先解决的是这样一个样本不匹配的问题:地面视角的数据在训练数据中仅占不到2%,但在评测数据中却占59%,从而导致基线模型(3DGS和Triangle Splatting)在相关视角上出现欠拟合,影响合成图像的质量。该方案基于EFA-GS模型(一种经改进的3DGS),加强了地面视角数据的学习。该方案还采用Depth-Anything-V2模型,将深度信息结合到训练中,并采用了三模型集成,用于进行像素级平均[2]。

获得第二名的方案首先通过GaussianPro中的PatchMatch算法将稀疏的点云变得密集和更均匀,然后基于这些数据训练3DGS模型。

【未完待续】

参考文献

[1] SoccerNet 2026 Challenges Results
https://arxiv.org/abs/2607.07320

[2] DENSER: Depth-Guided Ensemble with Staged EFA-GS Reconstruction for Soccer Novel View Synthesis
https://arxiv.org/abs/2606.01419

以上各参考文献的使用许可协议均为CC BY 4.0
https://creativecommons.org/licenses/by/4.0/

目录
相关文章
|
2天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1723 1
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
10天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2434 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
11天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1153 2
|
12天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1127 47
|
9天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
838 0
|
9天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
586 2
|
12天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
753 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南