SoccerNet 2026赛题整理(下)

简介: 继续介绍SoccerNet 2026的赛题、以及参赛团队的部分解题思路

本文的上半部分简要介绍了SoccerNet 2026中部分赛道的赛题。接下来继续介绍SoccerNet 2026中其余赛道的赛题。

Spiideo SoccerNet合成定位

Spiideo SoccerNet合成定位(Spiideo SoccerNet Synloc,简称SSS)赛道要求根据足球场上的单张图像及相机的校准信息(Camera Calibration),将场上球员定位到球场坐标系中(根据球员骨盆在地面的投影进行定位)[1]。


Fig_1_4.jpg

用于竞赛评测的指标是mAP-LocSim。该指标在mAP指标的基础上,采用LocSim指标来判断每个预测是否准确。LocSim指标的定义是:

LocSim.jpg

其中,τ的取值为1米,d的取值为预测的球员场上位置与实际位置之间的距离。当LocSim的值低于0.5时,预测被视为准确。

所有参赛团队都使用了基线模型YOLO26、RF-DETR或YOLOX-Pose。部分团队还采用了人体姿态估计模型(RTMPose-X 或 ViTPose)来估计球员骨盆位置及其在地面的投影。基于图像中的球员位置预测,通过利用所提供的相机校准参数进行转换,就可以得到球员在球场平面上的位置预测。

另外一种在部分参赛方案中出现的方法是Tiling。在计算机视觉中,Tiling是一种把一张大图片分成多个小图片(称为Tiles)、并独立处理每个小图片的方法。在部分参赛方案中,不同的Tiling方法被用于在场上图像中检测球员:

  • 自适应Tiling根据已产生的粗粒度的人员检测结果,动态调整小图片的裁剪,以保障小图片能覆盖人员目标;
  • 非自适应Tiling,需要后续的NMS(非极大值抑制)等处理,以避免重叠的人员检测结果,并且合并分散在不同小图片中的人员检测结果。

一些基座模型的损失函数是在像素级别上进行计算的,而竞赛的评测指标是在场上距离这一级别上计算的。因此,有的参赛团队改进了损失函数——有的采用基于球场坐标系的Huber损失函数(Huber Loss),有的直接优化基于球场坐标系的LocSim指标。

视觉问答

视觉问答(Visual Question Answering,简称VQA)赛道要求根据文本、图像和视频多种模态的输入,回答自然语言提问,每个提问有四个备选答案,其中的一个是正确答案[1]。

Fig_1_5.jpg

提问有14类:针对文本输入的提问侧重背景知识和比赛情况;针对图像输入的提问涵盖摄像机视角、球员识别、球衣号码、记分牌等;针对视频输入的提问涵盖镜头切换、重放检索、动作分类、评论、多视角犯规识别等。

用于评测的指标是回答准确率,即500个提问中回答正确的百分比。

优胜团队较多采用了任务路由[1]。在获得第二名的方案中,首先推测提问的分类,然后由任务路由将提问分发给14个Agent之一(一个Agent负责一个分类的提问)。在获得第一名的方案中,任务路由将提问分发给以下4个处理模块之一:

  • 处理知识和事实的模块;
  • 处理图像和视觉任务的模块;
  • 将推理进行分解的模块,用于处理比较含糊的推理任务;
  • 针对视频进行时间方面理解的模块。

优胜团队较多采用的其它方法包括:

  • 使用基于检索的推理;
  • 在SoccerAgent及类似工具链的基础上,增加人员检测、人脸匹配、基于姿态的球衣号码裁剪、CLIP风格的检索、球员分割等,用于改进有关球衣号码、球员、背景知识、重放、犯规等提问的回答。

参考文献

[1] SoccerNet 2026 Challenges Results
https://arxiv.org/abs/2607.07320
参考文献使用许可协议:CC BY 4.0
https://creativecommons.org/licenses/by/4.0/

目录
相关文章
|
3天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1731 2
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
11天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2443 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
12天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1172 2
|
10天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
919 1
|
13天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1171 49
|
10天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
601 2
|
10天前
|
SQL 关系型数据库 MySQL
【2026最新】DBeaver下载、安装、数据库管理一篇搞定(附官网社区版安装包)
DBeaver是一款免费开源的跨平台通用数据库管理工具,支持MySQL、PostgreSQL、SQLite、Oracle等几乎所有主流数据库,无需为每种数据库安装独立客户端,极大提升开发与数据分析效率。

热门文章

最新文章