想象一场巨大的、全球性的电子游戏锦标赛,这里的“玩家”不是人类,而是试图理解足球比赛的计算机程序(AI)。这篇论文是 SoccerNet 2026 挑战赛(该项竞赛的第六年)的官方成绩单。
组织者设置了五个不同的“关卡”或任务。每个关卡都在测试 AI 为了真正理解这项“美丽的游戏”所需要掌握的不同技能。以下是比赛情况的详细说明,使用了简单的类比。
五个关卡
1. 水晶球(球动作预测)
- 挑战: AI 观看 30 秒的足球比赛,然后必须猜出接下来的 5 秒内会发生什么。
- 类比: 想象你正在看电影,屏幕突然黑屏了 5 秒钟。你必须准确预测当画面恢复时,角色会做什么。是球员踢球了?还是传球了?
- 结果: 共有 9 支队伍参赛。获胜者是一个名为 FAANTRA-WS 的团队,他们通过使用“两阶段热身”策略(就像运动员在比赛前拉伸一样)并结合不同的模型来处理未来的不确定性,从而获得了最高分。
2. 超级裁判(以球员为中心的球动作识别)
- 挑战: AI 必须找到特定的动作(如传球、射门或铲球),说出这些动作发生的精确时间,并识别出是哪位特定球员做的动作(包括其所属球队和球衣号码)。
- 类比: 想象一位裁判不仅吹响了哨子,还能瞬间记录下:“红队 10 号球员在 12:04 进行了传球。”难点在于,球员经常互相遮挡(遮挡现象),导致很难看清到底是谁。
- 结果: 共有 6 支队伍参赛。获胜者 PAVE 使用了一种“投票系统”。他们让多个 AI 模型观察同一个时刻,并且只有当模型们对谁做了动作达成一致时,才计入一次动作。这有助于他们捕捉到那些通常会让计算机感到困惑的罕见“铲球”动作。
3. 时空旅行摄影师(新视角合成)
- 挑战: AI 被给予许多从不同角度拍摄的足球场照片,然后必须创建一个它从未见过的摄像机视角的新照片。
- 类比: 想象你有一张 360 度的房间全景照。如果你闭上眼睛,想象自己站在角落里,AI 必须精准地“画出”那个角落看起来的样子,包括草坪纹理和球员,即使那里从未有过摄像机。
- 结果: 共有 65 支队伍参赛。获胜者 DENSER 解决了一个标准 AI 在低角度拍摄(如靠近地面的摄像机)时表现挣扎的问题。他们使用了一个“深度引导”来帮助 AI 更好地理解球场的 3D 形状,从而创造出比基准模型更清晰的图像。
4. GPS 追踪器(Spiideo SoccerNet Synloc)
- 挑战: AI 观察一张由固定摄像机(如监控摄像头)拍摄的半场高分辨率照片,并必须精准定位每位球员臀部的实际地理位置。
- 类比: 想象从无人机视角观察城市地图。你看到代表车辆的小点。AI 必须说出:“那个点恰好位于第五大道和第 42 街。”即使那个点非常小且距离很远。
- 结果: 共有 88 支队伍参与。获胜者 SELab 使用了一种“智能分块”方法。他们并没有试图一次性看清整个球场,而是通过放大特定区域来寻找球员,然后利用几何学将他们的位置映射到真实的地面上。他们的准确度极高,大幅超越了基准水平。
5. 体育知识问答大师(视觉问答)
- 挑战: AI 被展示一段视频或一张图片,并被问到一个关于它的多选题。问题可以涉及比分、球员姓名或复杂的比赛情况。
- 类比: 这就像一场知识问答游戏。主持人展示一段片段并问道:“谁在第 88 分钟进球了?”或者“守门员的球衣是什么颜色的?”AI 必须从四个选项中选出正确答案。
- 结果: 共有 76 份提交记录。获胜者 vitomeme 不仅仅是在瞎猜;他们使用了一个“路由系统”:如果问题是关于事实的,他们就查找数据;如果问题是关于视频内容的,他们就仔细观察视频。他们实现了 98% 的准确率,这几乎是完美的。
大局观
总共有 427 支队伍 来自世界各地,提交了超过 1,100 份参赛作品。
论文强调了几种帮助获胜者取得成功的关键趋势:
- 更高分辨率: 给 AI 提供更清晰、更锐利的图像(就像从模糊的手机镜头切换到 4K 电视)有助于它们观察微小的细节。
- 团队协作: 最好的系统通常会结合多个不同 AI 模型的预测(就像一个专家委员会进行投票),而不是仅仅依赖于一个模型。
- 利用规则: 获胜者不仅仅是在观察像素;他们利用了足球的“规则”,例如了解摄像机的角度或球员的运动方式,从而做出更聪明的判断。
论文总结道,虽然这些 AI 系统已经变得非常出色,但它们在处理足球中最混乱的部分时仍然感到吃力,比如球员互相遮挡或动作发生得非常快的情况。这些挑战的目标是不断推动技术进步,以便我们最终拥有能像人类球迷一样理解足球的计算机。
技术摘要:SoccerNet 2026 挑战赛结果
1. 问题定义与背景
SoccerNet 2026 挑战赛是旨在推进体育视频理解领域计算机视觉研究的第六届年度开放基准测试。往届版本侧重于动作检测(action spotting)和相机标定等任务,而 2026 版将范围扩大到了五个不同的基于视觉的任务,这些任务针对足球转播中的独特难点进行了设计:球员体型小且视觉特征相似、频繁的遮挡、长篇未剪辑视频中稀疏的事件,以及剧烈的相机视角变化。
这五个特定挑战赛包括:
- 球类动作预测 (BAA): 基于前 30 秒的观察窗口,预测未来 5 秒内内与球相关的动作的时机和类别。
- 以球员为中心的球类动作检测 (PCBAS): 在进行时间定位和球类动作分类的同时,通过球队归属和球衣号码将每个动作分配给特定的球员。
- 新视角合成 (NVS): 从多视角足球场景中,从未见过的相机位姿下渲染出逼真的图像。
- Spiideo SoccerNet Synloc (SSS): 从单个经过标定的静态相机图像中,将运动员定位到真实的球场坐标中。
- 视觉问答 (VQA): 利用文本、图像和视频输入,回答关于足球转播的多项选择题。
该计划旨在提供共享数据、统一的评估协议和公开的基准模型,以确保不同方法之间的可复现性和可比性。
2. 方法论与挑战赛结构
2.1 数据与协议
每个任务都使用了特定的数据集和评估指标:
- BAA: 使用了 SN-BAA 数据集(英格兰足球联赛)。评估采用了改进后的平均精度均值 (mAP) 用于预测,并在不同时间容差 (δ∈{1,2,3,4,5,∞}) 下对分数进行平均。
- PCBAS: 基于包含 8 个动作类别的 FOOTPASS 数据集。评估使用低置信度阈值 (τ=0.15) 下的宏 F1 分数,要求在 ±12 帧范围内实现动作类别、球队和球衣号码的精确匹配。
- NVS: 使用通过 Blender 从真实转播画面生成的合成数据集,提供 4K 图像和 COLMAP 相机参数。评估优先考虑使用 PSNR 进行排名,同时参考 SSIM 和 LPIPS。
- SSS: 利用覆盖半个球场的静态相机图像。主要指标是 mAP-LocSim,它根据现实世界中的距离容差 (τ=1 米) 对检测和定位精度进行加权。
- VQA: 基于 SoccerAgent 和 SoccerBench,涵盖 14 个类别(文本、图像、视频)。评估严格基于 500 个问题挑战集上的答案准确率。
2.2 领先的方法论途径
各任务的获胜方案展示了几个反复出现的共性技术主题:
- 预测 (BAA): 获胜方案 FAANTRA-WS 改进了官方基准模型,采用了高分辨率时间建模(448p 帧)和两阶段预热训练方案。其核心创新包括对不同 RegNetY 检查点的非对称对数几率集成(asymmetric logit ensembling)以及处理稀有类别的类别加权损失。其他团队通过提高输入分辨率和使用视觉语言模型 (VLM) 来提取战术上下文,从而提升了性能。
- 检测 (PCBAS): 获胜方案 PAVE 增强了跟踪感知动作检测 (TAAD) 和去噪序列转换 (DST) 框架。它引入了单人注意力机制和四个变体的投票集成。至关重要的是,它采用了协议过滤(agreement filtering)来抑制假阳性,同时保留了对“铲球 (Tackle)”等稀有类别的召回率。
- 新视角合成 (NVS): 获胜方案 DENSER 解决了训练数据中地面层转播视角代表性不足的关键分布失配问题。它扩展了 EFA-GS(一种无别名高斯泼溅方法),引入了基于相机高度的损失权重(地面视图权重最高达 5 倍)、尺度与偏移不变的深度监督,以及三模型像素平均集成。
- 同步定位 (SSS): 获胜方案 边界感知自适应分块 (Boundary-Aware Adaptive Tiling) 采用了一种自顶向下的框架。它根据粗略检测结果动态扩展固定网格裁剪,以确保完整包含目标。它改编了 RTMPose-X,使其仅预测骨盆及其地面投影,通过双关键点估计器强制执行物理耦合,并使用确定性射线投射将 2D 投影提升到度量世界坐标。
- 视觉问答 (VQA): 获胜方案 Frontier VLMs 采用了一种任务路由引导系统。该流水线并非使用单一提示词,而是将问题路由到四种范式:知识落地、视觉提示、推理分解和时间理解。它利用结构化元数据 (SoccerAgent/SoccerWiki) 和视觉提示(带编号的球员框)来引导 Gemini-3.1-Pro 推理引擎。
3. 关键结果
参与程度非常广泛,共有 427 支队伍 在五个任务中提交了 1,129 份参赛作品。只有提交了经过评审的技术报告的队伍才被计入最终排行榜。
- 球类动作预测: 冠军团队 (FAANTRA-WS) 实现了 24.08 的 mAPavg,比基准模型高出 7.32 点。
- 以球员为中心的球类动作检测: 冠军团队 (FSITAHAKOMPCBAS-1) 实现了 58.94 的 Macro F1@0.15,比基准模型提高了 12.5 点。“铲球 (Tackle)”类由于遮挡和稀有性,仍然是最困难的类别。
- 新视角合成: 冠军团队 (Sarthi-GameChanger) 实现了 29.89 的 PSNR,比 3DGS 基准模型提高了 3.15 dB。然而,最优方法并未在 LPIPS 上超越 Triangle Splatting 基准,凸显了 PSNR 与感知质量之间的权衡。
- Spiideo SoccerNet Synloc: 冠军团队 (SELabSoccerSSS-1) 实现了 97.67 的 mAP-LocSim 和 81.91% 的帧准确率,显著优于基准模型 (77.30 mAP-LocSim)。
- 视觉问答: 冠军团队 (vitomeme) 在 500 个问题的划分集上达到了 98.0% 的准确率,而随机基准为 25.0%。
4. 重要性与贡献
本文声称有三个主要贡献:
- 文档化: 它为 2026 年五个任务的定义、数据集和评估得分提供了单一的参考依据。
- 基准测试: 它展示了留出集上的挑战赛排行榜,并总结了领先方案的原始贡献,识别了驱动性能提升的具体设计选择(例如:集成、分辨率缩放、任务路由)。
- 最先进技术 (SOTA) 分析: 它综合了反复出现的方法论主题,指出进步是由更丰富的上下文表示、模型集成以及对领域结构(如相机几何、战术特征)的显式利用所推动的。
作者强调,这些挑战成功降低了不可复现评估的风险,并降低了没有大规模内部数据集的团队的参赛门槛。结果表明,尽管取得了显著进展,但在处理遮挡、稀有动作类别以及将多模态推理与细粒度感知相结合方面仍面临挑战。论文最后重申了 SoccerNet 倡议致力于维护开放数据集和标准化协议,以支持体育视频理解领域的可复现研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。