想象一下,你正试图为一场足球赛进行解说,但你必须对场上每一位球员的每一个动作都做到完美,且精确到每一秒。这就是这篇论文所解决的挑战:弄清楚每个球员在何时、做了什么动作(带球、传球、射门等)。
来自 TAHAKOM 团队的作者们构建了一个“数字裁判”系统,并在名为 SoccerNet 2026 的比赛中取得了非常高的分数(58.94 分,总分 100 分)。以下是他们实现这一目标的步骤拆解,通过简单的步骤呈现。
两阶段工厂
将他们的系统想象成一条两步走的工厂流水线。
第一阶段:“眼睛”(TAAD)
首先,系统需要观察正在发生的事情。原始系统使用基础摄像头来观察球员。作者将其升级为了**“时间转换器”(Temporal Transformer)**。
- 类比: 传统的摄像头就像是在每秒钟为球员拍一张快照,并仅根据单张照片来猜测他们在做什么。而新系统则像是一位电影导演,观察整个场景。它不仅仅看单帧画面,还会观察多帧之间的运动流,从而理解动作背后的“故事”。
- 修复: 他们还发现了一个训练过程中的小故障(就像一个卡住的恒温器),并修复了它,使系统能够更有效地学习。
第二阶段:“大脑”(DST)
一旦“眼睛”看到了动作,“大脑”就必须将这些动作组织成一份连贯的列表。
- 旧方法: 原有的“大脑”将场上所有 26 名球员视为一个扁平且混乱的数据列表。这就像是通过听取所有人的同时呐喊来试图理解一场对话,却不知道谁在说话,谁在倾听。
- 新方法(逐人注意力机制/Per-Player Attention): 作者赋予了大脑一种超能力:专注力。
- 空间注意力(房间): 首先,系统会观察某一时刻所有的球员,并询问:“谁离谁近?”它理解了球队的阵型。
- 时间注意力(时间轴): 然后,它会针对每一位球员进行单独观察,追踪该特定球员随时间变化的运动轨迹。
- 结果: 通过先理解空间关系(人在哪里),系统能更好地理解时间轴(他们在做什么)的上下文背景。
“委员会”策略(集成学习/Ensembling)
与其依赖单一的智能 AI,作者训练了四个不同版本的“大脑”(模型 A、B、C 和 D)。每一个版本都略有不同,就像拥有四位各有所长的专家。
为了得到最终答案,他们并没有仅仅挑选表现最好的那一个,而是使用了**“委员会投票系统”**:
- 一致性规则: 如果只有一个专家说“10 号球员正在射门”,系统会忽略它。它假设这位专家可能产生了幻觉(看到了并不存在的动作)。
- 加成机制: 如果有两个或更多专家达成共识,系统就会提高置信度分数。这就像是在说:“如果三个人都告诉我正在下雨,那我肯定会带把伞。”
- “单人抢断”例外情况: 这里有一个问题:“抢断”(Tackle)这类动作非常罕见,有时只有一个专家能捕捉到。如果应用严格的一致性规则,他们会错过所有的抢断。因此,他们做了一个特别的例外处理:如果预测到了抢断,即使只有一个专家发现了,他们也会保留该结果。 这确保了他们不会错过那些稀有且棘手的瞬间。
结果
通过结合这些改进,团队看到了性能的稳步攀升:
- 基础系统: 准确率为 48.6%。
- 加入“电影导演”(第一阶段): 性能略有提升。
- 加入“专注力”(第二阶段): 实现大幅跳跃,达到 55.1%。
- “委员会”(集成): 最终得分达到了 58.94%。
为什么这很重要:
最令人印象深刻的部分在于,这个“委员会”不仅在练习赛(验证集)上表现出色,而且在实际测试赛(挑战赛)中也具有良好的泛化能力。他们的练习赛得分与测试赛得分之间的差距从宽达 6 个百分点缩小到了仅 2 个百分点。这证明了他们的系统不仅仅是在死记硬背答案,而是真正学会了如何理解足球。
简而言之,他们构建了一个像导演一样观察足球、像专注的分析师一样思考、并像谨慎的专家委员会一样做出决策的系统。
技术摘要:SoccerNet 2026 以球员为中心的球类动作检测
问题陈述
本文针对 SoccerNet 2026 竞赛中的**以球员为中心的球类动作检测(Player-Centric Ball Action Spotting)**挑战进行了研究。其目标是在视频序列中检测并定位由单个球员执行的特定球类相关动作(例如:传球、射门、抢断)。系统必须输出包含帧时间戳、动作类别和球员角色的结构化事件序列,从而超越简单的帧级分类,实现时序连贯的事件检测流水线。
方法论
所提议的系统遵循组织者建立的两阶段流水线,由**追踪感知动作检测器(Track-Aware Action Detector, TAAD)和去噪序列转导(Denoising Sequence Transduction, DST)**模型组成。作者对这两个阶段都引入了特定的架构和训练改进,最终形成了基于共识的集成策略。
第一阶段:追踪感知动作检测器 (TAAD) 改进
基准 TAAD 依赖于 X3D 架构,通过以下方式进行了增强,以更好地捕捉时序依赖关系:
- 时序 Transformer 集成: 系统不再独立地对每一帧进行分类,而是将 ROI 对齐特征(针对每个球员、每帧)投影到一个 256 维空间中。这些特征通过一个 4 层 Transformer 编码器(8 个注意力头,1024 个前馈维度)进行处理,并带有可学习的位置嵌入(最多 50 帧)。这使得模型能够在投影到 512 维空间进行 9 类分类之前,对时序模式进行推理。
- 训练优化: 作者修正了一个此前导致学习率更新停止的预热调度器(warmup scheduler)错误。其他修改包括:
- 对除 X3D 主干网络(使用固定学习率)之外的所有层采用余弦退火调度器。
- 学习率按 1/8 进行缩放。
- 降低背景类权重(0.05),并在第 16 个 epoch 开始将 tracklet 数量从 4 个增加到 6 个。
- 生成的 Logits 被视为后续 DST 阶段的冻结输入。
第二阶段:去噪序列转导 (DST) 改进
DST 组件通过自回归 Transformer 将比赛状态特征和 TAAD Logits 转换为结构化的事件序列。关键创新包括:
- 单球员注意力机制: 基准编码器将 26 个角色的特征向量视为扁平输入。所提方法引入了两个阶段的注意力机制:
- 空间注意力(阶段 1): 跨球员注意力,即特定时间步的所有 26 名球员相互关注,以捕捉空间配置。
- 时序注意力(阶段 2): 在每个球员的表示上独立应用自注意力,以建模状态演变。
- 注: 实验表明,在该注意力机制中使用仅包含比赛状态特征(位置、速度、可见性)而非 TAAD Logits,可以获得更优的性能。
- 空间优先排序: 在时序注意力之前处理空间注意力被证明至关重要,与反向顺序相比,这在验证集上带来了 +1.87% 的 Macro-F1 提升。
- 用于集成的架构多样性: 使用具有不同超参数的四个不同 DST 模型(A–D)来确保多样性:
- 模型 A: 基础配置(隐藏维度 512,1 个注意力层)。
- 模型 B: 增加隐藏维度(768)。
- 模型 C: 增加注意力深度(2 层)和维度(dp=128)。
- 模型 D: 并行注意力架构,其中空间分支和时序分支独立处理输入并进行求和。
- 推理优化: 作者发现,基于每类阈值优化 Logit 调节温度(τ)会导致在验证集上过拟合。因此,他们在所有最终预测中采用了 τ=0 且使用默认阈值。
集成策略
最终的提交采用了带有**共识过滤(Agreement Filtering)的加权事件融合(Weighted Event Fusion)**策略:
- 聚类: 将 N 个模型的预测结果按(队伍、球衣号码、动作类别)进行分组,并在 ±12 帧窗口内进行聚类。
- 共识提升: 对于由 n 个模型支持的簇,其平均得分乘以 (n/N)0.5。
- 过滤: 丢弃由少于 2 个模型预测的事件,以抑制假阳性(幻觉)。
- 异常处理: 由于“抢断(Tackle)”事件极其罕见(96 场训练赛中仅出现 26 次)且单模型 F1 值较低,因此跳过了抢断事件的共识过滤。保留单模型检测结果,以维持该特定类别的召回率。
结果
该系统在挑战集上实现了 58.94 的 Macro-F1 分数。
- 渐进式收益: 带有改进型 TAAD 的基准 DST 在挑战集上得分为 48.6。加入单球员注意力和空间优先顺序后,得分提升至 55.1。最终的 4 模型集成达到了 58.94。
- 各类别表现: 除了“抢断”类外,集成模型在所有类别上都优于单个模型;在“抢断”类中,模型 B 仍是表现最强的单个模型。集成显著提高了常见到中等频率类别(如:驱动、传球、传中)的性能,通过抑制假阳性同时保持了召回率。
- 泛化能力: 验证集与挑战集之间的性能差距从(单模型)约 6 个点缩小到(集成后)2 个点,表明泛化能力有所提高。
重要性与主张
本文声称,主要贡献在于 DST 编码器中集成了单球员注意力机制 以及 基于共识的集成策略。
- 空间优先的注意力顺序 被确定为关键的架构选择,它为时序推理提供了更丰富的上下文。
- 共识过滤 机制被强调为在不牺牲频繁类别召回率的情况下减少假阳性的关键,而针对抢断事件的特殊处理则展示了处理类别不平衡的针对性方法。
- 作者谦虚地将他们的工作描述为对所提供的基准流水线的系统性改进,证明了架构多样性和严格的集成过滤可以显著提升复杂多球员动作检测任务的性能。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。