想象一下,试图在拥挤的照片中猜出一个人正在看哪里。这就像是在试图弄清楚合影中的哪位朋友正盯着一块隐藏的饼干。长期以来,计算机科学家试图通过构建“多分支”机器来解决这个问题。把这些机器想象成一支侦探团队,每位侦探都有特定的职责:一个检查人的头部,另一个测量房间的深度,第三个分析其姿态,第四个观察他们的眼睛。虽然这听起来很周全,但论文指出,这有点像为了找一把丢失的钥匙而雇佣了一整支警察部队。它需要为每一位侦探准备海量的额外训练数据(标注),使得系统学习缓慢且难以迁移到新场景。
另一方面,一些更新、更简单的方法试图成为“单人秀”。它们观察图片并根据看起来闪亮或有趣的东西进行猜测。但论文指出了这里的一个主要缺陷:这些简单的方法经常会被“视觉噪声”分散注意力。它们可能会认为一个人在看一顶鲜红色的帽子,因为那是画面中最夺目的东西,即使那个人实际上是在看一面无聊的灰色墙壁。论文将此称为“语义失焦”——计算机看到了物体,却忽略了其中的“意图”。
于是,TextGaze 登场了,它是这个故事中的新英雄。作者们提出了一个聪明的折中方案,它既不需要庞大的侦探团队,也不会轻易被分心。他们使用了一个“大型视觉语言模型”(LVLM)——把它想象成一位超级聪明、博学多才的图书管理员,能够观察图片并用文字进行描述。
以下是 TextGaze 的工作原理:
- 图书管理员的描述: 系统不再仅仅盯着像素看,而是要求 LVLM 写一段关于场景的短文。例如,它可能会说:“穿着黄色球衣的男子正看向他的右侧。”
- 融合: 系统将这些文字与视觉图像混合在一起。这就像是在计算机探索地形(图像)时,给它提供了一张地图(文本)。这有助于计算机理解一个人为什么看向那里,而不只是看到那个闪亮的物体。
- 安全网: 为了确保计算机在进行数学运算时不会忘记这个故事,作者增加了一个特殊的“监督”步骤。这就像一位老师在每节课的过程中都会检查学生的笔记,以确保他们没有偏离主题。
论文在四个不同的数据集上测试了这个想法,这些数据集基本上是用于训练这些 AI 大脑的海量照片和视频集合。结果非常令人振奋。在 GazeFollow 数据集上,当使用较大的“ViT-L”骨干网络时,这种新方法实现了 0.956 的 AUC(这是一个越高越好的评分,1.0 为完美)以及仅为 0.099 像素的平均误差距离(Avg L2)。这意味着它非常接近现有的最佳方法,但却不需要其他顶尖模型所要求的额外的“深度”或“姿态”数据。
真正酷的一点是它在处理未见过的场景时表现得多么出色。当团队在没有给予任何额外训练的情况下,在包含人们在日常场景中购物的 GOO-Real 数据集上测试 TextGaze 时,它的表现依然处于领先地位,得分 AUC 为 0.918,L2 误差为 0.159。这表明“图书管理员”的方法能帮助计算机比单纯记忆视觉模式更好地进行泛化。
作者谨慎地指出,虽然他们的方法精简且有效,但它并不是能瞬间解决一切问题的魔杖。他们明确反对认为我们需要复杂的、带有额外传感器的多分支系统才能获得良好结果。他们也反对仅仅依赖于低层级的视觉技巧。相反,他们认为加入一层“文本理解”是弥合“看到图像”与“理解人类意图”之间鸿沟的关键。
简而言之,TextGaze 表明,赋予计算机一点点“讲故事”的能力,可以帮助它比仅仅盯着图片看更准确地判断一个人的视线方向。这是一种俏皮、高效且出奇准确的方式,教机器如何“察言观色”。
技术摘要:TextGaze
问题陈述
注视目标估计旨在推断人在场景中的注视位置,或确定其注视目标是否在图像帧内。本文指出了现有方法中的两个主要局限性:
- 多分支方法(Multi-branch methods): 这些架构通过独立的分支引入辅助线索(如深度、姿态、头部特征)。虽然它们丰富了视觉表示,但带来了显著的标注负担,由于结构复杂导致收敛缓慢,并阻碍了领域迁移。此外,它们通常仅作为几何过滤器,无法对有效的注视目标进行推理,从而导致“语义欠指定(semantic under-specification)”。
- 精简型/提示微调方法(Streamlined/Prompt-tuning methods): 最近的方法尝试通过使用基础模型的定位提示来简化架构。然而,这些方法往往遭受“语义失焦(semantic defocus)”的问题,即模型依赖于低级视觉显著性(空间邻近性、视觉显著性)而非真实的注视意图,导致预测的注意力与实际注视目标之间出现偏差。
核心挑战在于如何在保持架构简洁性的同时,平衡对语义引导的需求,从而超越纯粹的几何回归,转向意图层级的推理,且不重新引入复杂的多分支结构。
方法论:TextGaze
作者提出了 TextGaze,一种统一的跨模态架构,利用大语言视觉模型(LVLM)作为可扩展的语义引导。该框架将注视估计从直接的几何回归转变为通过语义层进行的意图识别过程。
1. 架构概述
该模型由三个核心组件组成:
- 基于 LVLM 的文本场景线索模块: 一个冻结的 LVLM(实验中具体使用 Qwen2.5-VL-7B-Instruct)被用于生成关于主体外观、行为和粗略注视方向的结构化文本描述。这些自然语言输出通过一个冻结的 BERT 文本编码器被编码为稠密嵌入(St)。该模块提供了高层语义先验(物体、动作),而无需从 LVLM 中获取显式的注视目标定位,因为后者对于帧外目标的定位可能并不可靠。
- 特征 Token 序列处理模块:
- 视觉流: 一个冻结的 DINOv2 编码器提取细粒度的场景特征(Fv)。为了增强对目标的敏感度,通过基于头部边界框的掩码调制添加了一个可学习的头部 Token 嵌入。
- 融合: 文本和视觉特征序列进行拼接。一个可学习的 Token(zin/out)被前置用于帧内/帧外分类任务。
- 跨模态融合与预测模块:
- 融合 Transformer: 一个三层堆叠的 Transformer 通过后归一化(post-normalization)集成视觉和文本 Token。它采用多头自注意力机制(MHSA)来实现模态间不受限制的交互。
- 层级文本监督(Hierarchical Text Supervision): 为了防止深层融合过程中任务相关文本语义的退化,作者引入了一种层级文本一致性监督机制。该机制通过将中间文本 Token 投影回原始文本编码器特征,并最小化均方误差(MSE),来强制实现所有 Transformer 层之间的语义对齐。
- 预测头: 一个轻量级解码器生成注视热力图(由带有高斯目标的像素级 BCE 损失监督)以及用于帧内/帧外状态的标量概率(由二元交叉熵监督)。
2. 训练目标
总损失函数结合了热力图损失(Lheat)、帧内/帧外分类损失(Lin/out)和层级文本监督损失(Ltext):
Lall=Lheat+λ1Lin/out+λ2Ltext
核心贡献
- 文本场景线索: 本文引入了将文本场景线索整合进注视目标估计的方法,以缓解语义失焦问题。通过使用 LVLM 生成辅助语义信息(外观、动作、意图),模型获得了高层先验,而无需复杂的多分支设计。
- 增强的基准测试: 作者通过整合场景-目标-人物的注意力场与面向 LVLM 的提示,强化了 GazeFollow 和 VideoAttentionTarget 基准测试,生成了鲁棒的上下文线索,从而提高了文本辅助注视估计的准确性。
- 统一的双流框架: 设计了一种新型的跨模态融合框架,将文本嵌入与细粒度视觉表示相结合。这种方法模拟了人类的自上而下的注意力机制,在保持精简流水线的同时,提升了空间推理能力和场景适应性。
实验结果
该方法在四个主流数据集上进行了评估:GazeFollow、VideoAttentionTarget、ChildPlay 和 GOO-Real。
- 达到最先进性能(SOTA): 在 GazeFollow 上,TextGaze(使用 DINOv2 ViT-L)取得了极具竞争力的结果,获得了最低的平均 L2 误差(0.099)并匹配了最佳的最小 L2(0.043),同时保持了较高的 AUC(0.956)。在 VideoAttentionTarget 上,它在帧内/帧外预测的 AUC、L2 误差和 AP 指标方面均优于现有方法。
- 跨数据集泛化能力: 在无需微调或修改提示的情况下,TextGaze 展示了强大的泛化能力:
- 在 GOO-Real(真实购物场景)中,它在 AUC 和 L2 指标上均达到了最先进的性能。
- 在 ChildPlay(儿童注视)中,它在帧内/帧外分类的 AP 指标上超越了所有基准模型,凸显了 LVLM 衍生线索在存在检测方面的有效性。
- 消融实验: 实验证实,基于 Transformer 的融合策略优于加法融合和交叉注意力融合。此外,同时激活层级文本监督、视觉残差连接和特定位置嵌入产生了最优性能,验证了这些组件之间的互补性。
意义与主张
本文声称 TextGaze 为传统的多分支设计提供了一种精简的替代方案。通过利用作为可获取辅助引导的 LVLM,该方法成功平衡了多分支系统的高标注成本与精简视觉模型在语义上的局限性。
作者强调,注视跟随本质上是一个意图层级的推理问题,而非纯粹的几何回归任务。TextGaze 通过将范式从“像素到坐标”转变为“像素到语义意图再到注视目标”来解决这一问题。实验结果验证了 LVLM 可以有效地将视觉与高层意图联系起来,为复杂场景下的注视估计提供了一种可扩展的解决方案,且无需冗余的分支或大量的领域特定标注。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。