← 最新论文
💻 computer science

TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues

该论文提出了 TextGaze,一种统一的跨模态架构,它利用大型视觉语言模型来提供可扩展的文本场景线索,从而实现鲁棒且高效标注的注视目标估计,在不同数据集中平衡视觉显著性与真实的注视意图。

原作者: Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图在拥挤的照片中猜出一个人正在看哪里。这就像是在试图弄清楚合影中的哪位朋友正盯着一块隐藏的饼干。长期以来,计算机科学家试图通过构建“多分支”机器来解决这个问题。把这些机器想象成一支侦探团队,每位侦探都有特定的职责:一个检查人的头部,另一个测量房间的深度,第三个分析其姿态,第四个观察他们的眼睛。虽然这听起来很周全,但论文指出,这有点像为了找一把丢失的钥匙而雇佣了一整支警察部队。它需要为每一位侦探准备海量的额外训练数据(标注),使得系统学习缓慢且难以迁移到新场景。

另一方面,一些更新、更简单的方法试图成为“单人秀”。它们观察图片并根据看起来闪亮或有趣的东西进行猜测。但论文指出了这里的一个主要缺陷:这些简单的方法经常会被“视觉噪声”分散注意力。它们可能会认为一个人在看一顶鲜红色的帽子,因为那是画面中最夺目的东西,即使那个人实际上是在看一面无聊的灰色墙壁。论文将此称为“语义失焦”——计算机看到了物体,却忽略了其中的“意图”。

于是,TextGaze 登场了,它是这个故事中的新英雄。作者们提出了一个聪明的折中方案,它既不需要庞大的侦探团队,也不会轻易被分心。他们使用了一个“大型视觉语言模型”(LVLM)——把它想象成一位超级聪明、博学多才的图书管理员,能够观察图片并用文字进行描述。

以下是 TextGaze 的工作原理:

  1. 图书管理员的描述: 系统不再仅仅盯着像素看,而是要求 LVLM 写一段关于场景的短文。例如,它可能会说:“穿着黄色球衣的男子正看向他的右侧。”
  2. 融合: 系统将这些文字与视觉图像混合在一起。这就像是在计算机探索地形(图像)时,给它提供了一张地图(文本)。这有助于计算机理解一个人为什么看向那里,而不只是看到那个闪亮的物体。
  3. 安全网: 为了确保计算机在进行数学运算时不会忘记这个故事,作者增加了一个特殊的“监督”步骤。这就像一位老师在每节课的过程中都会检查学生的笔记,以确保他们没有偏离主题。

论文在四个不同的数据集上测试了这个想法,这些数据集基本上是用于训练这些 AI 大脑的海量照片和视频集合。结果非常令人振奋。在 GazeFollow 数据集上,当使用较大的“ViT-L”骨干网络时,这种新方法实现了 0.956 的 AUC(这是一个越高越好的评分,1.0 为完美)以及仅为 0.099 像素的平均误差距离(Avg L2)。这意味着它非常接近现有的最佳方法,但却不需要其他顶尖模型所要求的额外的“深度”或“姿态”数据。

真正酷的一点是它在处理未见过的场景时表现得多么出色。当团队在没有给予任何额外训练的情况下,在包含人们在日常场景中购物的 GOO-Real 数据集上测试 TextGaze 时,它的表现依然处于领先地位,得分 AUC 为 0.918L2 误差为 0.159。这表明“图书管理员”的方法能帮助计算机比单纯记忆视觉模式更好地进行泛化。

作者谨慎地指出,虽然他们的方法精简且有效,但它并不是能瞬间解决一切问题的魔杖。他们明确反对认为我们需要复杂的、带有额外传感器的多分支系统才能获得良好结果。他们也反对仅仅依赖于低层级的视觉技巧。相反,他们认为加入一层“文本理解”是弥合“看到图像”与“理解人类意图”之间鸿沟的关键。

简而言之,TextGaze 表明,赋予计算机一点点“讲故事”的能力,可以帮助它比仅仅盯着图片看更准确地判断一个人的视线方向。这是一种俏皮、高效且出奇准确的方式,教机器如何“察言观色”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →