← 最新论文
💻 computer science

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

该论文介绍了 VEGAS,一种无需训练的跨模态指标,它利用同步的注视数据来评估并筛选出能更好地与个体观看者注意力对齐的视频标题,从而在无需模型重训的情况下提高标题质量及下游检索任务的性能。

原作者: Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一段某人在厨房里做饭的视频。一个标准的 AI 标注机器人可能会说:“一个人在厨房里,旁边有炉灶、冰箱和柜台。”这在技术上是正确的,但就像是在你只关心其中一条街道时,却读了一张整个城市的地图。机器人忽略了那个人实际上在“看”什么。

这就是 VEGAS(基于注视得分的视频标题评估,Video caption Evaluation via GAze Score)。你可以把 VEGAS 想象成一个超级聪明的“注意力裁判”,它不仅是在“读”视频,还在观察你在观看时,你的眼睛是如何移动的。

问题所在:“一刀切”式的标题

论文指出,目前的 AI 模型是在各种人的观点混合训练下的。它们试图描述场景中可见的所有内容。但人类是非常挑剔的。如果你正在看一段烹饪视频,你可能会专注地盯着正在被切开的红辣椒,而忽略背景里的烤面包机。一个通用的 AI 标题可能会完全漏掉辣椒,或者把辣椒埋在一堆背景噪音的列表里。这会导致当你搜索“切红辣椒”时,很难找到这段特定的视频。

解决方案:“注视过滤器”

作者提出了一个巧妙的技巧,叫做 VEGAS。VEGAS 并不是通过重新训练 AI(这就像是重新建造汽车的整个引擎),而是作为一个位于流程末端的“过滤器”。

它是这样运作的,这里有一个有趣的类比:
想象 AI 是一位厨师,他为同一顿饭写下了五种不同的食谱。

  1. 食谱 A: “我做了一顿饭。”(太笼统了)
  2. 食谱 B: “我切了洋葱、大蒜和辣椒。”(很具体,但也许你并没有看大蒜)
  3. 食谱 C: “我在搅动锅里的东西。”(你当时正盯着锅看)

现在,想象你戴着一副特殊的眼镜,可以精确追踪你的眼睛落在了哪里。VEGAS 会利用你的眼动追踪数据并询问这位厨师:“嘿,如果我只给你看观众注视的部分,你还能写出这个食谱吗?”

  • 如果食谱提到了红辣椒,而你的眼睛也正盯着红辣椒,VEGAS 会说:“匹配得很好!低分!”(在这个游戏中,分数越低越好)。
  • 如果食谱提到了烤面包机,但你的眼睛从未看向过烤面包机,VEGAS 会说:“等等,你怎么知道烤面包机的事?那是你不需要的额外信息。高分!”(匹配度差)。

随后,VEGAS 会挑选出得分最低的那个“食谱”(标题)——即那个完美契合你特定注视点的标题。

他们的发现(真实情况)

研究人员在两种截然不同的视频类型上测试了它:

  1. 第一视角视频(比如某人在家里做家务的过程)。
  2. 教学幻灯片(比如 PowerPoint 演示文稿)。

巨大的胜利:
在第一视角视频上,VEGAS 表现得非常出色。当他们使用“注视过滤器”来挑选标题时,描述内容与人类实际编写的内容相似度提升了 13.53%

  • 证据: 他们运行了一个统计检验(Wilcoxon 符号秩检验),结果为 Z = 10.04,且 p 值 < 0.001。这意味着这种提升并非偶然,而是真实、可衡量的差异。
  • 检索能力的提升: 当他们使用这些更好的标题进行视频搜索时,发现能更频繁地在列表最顶端找到正确的视频,提升幅度为 1.14%。如果查看更靠后的位置(如前 5 或前 10 个结果),提升幅度分别跃升至 4.16%4.10%

“视情况而定”的部分:
在教学幻灯片上,结果略有不同。提升幅度较小(+3.88%),且论文指出该结果不具有统计学显著性(p = 0.0952)。

  • 原因何在? 作者认为,对于幻灯片来说,通常存在许多种“正确”的总结方式。即使你的眼睛看向了某个特定的图表,不同的人对该图表“含义”的理解也会有所不同。注视能告诉你他们“看”了哪里,但不能一定告诉你他们如何“理解”那些复杂的概念。因此,VEGAS 擅长捕捉具体的物体(如红帽子或狗),但在处理抽象概念时并不完美。

他们排除了哪些可能性

论文非常谨慎地检查了 VEGAS 是否仅仅是通过挑选更短或更简单的标题来“作弊”。

  • 它只是在选短标题吗? 没有。他们检查了 VEGAS 得分与单词数量之间的相关性,结果几乎为零(0.001)。
  • 它只是在选通用的标题吗? 没有。它与“特异性”(使用名词、动词等)的相关性也接近于零(0.026)。
  • 它需要新的 AI 模型吗? 不需要。他们使用了现有的强大 AI 模型(如 Gemini 和 GPT),只是利用 VEGAS 从一组候选标题中挑选出最好的一个。无需重新训练。

底线结论

VEGAS 表明,如果你想要一个既有个人特色又能帮你以后找到视频的视频标题,你不应该只问 AI“这个视频里有什么?”你应该问:“这个人到底看了什么?”

论文表明,通过使用眼动追踪数据作为过滤器,我们可以将通用的 AI 描述转化为更符合人类注意力的个性化描述——尤其是在涉及现实世界动作的视频时。它虽然不是解决一切问题的万能药(幻灯片问题依然存在),但它是一个强大的新工具,可以在无需从头开始重建 AI 的情况下发挥作用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →