← 最新论文
💻 computer science

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

本文介绍了 Gazette,这是一个利用多模态大语言模型和合成的“出声思维”转录文本,将人类注视扫描路径解码为自由形式自然语言描述(旨在捕捉人类意图中开放式的细微差别,从而超越传统的类别解码)的新型框架。

原作者: Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的眼睛就像黑暗房间里的一束手电筒光。当你注视某个物体时,这束光并不会静止不动,而是会快速跳动,在不同的位置停留极短的时间。这种运动模式被称为“扫描路径”(scanpath)。长期以来,科学家们一直试图通过观察你的“手电筒光”落在哪里,来推测你在想什么。通常,他们会将这视为一道多选题。他们会问:“这个人是在找猫还是在找狗?”然后让计算机从一个固定的列表中选择一个答案。但人类的思想是杂乱且富有创造力的。有时候你不仅仅是在寻找一只“狗”,你是在寻找“那只躲在沙发后面、戴着红色围巾的、毛茸茸的金毛寻回犬”。旧的提问方式过于简单,无法捕捉到这种细节。这就是一个被称为“注视解码”(gaze decoding)的新兴领域,它试图将你的眼动轨迹转化为脑海中正在发生的丰富且开放式的叙事。

现在,一篇研究论文介绍了一种解决这个谜题的巧妙新方法。来自斯托尼布鲁克大学和阿德莱德大学的研究人员开发了一个名为 Gazette 的系统。Gazette 的设计初衷不是强迫计算机从多选题中做出选择,而是像人类一样,使用自然语言来编写一段关于一个人正在寻找什么的自由形式的故事。你可以把它想象成从一份僵化的清单升级到了一位能够精准描述你所见之物的创意作家。

研究人员面临的一个大问题是,即使是在看同样的东西,每个人的眼睛运动方式也略有不同。如果让十个人去找一辆“红色的车”,十个人寻找车的方式可能会有十种细微的差别。有些人可能会先看车轮,有些人则可能先看车窗。如果你只给计算机看一个人的眼动轨迹,它会被这些个人习惯搞糊涂。这就像试图通过听一个人跑调的哼唱来猜一首歌——你或许能听到旋律,但噪音让你很难确定。

为了解决这个问题,团队想出了一个聪明的策略,即“出声思考”(think-aloud)策略。他们意识到,虽然每个人的眼动方式是独特的,但其背后的“原因”是相同的。因此,他们利用一个强大的 AI(GPT-4)来观察许多人在寻找同一物体时的眼动情况。这个 AI 扮演了侦探的角色,忽略了个体的差异,寻找到了共同的模式——即人类寻找特定物体时的“秘密配方”。随后,AI 写下了一份“出声思考转录稿”,这本质上是一个解释策略的故事:“首先,观察大的形状,然后放大观察红色部分。”

他们教会了新模型 Gazette 阅读这些由 AI 生成的故事以及眼动轨迹。这有助于模型学习如何将“目标”(人在寻找什么)与“噪声”(人独特的观察方式)区分开来。在测试时,Gazette 在预测目标方面比以往的方法表现得更好。例如,当被要求在一张图片中寻找特定的汽车时,Gazette 不仅仅会说“汽车”,它还能说出“右上角的黑色汽车”,并且即便在任务非常复杂的情况下也能保持很高的准确度。

这篇论文表明,通过教计算机理解眼动背后的“策略”,而不仅仅是眼动本身,我们可以更详细地解码人类的意图。虽然该系统在人们对于寻找目标达成共识时(例如寻找特定物体)效果最好,但这表明我们正越来越接近这样一个未来:计算机仅通过观察我们的注视点就能理解我们的目标,从而为更好的辅助技术和对人类如何与世界互动的深入理解开启大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →