✨ 要点🔬 技术摘要
想象一下,你的眼睛就像黑暗房间里的一束手电筒光。当你注视某个物体时,这束光并不会静止不动,而是会快速跳动,在不同的位置停留极短的时间。这种运动模式被称为“扫描路径”(scanpath)。长期以来,科学家们一直试图通过观察你的“手电筒光”落在哪里,来推测你在想什么。通常,他们会将这视为一道多选题。他们会问:“这个人是在找猫还是在找狗?”然后让计算机从一个固定的列表中选择一个答案。但人类的思想是杂乱且富有创造力的。有时候你不仅仅是在寻找一只“狗”,你是在寻找“那只躲在沙发后面、戴着红色围巾的、毛茸茸的金毛寻回犬”。旧的提问方式过于简单,无法捕捉到这种细节。这就是一个被称为“注视解码”(gaze decoding)的新兴领域,它试图将你的眼动轨迹转化为脑海中正在发生的丰富且开放式的叙事。
现在,一篇研究论文介绍了一种解决这个谜题的巧妙新方法。来自斯托尼布鲁克大学和阿德莱德大学的研究人员开发了一个名为 Gazette 的系统。Gazette 的设计初衷不是强迫计算机从多选题中做出选择,而是像人类一样,使用自然语言来编写一段关于一个人正在寻找什么的自由形式的故事。你可以把它想象成从一份僵化的清单升级到了一位能够精准描述你所见之物的创意作家。
研究人员面临的一个大问题是,即使是在看同样的东西,每个人的眼睛运动方式也略有不同。如果让十个人去找一辆“红色的车”,十个人寻找车的方式可能会有十种细微的差别。有些人可能会先看车轮,有些人则可能先看车窗。如果你只给计算机看一个人的眼动轨迹,它会被这些个人习惯搞糊涂。这就像试图通过听一个人跑调的哼唱来猜一首歌——你或许能听到旋律,但噪音让你很难确定。
为了解决这个问题,团队想出了一个聪明的策略,即“出声思考”(think-aloud)策略。他们意识到,虽然每个人的眼动方式是独特的,但其背后的“原因”是相同的。因此,他们利用一个强大的 AI(GPT-4)来观察许多人在寻找同一物体时的眼动情况。这个 AI 扮演了侦探的角色,忽略了个体的差异,寻找到了共同的模式——即人类寻找特定物体时的“秘密配方”。随后,AI 写下了一份“出声思考转录稿”,这本质上是一个解释策略的故事:“首先,观察大的形状,然后放大观察红色部分。”
他们教会了新模型 Gazette 阅读这些由 AI 生成的故事以及眼动轨迹。这有助于模型学习如何将“目标”(人在寻找什么)与“噪声”(人独特的观察方式)区分开来。在测试时,Gazette 在预测目标方面比以往的方法表现得更好。例如,当被要求在一张图片中寻找特定的汽车时,Gazette 不仅仅会说“汽车”,它还能说出“右上角的黑色汽车”,并且即便在任务非常复杂的情况下也能保持很高的准确度。
这篇论文表明,通过教计算机理解眼动背后的“策略”,而不仅仅是眼动本身,我们可以更详细地解码人类的意图。虽然该系统在人们对于寻找目标达成共识时(例如寻找特定物体)效果最好,但这表明我们正越来越接近这样一个未来:计算机仅通过观察我们的注视点就能理解我们的目标,从而为更好的辅助技术和对人类如何与世界互动的深入理解开启大门。
技术摘要:Gazette – 注视点到文本生成(Gaze-to-Text Generation)
问题定义 本文针对现有注视解码方法的局限性提出了研究,这些方法通常将任务视为在固定预定义类别集上的判别式分类问题(例如,从有限的词汇表中识别特定物体)。作者认为,这种基于类别的做法本质上是受限的,缺乏在电子商务、教育分析和辅助技术等现实应用中所需的细粒度细节和开放式表达能力。相反,本文提出了一种全新的学习问题:注视点到文本生成(Gale-to-Text Generation) 。其目标是将人类的注视扫描路径(scanpaths)解码为自由形式的自然语言描述,以捕捉人类目标和意图的丰富细微差别,其范围涵盖了从简单的物体标签到复杂的、具有丰富上下文的指代性表达或问题。
方法论:Gazette 框架 作者引入了 Gazette ,这是第一个基于多模态大语言模型(MLLM)的注视点到文本解码生成式框架。
架构: Gazette 扩展了 LLaVA-1.5-7B 基础模型。它接收输入图像 I I I 、注视扫描路径 S S S (以文本形式编码为包含坐标和持续时间的注视点序列)以及语言指令。模型输出关于认知上下文的自然语言描述 D D D ,其中包括:
粗粒度行为类型: 目标导向行为的类别(例如:目标存在的/不存在的视觉搜索、物体指代、视觉问答)。
细粒度刺激物: 特定的目标(例如:目标类别、指代性表达或问题)。
个体差异性的挑战: 作者发现的一个核心挑战是注视信号受到个体差异的干扰。对于相同的目标,不同的参与者会表现出不同的扫描路径。在“图像-扫描路径-目标”三元组上进行标准的指令微调往往会失败,因为模型难以将目标驱动的信号与参与者特有的噪声区分开来。
出声思维转录生成(辅助任务): 为了解决这种解耦问题,作者提出了一种名为 ThinkAloud 的新型辅助训练目标。
概念: 作者利用了这样一个理论洞察:虽然个体的扫描路径各不相同,但在同一图像上执行相同任务时,潜在的目标驱动注意力分配策略在不同参与者之间是保持不变的。
实现: 他们利用 GPT-4 分析来自多个具有相同目标和图像的参与者的扫描路径。GPT-4 综合生成了**“出声思维转录(think-aloud transcripts)”**,这些转录描述了共同的时空模式和自上而下的注意力分配策略,从而有效地过滤掉了个体的特异性。
训练数据: 这些转录作为辅助任务的伪标注,在该任务中,模型学习在给定图像和单个扫描路径的情况下生成注意力分配策略。转录内容包含三个“意念单元(idea units)”:(i) 自上而下的注意力分配解释,(ii) 推断的目标位置(边界框),以及 (iii) 扫描路径长度。
指令微调: Gazette 使用低秩自适应(LoRA)在主要任务 GazeDec (解码目标)和辅助任务 ThinkAloud (生成策略解释)的组合上进行微调。
核心贡献
任务形式化: 引入了不受限的注视解码,其中目标通过开放词汇的自然语言而非固定类别来表达。
Gazette 框架: 开发了首个专门用于解码自上而下注意力的文本生成式 MLLM 框架。
辅助目标: 提出了 ThinkAloud 转录预测任务。该策略利用了不同观察者之间目标驱动信号的共享不变性,帮助模型过滤个体差异,从而显著提高了解码性能。
实验结果 作者在三个数据集上评估了 Gazette:COCO-Search18(视觉搜索)、RefCOCO-Gaze(物体指代)和 AiR-D(视觉问答)。
生成式任务(物体指代与视觉问答):
Gazete 在词汇重叠指标(BLEU、METEOR、ROUGE、CIDEr)上显著优于基线模型(包括标准的 LLaVA-1.5 和“最后一次注视点”基线)。
在 LLM-as-a-Judge 范式下(使用 GPT-4 评估流畅度、相关性和正确性),Gazette 取得了比未经过 ThinkAloud 任务训练的变体("w/o ThinkAloud")更高的评分。
结果表明,ThinkAloud 任务有助于模型学习复杂的推理过程和注意力分配策略,从而实现更准确、更具上下文感知能力的描述。
预测式任务(视觉搜索):
在 COCO-Search18 数据集上,Gazette 达到了最先进或接近最先进的性能。
对于**目标存在(Target-Present)**搜索,Gazette 达到了 77.3% 的准确率,几乎与之前的最先进水平(Mondal 等人实现的 77.6%)持平。
对于**目标不存在(Target-Absent)**搜索,Gazette 显著优于以往的方法(44.3% 准确率对比 Mondal 等人的 38.7%)。
作者指出,目标不存在搜索的改进较为温和,将其归因于此类任务中观察者间的一致性较低,从而降低了共享模式提取策略的有效性。
意义与主张 本文声称 Gazette 使注视能够成为一种强大的、非侵入性的线索,用于推断具有细粒度语义细节的人类目标,从而超越了固定分类学的限制。通过 ThinkAloud 策略成功地将目标特定的动态特性与个体噪声解耦,该框架展示了在多种自上而下注意力任务中的泛化能力。
作者将这项工作定位为迈向现实世界应用的一步,在这些应用中,理解用户正在寻找什么 (例如:购物中的特定风格偏好、教育中的概念焦点或 AR 中的导航意图)至关重要。他们承认了局限性,特别是该方法依赖于观察者间的一致性(在一致性较低的任务中性能下降),且 GPT-4 生成的转录可能会继承 LLM 训练先验的偏差,而非真实的参与者认知。然而,他们断言,这种方法为利用 MLLM 理解人类注意力和心理状态开辟了新的途径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。