想象一下,尝试预测一个人在看到一张图片时,眼睛下一步会看向哪里。长期以来,科学家们一直在构建专门用于这项工作的特殊、僵化的机器。这些机器拥有固定的规则(例如“人们总是先看中心”),并且无法轻易地学习新技巧,比如“这个人是一个正在寻找诊断结果的医生”或者“这个人是一个正在寻找玩具的孩子”。
这篇论文介绍了一种名为 DeepGaze3.5-VL 的新模型,它改变了游戏规则。作者并没有构建一台特殊的机器,而是将眼动过程视为编写一个故事。
以下是其工作原理及研究发现的详细拆解,使用了简单的类比:
1. 核心理念:将眼动视为“文本”故事
把一个人的视线路径(称为扫描路径/scanpath)想象成一个句子。
- 旧方法: 你建造了一个定制机器人来绘制这个句子,但如果你想改变风格(例如从小孩的手写体变为成人的手写体),你必须重建这个机器人。
- 新方法: 作者意识到,眼动仅仅是一系列坐标序列(例如“看这里,然后看那里”)。他们训练了一个巨大的、预训练好的 AI(一个大型视觉语言模型),让它将这些坐标视为句子中的单词。
通过将眼睛的位置转化为“Token”(类似于单词中的字母),该 AI 可以利用其庞大的大脑——该大脑已经过图像和语言理解的训练——来预测下一个“单词”(即眼睛下一个注视点)。
2. “提示词”的魔力
因为这个模型是以语言进行思考的,所以你可以像向聊天机器人提问一样给它指令。
- 类比: 想象一位导游。如果你告诉导游,“像游客一样带我参观博物馆”,他会带你看那些著名的雕像。如果你说,“像艺术史学家一样带我参观”,他会指出笔触。
- 结果: 研究人员展示了,通过简单地改变文本提示(例如,“预测一个正在寻找猫的人的注视路径”对比“预测一个只是随便看看的人的注视路径”),模型可以瞬间完成适配。它不需要新的硬件或复杂的代码更改;它只需要阅读指令。
3. 为什么更好:关于“智能”与“规模”的辩论
研究人员问道:这个模型之所以优秀,是因为它规模巨大,还是因为它真的理解了场景?
- 测试: 他们将该模型与使用完全相同的“眼睛”(视觉编码器)但拥有不同“大脑”的其他顶尖模型进行了对比。
- 发现: “大脑”(AI 的语言部分)比仅仅拥有更大的“眼睛”更为重要。一个能够理解图像含义和眼动“故事”的模型,其表现远优于一个仅仅看到像素的模型。
- 得分: 在一项标准测试(MIT1003)中,他们的模型比之前的最佳方法在预测准确度上提升了 46%。
4. “时间机器”实验(干预实验)
这篇论文展示的最酷的东西之一,是能够在计算机内运行无需真实人类参与的**“假设如果”场景**。
- 类比: 想象一个电子游戏,你可以暂停时间,改变一个变量(比如“玩家累了”),然后立即看到游戏会如何不同的演变。
- 实验: 研究人员提取了人类看图片的一个特定时刻(持续 50 毫秒),并询问模型:“如果他们看的时间更长(600 毫秒)会怎样?”
- 结果: 模型预测,短时间的注视往往是快速、本能的瞥视(类似于反射),而长时间的注视则会导致更多漫游式、思考式的探索。模型纯粹通过阅读数据就理解了这些复杂的人类行为,充当了一个人类视觉的数字沙盒。
5. “谁”的因素(个性化)
该模型还可以被告知注视者是谁。
- 类比: 如果你知道你的朋友喜欢狗,并且你给他看一张公园的照片,你知道他会先看狗。如果给另一个人看同一张照片,而那个人喜欢鸟,那么他会先看树。
- 结果: 通过向模型输入特定的“主体 ID”(例如“Subject A3F8”),它学会了预测该人独特的习惯。它不需要新的架构;它只是学会了不同的“角色”拥有不同的“故事线”。
总结
DeepGaze3.5-VL 是一种预测人类注视点的新方法。作者没有构建僵化、专门的工具,而是将眼动追踪变成了一个语言问题。通过这样做,他们创造了一个具备以下特性的模型:
- 更聪明: 它理解场景的上下文和含义。
- 更灵活: 你可以通过输入新的指令来改变它的行为。
- 更准确: 它大幅超越了以往的所有记录。
- 更具实验性: 它允许科学家在无需进行新的物理实验的情况下,瞬间模拟关于人类视觉的“假设如果”场景。
技术摘要:DeepGaze3.5-VL
问题陈述
对人类视觉注意力随时间变化(扫描路径预测)的建模,在历史上一直依赖于包含手工设计几何先验(如受限的莱维飞行、扫视偏差或抑制性标记)的专门架构。虽然这些模型成功捕捉了注视序列,但其僵化的结构偏差限制了可扩展性和灵活的调节能力。将特定任务的指令集成或适应不同的观察者身份,传统上需要定制且不连续的架构增补。此外,现有的生成式方法(例如扩散模型、神经点过程)通常仅针对注视数据从头开始训练,未能利用基础模型中丰富的序列先验。一个关键的瓶颈在于评估:连续生成模型无法原生计算精确的空间概率密度,迫使研究者依赖启发式的序列对齐指标(如 ScanMatch),而非严谨的信息论度量。
方法论
作者提出了 DeepGaze3.5-VL,该框架通过将扫描路径预测纯粹重新定义为使用大型视觉语言模型(LVLMs)的离散序列建模任务。
核心公式
- 自回归 Token 预测: 模型不再回归连续坐标,而是将注视预测为离散的 Token 序列。空间坐标 (x,y) 被映射为代表图像维度百分比位置的零填充两位整数(00–99)。这确保了每次注视恰好贡献四个 Token(x 两个,y 两个),保证了 Token 长度的统一和概率比较的公平性。
- LVLM 集成: 系统利用经过低秩自适应(LoRA)微调的预训练 LVLM(具体为 InternVL3.5-8B)。模型通过自然语言提示词编码输入图像 I 和可选的调节因子 C(例如任务描述、受试者 ID)。
- 训练目标: 模型通过在地面真值(ground-truth)扫描路径上的标准次 Token 预测进行训练。自回归结构允许计算任何有效注视序列的精确对数似然:
logP(S∣I,C)=i=1∑nlogP((xi,yi)∣I,C,(x1,y1),…,(xi−1,yi−1))
评估策略
- 信息增益 (IG): 作者利用自回归对齐来计算精确的信息增益,定义为相对于中心偏差基准线的对数似然提升。与连续模型不同,该公式无需启发式方法即可计算精确的空间概率密度。
- 高效计算: 为了计算跨越 100×100 网格的全空间分布(例如用于 AUC),作者采用了**前缀树(prefix tree)**策略。通过缓存共享前缀的键值(Key-Value)状态,他们将联合概率分解为 4 相扩展(边缘 x1,条件 x2,条件 y1,条件 y2),这仅需 1,111 次前向传播,而非 10,000 次。对于 IG 特别是,每次注视仅需 4 次前向传播。
核心贡献
- 将问题形式化为自回归 Token 预测: 通过微调 LVLM 来预测离散坐标 Token,作者利用了预训练的语义和序列先验。这种方法在 MIT1003 数据集上实现了 2.18 bits 的信息增益,相比于匹配骨干网络的 DeepGaze III 基准提升了 46%。
- 精确且高效的评估: 该框架利用自回归结构来分解全空间联合概率,从而实现大规模、精确且快速的信息增益计算,解决了生成式扫描路径模型的一个主要评估瓶颈。
- 灵活的调节与泛化: 模型通过自然语言提示自然地吸收多样化的变化因素。它展示了强大的分布外泛化能力(留一数据集法),并且可以在不改变架构的情况下,根据任务目标(自由观察 vs. 视觉搜索)或个体观察者身份进行调节。
- 计算机内(In-silico)干预: 该生成式框架作为一个受控行为干预的计算工具,允许模拟反事实场景(例如改变注视时长),而这些场景在实验中难以开展。
结果
- 性能: DeepGaze3.5-VL 在五个多样化数据集(MIT1003, COCO-FreeView, CAT2000, DAEMONS, FiGrIm)上建立了新的最先进性能。在 MIT1003 上,它实现了 2.18 bits 的 IG,而 DeepGaze III(使用相同的 InternViT-6B 骨干网络重新训练)为 1.49 bits。
- 表示的作用: 性能提升不仅仅是因为更好的视觉特征。一项控制实验显示,即使使用更优越的 InternViT-6B 编码器的 DeepGaze III 仍然表现不如该 VLM。此外,在信息增益与 MMMU 基准测试得分(衡量多模态推理能力的指标)之间观察到强相关性 (ρ=0.93),这表明高层语义理解驱动了扫描路径预测的质量。
- 序列性 vs. 空间性: 消融研究表明,虽然静态空间显著性驱动早期注视,但序列依赖(特定观察者的历史记录)成为后期注视的主要预测因子。全模型优于“历史不变”和“仅空间”变体,尤其是在扫描路径的后期阶段。
- 调节效应:
- 时长: 对注视时长进行调节可以改善空间预测,特别是对于短注视(<100 ms),从而恢复了已知的眼动现象(如预编程扫视)。
- 受试者身份: 提供受试者 ID 可使 IG 提高 +0.09 bits/注视,使模型能够学习每个观察者独特的空间先验。
意义与主张
本文声称,将扫描路径预测形式化为自回归 Token 预测,弥合了专门化注视模型与通用基础模型之间的鸿沟。作者断言:
- 语义理解是关键: 学习到的多模态表示的质量(通过推理基准衡量)是扫描路径预测的主要驱动力,这支持了认知理论,即顶层任务目标和语义理解驱动视觉探索。
- 原生评估: 自回归形式化使扫描路径预测与基础模型的原生训练目标保持一致,使得信息增益成为次 Token 预测目标的直接体现,消除了对替代指标的需求。
- 生成效用: 除了预测之外,该框架还作为一个强大的“计算机内”行为干预工具。作者展示了该模型可以纯粹从数据统计中恢复已知的眼动现象(例如注视时长对空间熵的调制),从而实现受控模拟,而无需额外的实验数据收集。
这项工作表明,前几代模型中僵化的、手工设计的先验不再是必需的,因为 LVLM 中固有的序列和语义先验足以以更高的灵活性和准确性来建模复杂的人类注视动力学。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。