← 最新论文
💻 computer science

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL 通过将该任务重新定义为视觉语言模型中的自回归标记生成,在视觉扫描路径预测领域建立了新的最先进水平,在实现显著性能提升的同时,实现了对观察者身份和任务的灵活调节,并促进了受控的计算机内行为模拟。

原作者: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,尝试预测一个人在看到一张图片时,眼睛下一步会看向哪里。长期以来,科学家们一直在构建专门用于这项工作的特殊、僵化的机器。这些机器拥有固定的规则(例如“人们总是先看中心”),并且无法轻易地学习新技巧,比如“这个人是一个正在寻找诊断结果的医生”或者“这个人是一个正在寻找玩具的孩子”。

这篇论文介绍了一种名为 DeepGaze3.5-VL 的新模型,它改变了游戏规则。作者并没有构建一台特殊的机器,而是将眼动过程视为编写一个故事

以下是其工作原理及研究发现的详细拆解,使用了简单的类比:

1. 核心理念:将眼动视为“文本”故事

把一个人的视线路径(称为扫描路径/scanpath)想象成一个句子。

  • 旧方法: 你建造了一个定制机器人来绘制这个句子,但如果你想改变风格(例如从小孩的手写体变为成人的手写体),你必须重建这个机器人。
  • 新方法: 作者意识到,眼动仅仅是一系列坐标序列(例如“看这里,然后看那里”)。他们训练了一个巨大的、预训练好的 AI(一个大型视觉语言模型),让它将这些坐标视为句子中的单词

通过将眼睛的位置转化为“Token”(类似于单词中的字母),该 AI 可以利用其庞大的大脑——该大脑已经过图像和语言理解的训练——来预测下一个“单词”(即眼睛下一个注视点)。

2. “提示词”的魔力

因为这个模型是以语言进行思考的,所以你可以像向聊天机器人提问一样给它指令。

  • 类比: 想象一位导游。如果你告诉导游,“像游客一样带我参观博物馆”,他会带你看那些著名的雕像。如果你说,“像艺术史学家一样带我参观”,他会指出笔触。
  • 结果: 研究人员展示了,通过简单地改变文本提示(例如,“预测一个正在寻找猫的人的注视路径”对比“预测一个只是随便看看的人的注视路径”),模型可以瞬间完成适配。它不需要新的硬件或复杂的代码更改;它只需要阅读指令。

3. 为什么更好:关于“智能”与“规模”的辩论

研究人员问道:这个模型之所以优秀,是因为它规模巨大,还是因为它真的理解了场景?

  • 测试: 他们将该模型与使用完全相同的“眼睛”(视觉编码器)但拥有不同“大脑”的其他顶尖模型进行了对比。
  • 发现: “大脑”(AI 的语言部分)比仅仅拥有更大的“眼睛”更为重要。一个能够理解图像含义和眼动“故事”的模型,其表现远优于一个仅仅看到像素的模型。
  • 得分: 在一项标准测试(MIT1003)中,他们的模型比之前的最佳方法在预测准确度上提升了 46%

4. “时间机器”实验(干预实验)

这篇论文展示的最酷的东西之一,是能够在计算机内运行无需真实人类参与的**“假设如果”场景**。

  • 类比: 想象一个电子游戏,你可以暂停时间,改变一个变量(比如“玩家累了”),然后立即看到游戏会如何不同的演变。
  • 实验: 研究人员提取了人类看图片的一个特定时刻(持续 50 毫秒),并询问模型:“如果他们看的时间更长(600 毫秒)会怎样?”
  • 结果: 模型预测,短时间的注视往往是快速、本能的瞥视(类似于反射),而长时间的注视则会导致更多漫游式、思考式的探索。模型纯粹通过阅读数据就理解了这些复杂的人类行为,充当了一个人类视觉的数字沙盒

5. “谁”的因素(个性化)

该模型还可以被告知注视者是

  • 类比: 如果你知道你的朋友喜欢狗,并且你给他看一张公园的照片,你知道他会先看狗。如果给另一个人看同一张照片,而那个人喜欢鸟,那么他会先看树。
  • 结果: 通过向模型输入特定的“主体 ID”(例如“Subject A3F8”),它学会了预测该人独特的习惯。它不需要新的架构;它只是学会了不同的“角色”拥有不同的“故事线”。

总结

DeepGaze3.5-VL 是一种预测人类注视点的新方法。作者没有构建僵化、专门的工具,而是将眼动追踪变成了一个语言问题。通过这样做,他们创造了一个具备以下特性的模型:

  1. 更聪明: 它理解场景的上下文和含义。
  2. 更灵活: 你可以通过输入新的指令来改变它的行为。
  3. 更准确: 它大幅超越了以往的所有记录。
  4. 更具实验性: 它允许科学家在无需进行新的物理实验的情况下,瞬间模拟关于人类视觉的“假设如果”场景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →