Eyettention II: A Dual-Sequence Architecture for Modeling Fixation Location, Within-Word Landing Position, and Fixation Duration in Reading
为了解决眼动追踪数据的稀缺问题,本文引入了 Eyettention II,这是一个轻量级的端到端深度学习模型,通过与认知理论对齐,生成逼真的、具有多属性特征的阅读扫描路径,并在预测类人注视行为方面优于现有的最先进模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在读一本书。你的眼睛并不是像高速公路上的汽车那样平滑地滑过页面;相反,它们是以一种被称为“注视”(fixations)的小幅度爆发进行跳跃,落在特定的单词上,有时会向前跳跃,有时会向后跳回重新阅读。这种跳跃的模式被称为扫描路径(scanpath)。
几十年来,科学家们一直试图构建计算机模型,来精确预测你的眼睛会落在哪里以及会在那里停留多久。问题在于,收集真实的眼动追踪数据既昂贵又缓慢——这就像是在拍摄一部电影,而每一位演员都必须在头上戴着一个特殊的摄像机。由于缺乏足够的“真实”素材,很难训练计算机去精准预测这些跳跃。
Eyettention II 应运而生。将这个新模型想象成一个高度熟练的模拟器或虚拟眼动仪。它是一款可以为任何文本生成逼真的“虚假”眼动数据的软件,包括眼睛落在哪一点、落在单词的具体哪个位置,以及停顿了多久。
以下是其工作原理及论文发现的详细解读,使用了简单的类比:
1. “双序列”谜题
大多数计算机模型将阅读视为一个简单的列表:单词 1,单词 2,单词 3。但人类的阅读是杂乱无章的。我们会跳过单词,向后跳跃,或者在长单词上停留更久。
作者将 Eyettention II 描述为一个双序列架构师。想象两条并排运行的传送带:
- 传送带 A(文本): 句子中按顺序出现的单词。
- 传送带 B(时间): 你的眼睛实际看向事物的顺序。
因为你的眼睛并不总是完美遵循文本顺序(你可能会跳回到开头),这两条传送带会变得不同步。Eyettention II 的特别之处在于它有一个“交通控制器”(交叉注意力机制),能够同时观察这两条传送带。它知道,即便文本显示下一个是“单词 5”,你的眼睛也可能正在跳回“单词 2”。这使其能够模拟人类阅读时那种混乱且非线性的方式。
2. 它能预测什么?
旧的模型就像是一个只告诉你身处哪个城市的 GPS。而 Eyettention II 是一个高清晰度的 GPS,它能告诉你:
- 城市(单词索引): 眼睛正在看哪个单词?
- 街道地址(落点位置): 眼睛究竟落在该单词的哪个位置?(例如:开头、中间还是结尾)。
- 停留时间(持续时间): 眼睛在那里停留了多久?
它像人类实时阅读一样,一个接一个地生成这三样东西。
3. “私人教练”模式
论文还引入了一个名为 Eyettention IIreader 的特殊版本。
想象你有一个通用的健身教练,他了解普通人的跑步方式。但如果你想要一个了解你特定跑步风格的教练呢?这个版本的模型可以针对特定的人(或人群)进行“微调”。如果你向它输入某个特定读者的数据,它就能学习他们的独特习惯——比如他们是否更频繁地跳过短单词,或者是否会在困难的单词上盯着看更久——然后它可以模拟出那个特定人的眼动轨迹。
4. 它表现如何?
研究人员在英文和中文文本(两种截然不同的语言)上测试了这个模型。他们将其与以下对象进行了对比:
- 旧的 AI 模型: 新模型胜出了,预测眼动更加准确。
- 经典的“认知”模型: 这些是基于规则的旧模型,由心理学家构建以模拟人类思维。Eyettention II 也击败了它们,证明了数据驱动的方法可以捕捉到简单规则所遗漏的复杂模式。
- 真实人类: 有趣的是,该模型的“虚假”眼动轨迹有时甚至比真实人类之间的差异还要小。这是因为真实人类是杂乱且差异巨大的,而模型找到了“平均”的人类模式。
5. 我们为什么需要一个虚假的眼动仪?
论文强调了使用这个模拟器的三个主要原因,都与节省时间和金钱有关:
- “试点测试”(实验规划): 在科学家对 50 个人进行真实实验之前,他们可以使用模拟器进行 1,000 次虚拟实验。这有助于他们确定实验材料是否合格,以及实际需要招募多少人。这就像是研究人员的飞行模拟器。
- “数据增强器”(训练 AI): 如果你想构建一个理解阅读的 AI,你需要大量的眼动数据。由于真实数据稀缺,你可以使用 Eyettention II 生成数百万条“虚假”的眼动记录来训练你的 AI,从而在不需要给成千上万真实的人戴上摄像机的情况下,让 AI 变得更聪明。
- “假设工具”: 研究人员可以使用它来观察不同的文本布局或语言如何影响阅读,而无需搭建昂贵的实验室设备。
6. 一个令人惊讶的发现:“大并不代表好”
研究人员使用不同规模的“大脑”(语言模型)来理解文本,并测试了该模型。他们发现了一个反直觉的结果:较小的模型效果更好。
- 他们尝试使用极其庞大、复杂的 AI 模型(类似于驱动高级聊天机器人的模型)来理解文本。
- 他们也尝试了更小、更简单的模型。
- 结果: 较小的模型在预测人类眼动方面表现得更好。这似乎表明,对于阅读而言,你不需要一个能理解深奥哲学的超级复杂的大脑;你需要的是一个能理解句子即时、表层结构的模型。
总结
Eyettention II 是一个轻量级、高效的计算机程序,充当着“虚拟眼睛”的角色。它不仅能猜测你下一个要读哪个词,还能预测你的眼睛会落在该词的哪个位置以及会盯着看多久,以极高的准确度模拟人类行为。它通过生成高质量的“虚假”数据,解决了真实眼动数据不足的问题,从而帮助科学家更好地规划实验并训练更智能的 AI 系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。