← 最新论文
💻 computer science

Predicting Human Visual Attention on Words in Source Code

本文介绍了一种新颖的计算模型,该模型通过利用一种专门的损失函数,使神经网络的内部注意力与 Java 和 C 编程语言中的经验眼动追踪数据保持一致,从而在预测人类对源代码的视觉注意力方面显著优于现有的基准模型和先进的 AI 系统。

原作者: Chia-Yi Su, Collin McMillan

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Chia-Yi Su, Collin McMillan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解人类在阅读书籍时大脑是如何运作的。你不能直接问他们:“你现在在想什么?”因为他们可能不知道,或者可能会撒谎。因此,科学家们使用一种特殊的相机来观察他们的眼睛。这被称为眼动追踪(eye-tracking)。它就像一个微型聚光灯,跟随人的视线移动,向我们展示他们究竟盯着哪些词、跳过了哪些词,以及在哪里停顿了多久。在计算机科学领域,这是一件大事,因为软件工程师一生都在盯着源代码(source code)——即那些告诉计算机如何运行的文本指令。但代码不仅仅是一个故事;它是一个谜题。工程师并不像读小说那样阅读代码;他们会来回跳转,反复阅读某些行,并寻找线索。了解他们的视线落在哪儿,能帮助我们构建更好的工具、设计更清晰的屏幕,甚至教计算机像人类一样思考。

现在,棘手的部分来了:计算机通常非常不擅长猜测人类正在看哪里。它们可能会认为一个长而复杂的单词是最重要的,但人类工程师知道,旁边那个简短、枯燥的单词才是整个程序的关键。这篇论文是关于如何教计算机停止瞎猜,开始像人类程序员一样去“看见”。研究人员构建了一种特殊类型的计算机大脑(模型),它通过观察人类阅读代码的过程来进行学习。他们不仅仅是告诉计算机:“这是代码,猜下一个词。”相反,他们给了它一张秘密的“作弊表”:一张人类眼睛实际落点的位置图。他们教会了计算机将自己的内部“注视点”与人类真实的注视点进行对比,不断调整自己的思维,直到两者匹配。

主要的发现是,这种新的计算机模型在模仿人类注意力方面表现得惊人地出色。当研究人员将其应用于针对三组不同程序员(一些在阅读 Java 代码,一些在阅读 C 代码)的测试时,计算机的预测结果比以往任何计算机模型都更接近人类的真实行为。事实上,在某些测试中,它预测人类视线落点的准确度比旧的标准方法高出了 64% 甚至 467%。它不仅猜对了数字,还学会了人类思维的模式

但研究人员并没有止步于此。他们想看看这种“类人”的注意力是否能帮助计算机完成一项更难的工作:预测被称为**扫描路径(scanpath)*的精确眼动序列。想象一下,尝试预测一名徒步旅行者在森林中行走时会采取的精确路径,一步接一步。通过接受人类眼动数据训练的计算机,能够比其他著名的 AI 模型(如 GPT-5 和 Claude)以及之前的最佳计算机程序,更好地预测这些路径。虽然它在写作任务上也显示出了进步,但研究人员指出,与之前的最佳计算机程序相比,这些特定的增益在统计学上并不显著,尽管它仍然优于那些商业模型。这表明,当我们教计算机像人类那样去关注时,它们不仅变得更擅长阅读,还开始理解思考本身的过程*。

然而,作者们谨慎地表示,他们并没有声称已经解开了人类思维之谜。他们承认,他们的模型是一个“估计器”,用于估算一群人的普遍行为,而不是任何单个人大脑的完美副本。它也有局限性;它在处理较小的代码块时效果最好,如果代码过于庞大以至于无法一次性放入其内存,它可能会感到困惑。但结果有力地暗示,通过观察我们的眼睛如何移动,我们可以教机器像我们一样看待世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →