← 最新论文
💬 NLP

Eye Tracking Based Cognitive Evaluation of Automatic Readability Assessment Methods

本文介绍了一种基于眼动追踪的认知评估框架,该框架揭示了与心理语言学词汇属性相比,传统的可读性公式、自然语言处理方法、商业系统以及前沿的大语言模型在预测实时阅读易度方面表现较差,从而强调了开发新的认知驱动评分方法的必要性。

原作者: Keren Gruteke Klein, Shachar Frenkel, Omer Shubi, Yevgeni Berzak

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Keren Gruteke Klein, Shachar Frenkel, Omer Shubi, Yevgeni Berzak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚一本书的阅读难度。一百多年来,科学家和教师一直试图构建“可读性公式”——即通过观察文本并输出一个年级水平(例如“这是五年级的文本”或“这是十二年级的文本”)的数学配方。他们通常通过统计诸如句子长度或大词数量等指标来进行。但问题的关键在于:仅仅因为一段文本的句子很短,并不意味着人类在阅读时实际上的“感觉”是容易的。要真正了解一段文本是否容易,你需要观察一个人的大脑在实时是如何运作的。这就是“眼动追踪”发挥作用的地方。它就像是在人的眼睛上放了一个微型摄像头,用来观察他们具体在看哪里、盯着一个词看了多久,以及是否因为困惑而不得不回看(回视)。这就像是通过观察发动机尺寸来猜测汽车的速度,与实际驾驶并感受速度之间的区别。

这篇题为《基于眼动追踪的自动可读性评估方法认知评价》的论文,是对文本分析领域的一次重大现实检验。由以色列技术学院的 Keren Gruteke Klein 及其团队领导的研究人员,决定测试目前最流行的判断文本难度的方法。他们收集了 638 名成年读者的大规模样本——其中既有英语母语者,也有英语作为第二语言的学习者——并让他们在电脑上阅读新闻文章,同时以每秒 1,000 次的高速进行眼动追踪。他们使用了一个巧妙的技巧:他们将同样的新闻故事交给人类教师进行简化改写。这使得研究人员能够对比同一内容的“难版”和“易版”,从而将写作风格与主题本身隔离开来。

随后,团队提出了一个简单的问题:哪种计算机程序最擅长预测“易版”版本在读者实际感受中到底有多容易?他们测试了从传统数学公式(如 Flesch 阅读易度得分)到现代人工智能系统、商业化学校工具以及前沿的大型语言模型(LLM)。值得注意的是,该研究评估了 GPT-4o 及其他尖端系统(包括论文中标记为 2025 年等未来日期的版本),并使用了特定的提示词,要求 AI 分配一个年级水平或 1 到 100 之间的难度分数。他们将这些高科技工具与一些非常简单的、传统的心理学测量指标进行了对比,比如一个词在语言中的使用频率,或者一个词出现在此处时的“意外程度”。

结果令人震惊。尽管拥有如此精妙的技术和现代人工智能的强大能力,流行的可读性工具在预测文本在实时阅读中实际感受到的难易程度方面表现得极其糟糕。那些旧有的公式、商业化的学校工具,甚至是最尖端的 AI 模型,都未能匹配读者的眼动轨迹。事实上,表现最好的预测指标竟然是那些最简单的东西:单词的长度、单词的常见程度,以及一种被称为“惊异度”(surprisal)的指标(这基本上是数学上描述“这个词出现的出乎意料程度”的一种方式)。这项研究表明,虽然我们目前的工具在猜测一段文本属于哪个年级水平方面做得很好,但它们错失了人类真实的阅读体验。作者得出结论,我们需要停止依赖这些旧方法来进行高风险决策,转而开始构建那些真正由大脑在处理单词瞬间的运作方式所驱动的新系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →