Leveraging Human Reading Behavior for Keyphrase Extraction: A Webcam-based Eye-tracking Corpus
本研究介绍了中文语言学习眼动数据集(CLIS-ET),并证明了引入轻量级的基于网络摄像头的眼动追踪特征,特别是注视次数和总注视时长,能显著提升中文学术摘要中的关键词提取性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:利用人类阅读行为进行关键词提取
问题陈述
关键词提取(KPE)是信息检索中的一项基础任务,然而现有方法主要依赖于文本内部的线索,如词频、句法模式和上下文语义。这些方法在很大程度上忽略了关键词与人类阅读行为之间的联系,特别是读者在理解过程中如何分配注意力。虽然眼动追踪研究已经证实注视模式与认知加工过程相关,但将这些见解应用于 KPE 面临两个主要因素的阻碍:中文学术文本眼动数据的匮ال乏,以及传统实验室级眼动设备的高昂成本。此外,现有的开源语料库(如 ZuCo、GECO)主要基于新闻或小说等通用内容,缺乏领域特定的术语和结构惯例,尤其是在图书情报学(LIS)领域。
研究方法
为了填补这些空白,作者开发了一个包含数据采集、语料库构建和模型集成的综合框架:
- 轻量化数据采集平台: 本研究采用了一种成本低廉的方法,通过集成开源的 SearchGazer JavaScript 库和基于 Flask 的后端,利用基于网络摄像头的方案。该平台允许使用消费级网络摄像头进行实时注视推断,从而无需专门的硬件设备。
- 语料库构建 (CLIS-ET): 作者构建了中文图书情报学眼动语料库 (CLIS-ET)。数据采集自 10 名图书情报学专业研究生和高年级本科生,他们阅读了来自核心中文图书情报学期刊的 320 篇摘要。实验过程包括在阅读每篇摘要前的九点校准以及阅读后的理解度检查。
- 特征提取: 研究侧重于字符级的眼动指标,以避免分词问题。研究提取了三个主要特征,并在参与者之间取平均值:
- 首次注视时长 (FFD): 对一个字符进行初始注视的时长。
- 注视次数 (FN): 对一个字符进行注视的总次数。
- 总注视时长 (TFD): 注视一个字符的累积时间。
数据经过过滤以保留有效注视(16.7ms 至 1500ms),并剔除了无效字符数据(即超过 50% 的参与者缺乏有效数据的字符)。
- 模型集成: 眼动特征被整合到两类 KPE 模型中:
- 循环神经网络: BiLSTM、BiLSTM+CRF、基于注意力的 BiLSTM (Att-BiLSTM) 以及 Att-BiLSTM+CRF。特征被用作外部输入或注意力指示器。
- 预训练语言模型: BERT、RoBERTa、MacBERT 和 Randeng-T5-784M。
- 评估: 实验在两个数据集上进行:较小的眼动数据集 (Abstract-320) 和源自相同期刊来源的较大规模通用 KPE 数据集 (Abstract-5190)。性能通过 top-3、top-5 和 top-10 关键词提取的 F1 分数进行评估。
主要贡献
- 易于获取的数据采集方法: 本文引入了一种利用标准网络摄像头收集眼动数据的轻量化、可扩展平台,显著降低了领域特定阅读行为研究的门槛。
- CLIS-ET 语料库: 发布了首个针对中文图书情报学学术摘要的领域特定眼动语料库,提供了用于认知 KPE 研究的字符级指标(FFD、FN、TFD)。
- 认知信号的实证验证: 研究系统地评估了单个及组合眼动特征如何影响不同模型架构下的 KPE 性能,证明了人类阅读行为能为文本特征提供补充信号。
结果
- 特征有效性: 在两个数据集和模型类型中,整合眼动特征均一致地提升了 KPE 性能。
- 在 Abstract-320 数据集上,FFD 特征对基于 BERT 的模型提升最为显著(最高达 +2.83%)。
- 在较大的 Abstract-5190 数据集上,FN 特征结合 RoBERTa 达到了最高性能(44.51% F1@5)。
- 特征组合: 注视次数与总注视时长 (FN+TFD) 的组合在 Att-BiLSTM+CRF 模型上取得了最佳性能。通常,FFD+FN 和 FN+TFD 的组合比使用单一特征或完整三元组 (FFD+FN+TFD) 提供了更稳定的提升。
- 统计显著性: 对 Abstract-320 数据集的配对 t 检验确认,眼动特征在多种架构中均具有统计学意义上的显著效应。具体而言,FN+TFD 和 FFD+TFD 显示出一致的显著性,表明注视频率和持续时间捕捉到了阅读行为中互补的方面。
- 数据集规模效应: 研究观察到,当数据有限时,早期处理特征(如 FFD)能提供更大的信息增益;而当数据集较大时,累积处理特征(如 TFD)能更好地支持深度语义建模。
意义与主张
本文主张,将人类阅读行为纳入计算模型可以弥合统计启发式方法与认知过程之间的鸿沟。通过证明基于网络摄像头的轻量化眼动追踪可以有效地增强 KPE,作者提倡一种更易获取、更具成本效益的方法来收集自然语言处理(NLP)中的认知数据。研究结果表明,眼动特征作为有价值的辅助信号,能够反映语义处理的深度和词项的重要性,从而提高关键词提取系统的可解释性和性能。这项工作旨在将研究定位为构建更符合实际读者注意力模式的、以人为中心的信息检索工具的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。