← 最新论文
💻 computer science

Research on Readability Rating Methods for English Texts Based on Artificial Intelligence

本研究提出了一种基于人工智能的框架,该框架将 RoBERTa 衍生的语义嵌入与手工设计的语言特征相结合,在英语文本可读性评估方面显著优于传统方法,并在 CLEAR 数据集上实现了极高的准确率(R² = 0.9908)。

原作者: Zhongwei Mei

发布于 2026-08-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhongwei Mei

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:基于人工智能的英文文本可读性评分研究

1. 问题陈述

本文旨在解决当前自动化可读性评估系统的局限性,这些系统难以在语义丰富度、可解释性和计算效率之间取得平衡。传统的基于公式的方法(如 Flesch-Kincaid、Gunning Fog)依赖于句子长度和音节计数等浅层语言特征,无法捕捉语义含义、话语连贯性和复杂的句子结构。相反,虽然深度学习和基于 Transformer 的模型(如 BERT、RoBERTa)擅长上下文理解,但它们通常需要大量的计算资源,缺乏可解释性,并且可能会忽略对可读性评估至关重要的显式语言线索。现有的混合方法往往无法在统一的回归框架内,有效地将深度语义嵌入与具有可解释性的手工语言特征相结合。

2. 研究方法

本研究提出了一种 Hybrid RoBERTa–XGBoost 框架,旨在预测英文文本的连续可读性得分。该方法遵循一个结构化的流水线:

  • 数据集: 研究使用了 CLEAR Corpus(CommonLit Ease of Readability),这是一个包含 4,724 个已标注英文文本样本(涵盖 Grade 3 到 Grade 12 等级)的基准数据集。数据被分为 80/20 的训练集(3,779 个样本)和测试集(945 个样本)。
  • 预处理: 原始文本经过了归一化(转为小写)、去除非语言特殊字符、句子切分以及使用 RoBERTa 分词器进行分词。
  • 特征提取(双流):
    1. 语义特征: 利用 RoBERTa-Base 模型生成 768 维的语义嵌入。该模型的配置为学习率 1.00E-05,最大序列长度 512,批大小 16,并训练了 10 个 epoch;然而,论文明确指出,该模型是在**冻结状态下使用(未进行额外微调)**以提取上下文隐藏表示。通过提取 [CLS] 标记的表示来捕捉每个段落的全局上下文含义。
    2. 语言特征: 工程化构建了 39 个手工特征,用于捕捉结构属性,包括平均词长、句子长度、词汇密度、标点符号比例、连词比例以及句法复杂度。
  • 特征融合: 两组特征均使用标准缩放(Standard Scaling)进行归一化,以确保分布一致。将 768 维的语义向量与 39 维的语言向量进行拼接,形成一个统一的 807 维特征向量。
  • 模型训练: 融合后的特征被输入到 XGBoost 回归器中。模型通过 网格搜索交叉验证(5 折)进行优化,以调整超参数,如学习率、树深度和估计器数量。目标函数在最小化平方误差的同时应用正则化(L1 和 L2)以防止过拟合。

3. 核心贡献

论文概述了四项主要贡献:

  1. 框架开发: 创建了一个智能的、基于混合 AI 的回归框架,用于预测 CLEAR Corpus 中英文文本的连续可读性得分。
  2. 工作流阐述: 对端到端的工作流进行了全面记录,包括数据集收集、预处理(处理缺失值、文本清洗、分词)以及 RoBERTa 语义嵌入与工程化语言特征的具体提取过程。
  3. 特征融合策略: 实现了一种特定的融合技术,通过缩放和拼接将基于 RoBERTa 的语义表示与设计的语言特征相结合,随后利用带有网格搜索交叉验证的 XGBoost 回归进行超参数调优。
  4. 性能评估: 通过标准回归指标(RMSE、MAE、R²)对所提出的解决方案与基准模型(线性回归、支持向量回归、随机森林)及消融实验进行了严格评估。

4. 实验结果

所提出的模型表现优于所有基准模型和消融变体:

  • 主要指标: 全量混合模型实现了 RMSE 为 0.0980MAE 为 0.0794R² 得分为 0.9908
  • 对比性能:
    • 对比基准模型: 所提模型优于线性回归(R²: 0.944)、支持向量回归(R²: 0.762)和随机森林(R²: 0.965)。
    • 对比消融实验: 与仅使用语义特征的模型(RoBERTa + 预计算:R² 0.882)、仅使用语言特征的模型(R² 0.685)以及消融实验中列出的仅微调 RoBERTa 的模型(R² 0.722)相比,全量混合模型表现显著提升(见表 3)。
  • 误差分析: 残差分析表明误差在零附近呈正态分布且偏差极小,证实了模型的可靠性。
  • 特征重要性: 分析显示,句法特征——特别是连词比例(0.1802)和介词比例(0.0946)——是影响力最大的预测因子之一,验证了将结构性线索与语义嵌入相结合的重要性。

5. 意义与主张

论文声称,将深度语义嵌入与可解释的语言特征相结合,能显著提高预测精度和泛化能力。研究断言,这种混合方法成功弥合了 Transformer 模型的上下文理解能力与传统语言分析的结构可解释性之间的鸿沟。

作者将该框架定位为以下领域的可扩展解决方案:

  • 教育内容适配: 为特定学生水平定制学习材料。
  • 稿件评估: 辅助评估出版物的文本复杂度。
  • 自然语言处理应用: 为自动化文本分级和内容推荐提供稳健的方法。

论文总结认为,所提出的方法为自动化语言分析提供了科学依据,在实现高精度(捕捉 >99% 的方差)的同时,通过优化的集成学习保持了计算可靠性。未来的工作建议探索跨语言鲁棒性、集成 SHAP 等可解释 AI (XAI) 模块,以及使用轻量化模型(如 DistilRoBERTa)来提升流水线效率。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →