← 最新论文
💻 computer science

Multi model deliberation improves the stability of automated scoring by large language models across genres and assessment contexts

本研究表明,一种由三个异构中文大语言模型迭代交换评分与理由的多模型审议框架,显著提高了自动化作文评分在不同体裁和评估场景下的稳定性和精准度,且由此产生的任何系统性偏差均可通过标准的以人为锚点的校准进行有效修正。

原作者: Xiaoying ZHENG, Benhui CHEN, Yuqing CHEN, Yun YANG

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoying ZHENG, Benhui CHEN, Yuqing CHEN, Yun YANG

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:面向自动化评分稳定性的多模型审议机制

问题陈述
尽管大语言模型(LLMs)在自动化作文评分方面展现出潜力,但其在教育评估中的实际应用仍受限于评分的不稳定性以及缺乏跨语境验证。现有研究侧重于预测准确性(与人类评分者的一致性),却往往忽视了可靠性——即模型在重复评估同一响应时的连贯性。作为概率生成模型,LLMs 会引入类似于人类评分者疲劳导致的随机变异性,这威胁到了教育公平与效度。经典测量理论认为,可靠性是效度的前提;一个对同一响应给出不同分数的工具无法支持有效的推论。此外,传统的集成方法(如简单平均法)无法促进“认知校准”,因为它们只是聚合孤立的判断,而没有实现信息交换或协同推理。

研究方法
本研究提出了一种基于集体智能理论的多模型审议框架。该框架将自动化评分重新构想为一个涉及三种异构开源中文大语言模型的审议过程:Baichuan2-13BQwen2.5-14BChatGLM4-9B。该过程分为三个连续轮次进行:

  1. 独立评分(R1): 模型在隔离状态下对响应进行评分,生成初始分数和理由。
  2. 信息交换(R2): 模型被呈现另外两个模型的评分和理由。它们被提示重新评估该响应,并可以选择根据新证据调整分数或维持原有的判断。
  3. 最终确认(R3): 模型接收来自 R2 的完整调整结果和理由,并提交最终确定的分数。

该框架在两个互补的数据集上进行了评估,以测试其泛化能力和稳定性:

  • ASAP-AES 语料库: 一个包含约 13,000 篇 K-12 学生作文的公开基准,涵盖八个写作提示词。在本研究中,从每个提示词中刻意抽取了五篇作文(覆盖高、中、低分段),构建了一个包含 40 篇作文的测试集,每篇作文进行 30 次试验(共计 7,350 个特征级观测值)。
  • 新闻学语料库: 来自一门中国大学新闻学课程的真实响应(10 篇作文,每篇 100 次试验,共 9,000 条评分记录),由专家人类评分者进行评分。

研究将提出的审议集成方法与单模型基准、简单均值/中位数集成以及审议后单模型评分进行了对比。评估指标包括用于收敛性的跨模型平均绝对误差(MAE)、用于稳定性的变异系数(CV)以及与人类评分的秩相关性。

核心结果

  • 显著降低分歧: 在 ASAP-AES 语料库上,所有提示词下的模型间分歧(MAE)从 R1 到 R3 均显著下降(经 Holm 校正后 p < 0.001)。合并效应量较大(Cohen's dz = 1.08),秩双序列相关系数为 0.92,表明无论文体或评分量表如何,审议过程都能一致地驱动收敛。
  • 增强稳定性: 在新闻学语料库上,审议集成的变异系数(CV)从 7.29%(基准)降至 2.78%,实现了 61.9% 的相对提升(t(9) = 7.98, p < 0.001)。这一提升显著优于简单的集成策略(降低了 40.8% 的 CV)和审议后单模型评分(提升了 34.2%),证明了审议与聚合之间的协同效应。
  • 轮次分解: 收敛效应被划分为两个阶段。信息交换轮(R1 到 R2)贡献了约三分之二(66–69%)的总收敛量,而最终确认轮(R2 到 R3)贡献了剩余的三分之一(31–34%)。研究发现这两个阶段在统计学上都是显著且非冗余的。
  • 模型异构性与行为: 三个模型在不同数据集上表现出截然不同且一致的角色。Baichuan2 扮演了保守的“锚点”角色,分数变化极小;Qwen 作为“积极调整者”,频繁上调分数;而 ChatGLM 则充当“稳健的裁判”,在调整与抵制群体思维之间取得平衡。这种异构性防止了过早收敛。
  • 与人类评分的一致性: 虽然审议提高了精确度(稳定性),但也导致了相对于人类评分者的系统性分值上升(例如,在 100 分制的新闻学量表中上升了 13.46 分)。然而,与人类评分的秩相关性基本得以保留(新闻学语料库的 Spearman ρ = 0.75)。研究表明,这种系统性偏差可以通过针对人类锚点的标准线性校准进行修正,从而使平均绝对误差降低 50.3%。

核心贡献

  1. 重构评分可靠性: 本研究将关注点从纯粹的预测准确性转向测量可靠性,提出了一个通过主动认知校准而非数值误差抵消来实现稳定性的审议框架。
  2. 实证验证: 研究提供了关于该框架有效性的有力证据,涵盖了多种语言(中文/英文)、文体(议论文/叙事文)及评分量表,验证了多模型审议的泛化性。
  3. 机制特征化: 研究刻画了异构模型的特定收敛模式和调整行为,揭示了信息交换驱动了大部分收敛,而最终确认轮则提供了必要的稳定性。

意义与主张
本文主张,多模型审议显著增强了自动化评分的稳定性,使得 LLMs 在对一致性要求极高的教育评估场景中更具可行性。作者认为,虽然审议提高了分数的精确度(可靠性),但并不自动保证效度(与人类标准的绝对一致性)。因此,该框架被定位为一个增强精度的层,必须与基于人类锚点的校准相结合,才能应用于高利害评估。研究结论指出,只要人类专业判断在评估过程中保持核心地位,并对系统性偏差进行管理,该系统即可支持形成性评估并减轻评分工作量。研究结果表明,通过审议结构化的异构模型“集体智慧”,可以实现比简单聚合或单模型方法更可靠的自动化评分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →