Expert Preference-based Evaluation of Automated Related Work Generation
本文介绍了 GREP,这是一个通过整合细粒度标准和对比示例,通过与专家偏好对齐并超越标准基于大语言模型的评判器,来稳健评估自动化相关工作生成的多轮评估框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心图景:“专家编辑”难题
想象一下你是一名正在撰写论文的科学家。在解释你的新发现之前,你必须写一段**“相关工作”(Related Work)**。这就像是编写一份“邻里历史”:你需要解释别人在附近建造了什么,你的新房子有何不同,以及为什么你的设计很特别。
这项任务非常困难。它需要深厚的领域知识和一种只有经验丰富的专家才知道的特定风格。
最近,人工智能(大语言模型或 LLM)已经开始尝试为我们撰写这些章节。但问题在于:我们如何知道 AI 是否做得好?
- 旧方法: 我们使用简单的数学方法来检查 AI 是否使用了正确的词汇。这就像仅通过计算一幅画中有多少个红色像素来给画作评分。它忽略了艺术性。
- 新方法(本论文之前的做法): 我们让 AI 对自己(或对其他 AI)进行评分。但本文认为,AI 评委就像是新手艺术评论家:它们可能会有偏见,不理解该领域的深层规则,并且经常忽略那些能让一个章节真正出色的微妙“专家偏好”。
解决方案:GREP(“聪明评论家”)
作者创建了一个名为 GREP(基于偏好的细粒度相关工作评估)的新系统。不要把 GREP 看作一个单一的评委,而要把它看作一个由专业检查员组成的团队,共同为 AI 的作品打分。
GREP 不仅仅是给出一个像“8/10”这样的单一分数,而是将评估分解为微小的、具体的检查项。它模拟了人类专家评审草稿的过程。
GREP 如何运作(检查流程)
假设 AI 写了一份“相关工作”章节的草稿。GREP 会将这份草稿送入一系列检查点:
“事实检查员”(硬约束):
- 你撒谎了吗? 系统会检查 AI 是否编造了引用(幻觉),或者是否遗漏了应该引用的论文。
- 你理解来源了吗? 它会检查 AI 对论文的描述是否与该论文的实际内容相符。如果 AI 说“论文 X 证明了重力是假的”,但论文 X 实际上证明了重力是真的,GREP 会立即捕捉到这一点。
“风格教练”(软约束):
- 你遵守规则了吗? 专家是有偏好的。也许他们希望章节正好是 500 字,或者他们希望比其他论文更强调某篇特定的论文。
- 你展现了自己的声音吗? 一个好的“相关工作”章节不应只是罗列他人的工作;它需要说明“我的工作有何不同”。GREP 会检查 AI 是否成功地突出了作者独特的贡献。
“反馈循环”(迭代):
- 这是最具创意性的部分。GREP 不仅仅是给出评分就结束了。它扮演的是写作教练的角色。
- 它会生成一份报告:“你漏掉了引用第 4 号论文。你花太多时间讨论第 2 号论文了。你的章节太长了。”
- 它将此报告反馈给 AI。随后,AI 重新撰写该章节。
- 他们重复这个过程(就像进行一轮修订)以观察 AI 是否能够真正从反馈中学习并变得更好。
“先知”(黄金标准)
为了确保 GREP 的公平性,研究人员使用了一个“先知”(Oracle)。想象一位拥有完美食谱(即“黄金标准”相关工作章节)的大厨。先知完全知道理想的版本是什么样子的。GREP 利用这个完美版本来定义什么是“好”的软约束(如长度和侧重点),从而确保 AI 是根据高标准进行评判,而不仅仅是随机猜测。
研究发现(结果)
研究人员将该系统与 16 名人类专家(博士生和研究人员)以及几种顶尖 AI 模型进行了对比测试。
- AI 评委 vs. 人类专家: 标准的 AI 评委经常出错。它们与人类专家的意见一致率仅为 53% 左右。
- GREP vs. 人类专家: GREP 与人类的判断更为接近,其高精度版本的一致率达到了 78%。它成功理解了专家所关注的核心点。
- AI 的困境: 即便是最聪明的 AI 模型(如 o3-mini 和 GPT-4o)在独立撰写完美的“相关工作”章节方面也表现挣扎。
- 它们经常无法引用所有要求使用的论文。
- 它们经常无法区分一篇论文是支持其观点还是反对其观点。
- 反馈问题: 当专家(或 GREP)给出反馈以修复这些错误时,AI 模型往往无法改进。它们可能会修复一个错误,却意外破坏了另一个,或者干脆忽略了“缩短篇幅”的指令。
总结
本论文介绍了一种更聪明的方法,用于评估科学领域的 AI 写作。它表明:
- 当前的 AI 评委对于复杂的专家级任务来说还不够好。
- 我们需要一个将任务分解为细小、具体检查项(类似于清单)并利用示例来教导评委观察重点的系统。
- 即便是现有的最强 AI 模型,也尚未准备好完全取代人类专家来撰写科学文献,尤其是在处理复杂且变化的指令时。
简而言之:GREP 是 AI 作家的一个更好的“老师”,它揭示了 AI 在能够独立写出完美的科学论文之前,仍有很多功课要做。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。