OARelatedWork: A Large-Scale Dataset of Related Work Sections with Full-texts from Open Access Sources
本文介绍了 OARelatedWork,这是第一个能够从开放获取资源中生成全文相关工作的大规模数据集,它揭示了尽管现代大语言模型在处理大规模上下文方面的能力较之摘要有所不足,但它们在基于证据的事实性方面可以超越人类基准,从而使得有必要采用新的陈述级评估框架来取代不足的基于参考的指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心思想:撰写“他人的篇章”
想象你正在写一部小说。在讲述你自己的故事之前,你必须先写一个名为“相关工作”(Related Work)的章节。在这个章节中,你必须总结前人所写的作品,解释他们的故事与你的故事有何相似之处,并展示你的故事有何不同。
长期以来,试图完成这项任务的计算机就像是只能阅读书籍封底简介(摘要)的学生。它们必须根据一个微小的总结来推测整个故事。这篇论文介绍了一个名为 OARelatedWork 的新数据集,它改变了游戏规则:现在,计算机在尝试撰写自己的章节之前,可以阅读整个图书馆(每本书的正文全文)。
问题所在:“简介” vs. “书籍”
此前,研究人员构建的数据集仅让计算机看到被引用论文的简短摘要。
- 旧方式: 就像仅根据封底简介来写书评。你可能会抓住大意,但你会错过细节、细微差别和具体的证据。
- 新方式 (OARelatedWork): 这个数据集让计算机阅读了 94,000 篇论文的全文,以及它们所引用的数百万本书籍的全文。它迫使 AI 去读整本书,而不仅仅是看简介。
研究发现:“聪明人” vs. “人类”
研究人员使用这个新数据集测试了各种 AI 模型,并将其与人类作者进行了对比。他们发现了一些令人惊讶的事情:
- 信息过多可能是一个陷阱: 当 AI 被给予书籍全文而非仅仅是简介时,它在标注引用位置方面反而犯了更多错误。这就像是给一个学生一本 1,000 页的教科书,然后让他们找到一个特定的事实;他们会被信息淹没,有时甚至会指向错误的页面。
- 人类会“脑补”(抽象化): 人类作者非常有创意。他们经常读完一本书,合上书,然后写下一句听起来像是出自那本书的话,即使书中并没有完全相同的原话。他们会将书中的不同部分进行融合,从而创造出一个流畅的故事。
- AI 是“严谨的图书管理员”: 因为 AI 的训练目标是变得非常谨慎,只说那些它能用直接引文证明的事情,所以结果显示,如果严格评判,它比人类更具事实准确性。
- 类比: 想象人类作家是一位爵士乐手,他即兴创作出一段优美的旋律,虽然感觉很对,但可能并不完全遵循乐谱。而 AI 则是一位严厉的指挥家,他会逐个音符地对照乐谱进行检查。在这种“是否遵守规则”的游戏中,AI 赢了。
计分板:我们如何评分?
论文认为,旧的评分方式(计算 AI 作品与人类作品之间有多少单词重叠)是失效的。
- 旧分数: 就像通过计算学生作文中使用了多少老师范文中出现的单词来评分。如果学生用了不同的词来表达同样的意思,他们就会得到低分。
- 新分数: 作者创建了一个“语句级评判者”。他们不再看整篇文章,而是将其拆解为逐句进行分析,并询问:“这个事实是真的吗?这个引用正确吗?”
- 他们发现标准的评分工具在处理这类问题时表现得很糟糕。你需要一个聪明的 AI 评判者(就像一位资深教授)来核实事实,而不仅仅是一个拼写检查器。
结论
这篇论文在说:“别再只给 AI 看书籍封底的简介了。把整个图书馆交给它。”
- 数据集: 这是一个包含全文的开放获取论文的海量集合。
- 教训: 当 AI 必须阅读整本书时,它在将信息进行平滑综合方面不如人类那样出色,但它在恪守事实方面变得极其优秀。
- 未来: 为了构建更好的研究工具,我们需要停止在短小的摘要上测试 AI,而是开始在阅读整篇学术论文这种完整、混乱且复杂的现实场景中测试它们。
简而言之: 这篇论文为 AI 构建了一个练习撰写文献综述的巨大图书馆。它发现,虽然 AI 在事实核查方面比人类更遵守规则,但人类仍然更擅长将这些事实编织成一个流畅、自然的故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。