← 最新论文
💬 NLP

Re3: A Holistic Framework and Dataset for Modeling Collaborative Document Revision

本文介绍了 Re3,这是一个整体性框架以及随附的 Re3-Sci 数据集,该数据集包含标注过的科学论文修订、评审和编辑摘要,旨在实现对协作式文档修订的建模,并评估大语言模型在自动化编辑分析和促进基于文本的协作方面的能力。

原作者: Qian Ruan, Ilia Kuznetsov, Iryna Gurevych

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Qian Ruan, Ilia Kuznetsov, Iryna Gurevych

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一群朋友如何共同创作一篇故事。一个人起草了一个段落,另一个人读完后说:“这一部分很令人困惑,而且那个事实是错误的。”第一个人随后重写了该段落,而第三个人写下了一份笔记,解释了他们为什么要做出这些修改。

这篇题为 Re3 的论文,旨在构建一张地图,来精确理解这种混乱、反复进行的协作过程是如何运作的。作者们意识到,虽然计算机在阅读文本方面已经做得很好,但在理解修改背后的“对话”方面却表现得很糟糕。他们想要创建一个系统,将以下三者联系起来:

  1. 评审(The Review): 反馈意见(例如:“修正这个语法”)。
  2. 修订(The Revision): 对文本进行的实际修改。
  3. 回应(The Response): 作者对所做改动的解释。

问题所在:缺失全局观

在此之前,研究人员是分别研究这些部分的。他们研究句子如何变化,或者研究评审是如何撰写的,但他们没有一种方法能同时看到全貌。这就像是试图通过单独观看预告片、剧本和导演笔记来理解一部电影,却从未看过电影本身。

作者认为,要真正理解人类如何进行协作,你需要看到整篇文档,以及每一个改动是如何融入宏大叙事的。

解决方案:Re3 与 “Re3-Sci” 数据集

为了解决这个问题,团队创建了 Re3——一个用于分析这些文档的新框架(一套规则和类别)。随后,他们构建了一个名为 Re3-Sci 的大规模数据集来对其进行测试。

可以将 Re3-Sci 想象成一个巨大的、有组织的图书馆,里面收藏了 314 篇经过同行评审过程的科学论文。对于每一篇论文,他们都拥有:

  • 原始草稿。
  • 最终版本。
  • 评审员的评论。
  • 作者的回应。

但他们不仅仅是收集文件;他们扮演了“超级侦探”的角色。他们手动标注了这些论文中的 11,600 处特定改动(编辑)。对于每一次改动,他们都会询问:

  • 他们做了什么?(是增加了一个句子?删除了一个段落?还是合并了两个观点?)
  • 他们为什么这么做?(是为了修正拼写错误?为了添加新事实?还是为了改变某个科学主张?)
  • 它发生在何处?(是一个微小的词汇改动,还是整个章节的重写?)

他们的发现(“人性化”的洞察)

通过观察所有这些数据,作者发现了关于人类如何编辑的一些有趣模式:

  • “书签效应”(The "Bookends" Effect): 人们倾向于在论文的最开始(引言)和最末尾(结论)进行最多的编辑。中间部分通常比较稳定。
  • 事实 vs. 流畅度: 在过程早期,人们主要修复语法和清晰度(让句子表达更流畅)。到了后期,他们则更多地关注于改变事实和科学主张。
  • 评审员具有针对性: 当评审员给出具体、明确的指令(例如:“在此处添加引用”)时,作者通常会遵循。但如果评审员只是说“这一部分很薄弱”,作者不太可能做出具体的改动。
  • 并非所有内容都会改变: 即使是在那些经过“大幅修订”的论文中,大部分文本仍然保持不变。只有约 18% 的句子被实际修改了,甚至更少的句子是出于深层的科学原因而被修改的。

计算机能做到这一点吗?(AI 实验)

作者还提出了疑问:“现代人工智能(大语言模型)能否理解这个过程?”

他们在四项任务上测试了 AI:

  1. 猜测意图: AI 能否观察一个改动并猜出它是为了语法还是为了新事实?
    • 结果: AI 的正确率约为 70%。它表现得不错,但仍然难以区分“事实”类改动和“主张”类改动。
  2. 总结改动: AI 能否阅读所有的改动,并为作者写一份简短的总结以便发回给评审员?
    • 结果: AI 可以写出总结,但有时会遗漏细节或在事实方面出现轻微偏差。它倾向于按“做了什么”(例如,“我们删除了 5 处内容”)来分组,而不是按“发生在何处”(例如,“在引言部分,我们修改了……”)来分组。
  3. 匹配评审与改动: AI 能否将评审员的评论与作者修改的具体句子联系起来?
    • 结果: AI 在这方面做得非常好,几乎达到了完美。
  4. 寻找评审请求: AI 能否识别出评审中的哪些句子实际上是对作者的指令?
    • 结果: AI 在识别这些指令方面表现得非常出色。

核心结论

这篇论文并不声称 AI 已经准备好取代人类编辑,也不声称 AI 现在就能为我们撰写科学论文。相反,它提供了第一张完整的地图,展示了协作式写作究竟是如何发生的。

他们构建了工具、数据和规则,以帮助计算机学习协作的“语言”。这就像是为计算机提供了一本关于写作、评审和修订这一复杂舞蹈的字典和语法书,以便在未来,AI 能够真正帮助人类更好地协作,而不仅仅是猜测他们在做什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →