← 最新论文
💬 NLP

AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification

本文介绍了 AutoSupervision,这是一个利用 56,000 条《自然-通讯》(Nature Communications)审稿记录来评估稿件修订是否通过基于证据的手段真正解决了审稿人疑虑的框架,研究揭示了虽然大语言模型可以有效地刻画这些疑虑,但基于证据的验证仍然是一个显著的瓶颈。

原作者: Haobo Li, Eunseo Jung, Wenxiao Zhao, Feng Liu, Jiong Wang, Kaiyi Xu, Zijie Guo, Zixin Chen, Ben Fei, Fenghua Ling, Lei Bai

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Haobo Li, Eunseo Jung, Wenxiao Zhao, Feng Liu, Jiong Wang, Kaiyi Xu, Zijie Guo, Zixin Chen, Ben Fei, Fenghua Ling, Lei Bai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

把科学想象成一场由地球上最聪明的人进行的、永无止境的巨型“传声筒”游戏,但有一个转折:他们不是在耳语,而是在记录想法;他们也不仅仅是传递信息,而是必须在有人指出错误时,证明自己确实修改了信息。这就是同行评审的世界——一个严苛的检查站,科学家在这里提交他们的发现,而其他专家则充当严格的编辑,指出逻辑漏洞、缺失的实验或含糊不清的解释。长期以来,我们已经拥有了相当擅长生成这些科学故事、甚至能像严厉编辑一样对其进行批判的计算机。但拼图中一直缺少一块:计算机能否通过查看最终稿,将其与编辑最初的投诉进行对比,并说出:“是的,作者确实解决了问题,而且这是他们做出修改的具体句子”?这就是“反馈循环”中棘手的部分——验证所做的更改是否真实、有意义且有据可查,而不仅仅是空洞的承诺。

AutoSupervision 应运而生,这是研究人员开发的一种旨在测试这种能力的全新工具。把它想象成一个超级智能的“事实核查员”,专门针对科学论文。该团队利用来自《自然·通讯》(Nature Communications)的 56,000 篇真实文章及其评审记录,创建了一个庞大的训练场。他们设定了一个挑战:AI 必须阅读审稿人的投诉、作者的回应以及修订后的论文版本,然后判定:作者是否真的解决了问题?如果是,文本中的证据在哪里?结果喜忧参半。AI 模型在理解审稿人担心什么方面表现出色——几乎像是一个能够完美总结老师笔记的优秀学生。然而,当涉及到验证修改是否真正完成以及在文本中寻找具体证据这项艰巨工作时,AI 却踉跄了。表现最好的模型在这一验证任务上的得分仅为 0.501,而它仅仅是理解问题的能力要高得多,达到了 0.754。本质上,计算机很擅长倾听问题,但在证明解决方案是否真实存在方面仍然感到吃力。

研究人员发现,虽然现代 AI 几乎可以完美地识别出关注点(“覆盖率”得分接近 1.000),但它往往无法在作者的声明(“我们修复了它!”)与修订稿中的实际文本之间建立联系。这就像一个学生自信地告诉老师:“我做完作业了,”但当被要求展示过程时,他却指不出正确的页码。这项研究表明,虽然 AI 已经准备好协助生成反馈,但它尚未准备好成为判断这些反馈是否真正得到落实的最终裁判。团队还发现,给 AI 提供一些帮助——例如将任务分解为较小的步骤,或针对此类问题进行专门训练——确实可以提高其性能,但“落地”(即寻找确切证据)的问题仍然是最大的障碍。简而言之,我们拥有了能够“察言观色”的 AI,但我们仍需教会它如何“核对收据”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →