Evidence-Ledger Adjudication for Claim-Evidence Traceability
本文介绍了证据账本裁决(evidence-ledger adjudication),这是一种将 AI 生成的断言与证据包相结合,以验证支持度并将问题断言路由至人工审查的工作流,通过一项盲测基准测试证明,这种基于智能体的方案在断言-证据可追溯性准确度方面显著优于非智能体基线模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在写一个故事,但你不是亲自敲下每一个字,而是有一个超级快速的机器人助手,能在眨眼之间为你起草段落。这个机器人非常擅长听起来聪明且流利,但它有一个棘手的习惯:有时它会编造事实,或者抓取一段实际上与你想表达的意思相反的信息。在AI写作的世界里,这就是那个大问题。机器人生成文本的速度比人类检查事实是否真实的速度还要快。这篇论文存在于计算机科学中一个被称为“AI辅助写作”的领域,研究人员正试图构建这样的工具——它们不仅仅是为我们写作,还能在我们点击“发布”之前,帮助我们核查机器人写下的内容。这里的核心理念是“可追溯性”——确保机器人提出的每一个主张都能追溯到特定的证据,就像侦探追踪面包屑路径一样,以观察故事是否站得住脚。
这篇论文的作者 Gengyu Chen、Yongjie Yu 和 Weiling Wang 决定为这些 AI 草稿建立一个“交通警察”。他们将他们的系统称为“证据账本裁决”(Evidence-Ledger Adjudication)。把它想象成一个高科技编辑桌,在这里,AI 写的每一句话都配有一个“证据包”(就像一叠来源文档)。系统的任务是阅读句子和证据包,然后做出决定:“这份证据支持这句话吗?它是否矛盾?证据是否缺失?还是两者混杂在一起?如果证据不靠谱,系统不会就此放过这个句子;它会标记该句子,并将其发回给人类作者,附带一条笔记说:“嘿,你需要修正这一点或寻找更好的证明。”
为了测试这个想法是否真的有效,团队不仅仅是在虚构的例子上进行测试。他们利用来自三个不同来源的 2,335 个真实世界的主张构建了一个大规模的盲测,这些来源包括事实核查数据库、气候科学报告和科学论文。在 AI 进行猜测时,他们隐藏了“正确答案”,以确保测试是公平的。结果非常令人兴奋。使用这种“证据账本”方法的 AI 系统在处理主张与证据之间的关系时,有 67.6% 的时间是正确的(准确率为 0.676)。相比之下,他们测试过的最好的“非 AI”计算机方法仅在 38.3% 的情况下是正确的。
然而,最重要的部分是该系统何时知道该寻求帮助。在 1,435 个实际上缺乏支持、被矛盾或混杂的主张中,AI 系统正确地标记了其中的 1,270 个,并将它们发回给人类作者进行修改。这是一个巨大的进步,而其他方法则漏掉了许多这类问题点。它还成功地让 900 个“良好”主张中的 605 个保持原样,因此人类作者不会被虚假警报所淹没。
简而言之,这篇论文表明,通过给 AI 一种结构化的方式,让它对照一堆证据来检查自己的作业,我们可以将混乱的 AI 生成文本流转化为一份干净、可审计的草稿。它并没有解决所有问题——系统有时仍会感到困惑,尤其是在处理棘手的“混合证据”案例时——但它证明了这种“交通警察”方法比仅仅让机器人横冲直撞或使用简单的、旧式的文本匹配技巧要好得多。它将写作过程变成了一种伙伴关系:AI 承担起起草的大量工作,而证据账本则确保事实的稳固,在人类拿起最终画笔之前完成任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。