Grounded verification of chemical and materials reasoning: detection is the bottleneck
本文表明,对于进行化学与材料领域推理的大型语言模型而言,一种优先考虑检测特定事实错误而非盲目检索的分层数据库落地验证系统,通过实现针对性修复显著降低了幻觉率,从而确定错误检测而非错误纠正才是提高模型准确性的主要瓶颈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
近乎成功的魔术表演
想象一下,你正在和一个非常聪明、非常自信的机器人朋友聊天。你问它一个问题,它用一段听起来完美无瑕、流畅自然的叙述来回答你。但有时,这段叙述中包含了一个谎言。在科学领域,特别是化学和材料科学领域,这是一件大事。如果机器人说某个化学式是“C6H12O6”,而实际上应该是“C6H12O5”,科学家可能会制造出一台无法工作的机器,或者一种不安全的药物。这不仅仅是一个拼写错误,这是一种“幻觉(hallucination)”——机器人编造了听起来很真实但完全虚假的事实。
长期以来,人们试图通过让机器人检查自己的工作来解决这个问题。这就像要求一名学生为自己的考试评分;他们往往会错过自己的错误,因为他们太自信了。另一些人尝试给机器人一间图书馆(数据库)供其在回答前查阅。但为每一个问题都查阅每一本书既慢又贵,而且机器人有时仍会感到困惑。研究人员想要回答的核心问题是:我们如何在不减慢速度的情况下捕捉到这些谎言?一旦发现,我们真的能修复它们吗?
只检查嫌疑人的侦探
这篇来自 Kurban Intelligence Lab 的论文介绍了一种与这些智能机器人玩“侦探游戏”的新方法。他们没有让机器人阅读整座图书馆或检查自己的作业,而是构建了一个“分层验证器(tiered verifier)”。把这个验证器想象成一个反应极快、极其严格的图书管理员,它只检查特定的事实。
以下是这个魔术表演是如何运作的:
- 设置: 机器人尝试回答一个关于某种化学物质的问题(例如“氨苄西林的分子式是什么?”)。
- 障碍: 机器人写出了一个流畅的答案,但它可能编造了一个数字或公式。
- 检查: 验证器不会阅读整个故事。它寻找特定的“可核查声明”(例如分子式或能量数值)。它提取出那个特定的声明,并将其与受信任的数据库(例如数字化的化学百科全书)进行比对。
- 闸门: 如果该声明与数据库匹配,验证器会说:“一切正常!”并允许答案通过。如果该声明错误,验证器会拉响红旗。
- 修复: 当红旗被拉起时,验证器不仅仅是说“你错了”。它会向机器人低声耳语正确的事实,并说:“再试一次,但请使用这个事实。”然后机器人会重新编写答案中的那一部分。
大惊喜:抓到谎言比修复它更难
这篇论文中最令人兴奋的发现是一个情节转折。研究人员原以为机器人可能不擅长修复自己的错误。他们想:“也许机器人看到了正确的事实,但仍然不知道如何把它写下来。”
但事实并非如此。论文发现,修复其实很容易。当验证器捕捉到错误并向机器人提供正确事实时,机器人80% 到 97% 的情况下都能成功修复!无论是分子式还是晶体结构,机器人都很乐意接受修正。
真正的瓶颈,即阻碍系统达到完美的因素,是检测(detection)。验证器必须首先发现错误。
- 对于常见的化学物质,验证器几乎捕捉到了所有的错误。
- 对于罕见的、奇特的化学物质(科学领域的“长尾”部分),验证器漏掉了很多错误。
- 在一个案例中(生成能),尽管验证器如果能发现错误就能修复其中的 80%,但它实际上只捕捉到了 19% 的错误。
这就像有一个保安,一旦看到小偷,他就能出色地阻止对方;但问题在于,这个保安在人群中识别出小偷的能力很差。论文得出结论:最大的挑战不是教机器人诚实,而是教系统如何识破谎言。
有效与无效之处
研究人员在四种不同的“智能机器人”(大语言模型)上测试了这个系统,并发现了一些有趣的模式:
- “稀有”问题: 机器人在处理它们从未见过的罕见、晦涩的化学物质时犯错最多。这正是最需要验证器的地方,也是验证器最难发现错误的地方。
- “常见”天花板: 对于非常著名、广为人知的知识(如基础物理常数),机器人的表现已经足够好,以至于验证器几乎不需要做任何事。事实上,对于这些简单的知识,验证器有时会误将正确的答案标记为错误,导致机器人“破坏”了一个原本正确的答案。这表明,你必须小心不要去修复那些本就完好的东西。
- 优于“直接询问”: 团队将他们的系统与“对话式先知(conversational oracle)”(即只会查找答案并告诉你答案的机器人)进行了对比。他们的“闸门式”系统表现得更好。为什么?因为对话式机器人通常只是在谈论答案,而没有实际写下科学家需要的特定数字。验证器强制机器人写下确切的事实,从而使其更易于检查。
- 成本考量: 检查每个问题的每一个单词既昂贵又缓慢。他们的系统只检查看起来可疑的部分。这意味着他们使用的数据库查询次数比检查所有内容的方法减少了 3.2 倍,在节省时间和金钱的同时,依然捕捉到了大部分错误。
“范围”的教训
他们还发现了另一个聪明的技巧。有时,验证器会检查成分(化学式)并说:“那是正确的!”但最终答案需要基于这些成分进行计算(例如“这个分子的重量是多少?”)。如果验证器只检查成分而不检查最终计算结果,那么最终答案仍可能是错误的。
当他们扩大验证器的范围,使其不仅检查成分,还检查最终计算出的答案时,成功率从 83% 跳升至 90%。这教会了他们,要真正解决问题,你必须检查对用户真正重要的那个答案部分,而不仅仅是检查建筑模块。
总结
这篇论文表明,我们可以让科学 AI 变得更加可靠,但我们必须关注问题的正确部分。我们不需要教机器人如何更聪明地修复错误;它在这方面已经做得相当不错了。相反,我们需要构建更好的“谎言探测器”,以便在错误发生之前就能识别出那些罕见且棘手的错误。
研究人员还展示了这种方法适用于其他领域,比如检查放射性原子的半衰期,证明了这一理念并非仅限于化学。然而,他们也谨慎地指出,对于机器人已经掌握得非常完美的知识(如著名的物理常数),这个系统并无太大帮助,甚至可能引发一些新的错误。魔术只有在存在真实错误需要被发现时才会生效。
简而言之:机器人已经准备好接受纠正了;我们只需要变得更擅长抓到它撒谎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。