← 最新论文
🤖 AI

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

本文证明,一种利用语言模型内在置信度的基于逻辑值(logit)的能量评分方法,在跨多个学科对科学假设进行排序方面,显著优于通过提示词驱动的 LLM-as-judge 方法。

原作者: Swati Rajwal, Sanjay Das, Tirthankar Ghosal

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Swati Rajwal, Sanjay Das, Tirthankar Ghosal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

科学始终是已知与可能发现之间的对话。当研究人员面对一个复杂的问题时,他们必须首先构想出一个可能的解释,即一个符合他们所收集到的事实的假设。几十年来,这一步骤完全依赖于人类的直觉,但现在一个新工具已经进入了实验室:大语言模型。这些强大的计算机程序在海量文本上进行了训练,现在可以编写句子、总结研究,甚至提出新的科学构想。然而,一个关键问题仍悬而未决。如果一台计算机可以生成一系列针对某种现象的可能解释,我们如何知道哪一个才是真正正确的?目前回答这一问题的标准是要求另一台规模更大的计算机程序阅读该列表并选出最佳选项,就像老师批改试卷一样。然而,这种方法存在缺陷:它往往倾向于那些听起来熟悉或文笔优美的想法,而不是那些真正具有原创性或科学严谨性的想法。

橡树岭国家实验室的一个研究小组决定测试一种不同的方法。他们没有要求模型去比较想法并给出言语上的评价,而是要求模型仅仅去“感受”每个想法的分量。他们将计算机的内部置信度视为一种信号。当模型读到它预期的句子时,它会感到一种确定感;当它读到陌生或不太可能的句子时,它会感到惊讶。研究人员想知道,这种原始的、内在的感觉是否比正式的、口头的排名更能判断科学真理。他们试图观察计算机是否能够仅仅通过一个假设如何自然地融入一篇科学论文的故事中,而不经过任何明确的选择指令,就能识别出优秀的假设。

为了进行这项测试,研究人员收集了来自十二个不同领域(从天文学、物理学到法律和商业)的 1,323 篇真实科学论文的庞大集合。对于每篇论文,他们提取了背景信息和科学家试图解决的具体问题。然后,他们为计算机模型创造了一个挑战:一份包含十六个可能假设的列表。其中只有一个是原始科学家所使用的真实假设;其他十五个是经过巧妙编写但错误的替代方案。目标是看计算机能否从这十五个错误的选项中识别出唯一的正确假设。

该团队使用七种不同的计算机模型运行了这项测试,其范围从非常小的开源程序到庞大的专有系统。他们比较了判断假设的两种方式。第一种方法是传统方法:提示一个大型商业模型阅读所有十六个选项,并明确地对其进行从优到劣的排序。第二种方法是新方法:他们将每个假设连同背景上下文逐一输入模型,并测量模型的内部置信度得分。该得分基于模型认为在给定语境下,特定词汇出现的可能性。他们进行了两次测量,一次使用标准的概率计算,另一次使用原始的“内部能量”度量,后者捕捉的是预测在被平滑处理之前的强度。

结果令人惊讶,并改变了我们对这些工具运作方式的理解。传统的、要求大型模型充当评委并对列表进行排序的方法表现不佳。它仅在约 16.6% 的案例中正确识别出了排名第一的假设。相比之下,依靠模型内部置信度(而非显式排名指令)的方法表现得显著更好。当研究人员观察表现最好的模型与评分方法的组合时,他们发现,一个相对较小的开源模型使用原始能量得分,在 53.1% 的案例中正确识别了正确的假设。这意味着,一个仅仅通过“感受”文本的适度规模的计算机程序,在寻找正确科学构想方面的效率,是比一个被明确要求进行比较和排序的更庞大、更复杂的系统高出三倍多的。

研究还表明,模型的规模并不保证更好的性能。最成功的配置是一个仅拥有 10 亿参数的模型,这与通常用于复杂推理的庞大系统相比是非常微小的。事实上,在被要求对假设进行排序时,测试中的最大模型并不总是表现最好。研究人员指出,内部置信度信号在不同模型之间并不统一:对于某些模型,原始能量得分是一个强大的工具,而对于另一些模型,其效果则较差。这表明,在处理这项特定任务时,模型的构建和训练方式比其单纯的规模更为重要。研究还发现,该方法在大多数科学学科中表现一致,尽管学科间的差异微小到不足以构成确定的规则。

这项工作的最重要启示之一是,我们目前要求计算机评估科学构想的方式可能存在缺陷。通过强迫模型表达偏好并对选项进行排序,我们可能会引入误差,从而掩盖其真实的理解。研究人员建议,模型的自身似然度——即它对特定词序的静默信心——可能比它的言语判断更能诚实且可靠地反映科学上的合理性。这并不意味着问题已经解决。研究人员承认,他们的测试使用了已经发表的论文中的假设,因此模型可能是在识别熟悉的措辞,而非真正理解科学。他们提议,下一步是将这些方法应用于全新的、尚未发表的想法,即答案尚不明确的情况,届时需要由人类专家来判断结果。

最终,这项研究为可信的人工智能科学研究提供了一条新路径。它表明,我们不需要依赖计算机程序之间复杂的言语辩论来寻找正确答案。相反,我们或许可以信任模型的内在、静默的信号,让即使是规模较小、更易获取的工具也能在科学发现过程中发挥至关重要的作用。研究结论指出,尽管当前的方法存在局限性,但利用模型的内在置信度来评估科学假设的潜力是真实存在的,并且值得进一步探索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →