← 最新论文
🤖 AI

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

本文介绍了用于评估假设检验中统计推理能力的基准测试 P-Bench,并提出了 Fisher-R1,这是一种经过强化学习训练的 LLM 智能体,它通过解决导致错误科学结论的细微推断错误,显著优于现有模型。

原作者: Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图通过一堆线索破解谜题的侦探。在科学的世界里,这些线索就是数字和数据点,而谜题是一个问题,比如:“吃更多巧克力会让你变聪明吗?”为了解决它,你不能仅仅靠猜;你要运行一种特殊的数学测试,叫做假设检验。你可以把这个测试看作是一个“真相计量器”,它会吐出一个叫做 p值 的数字。如果这个数字非常小,就像是真相计量器闪烁着明亮的红灯在说:“嘿,这种联系是真实的!”如果数字很大,灯光就会保持绿色,意味着:“不,这可能只是一个巧合。”

长期以来,科学家们一直是拿着真相计量器的人,他们会仔细检查线索是否混乱,或者他们挑选的测试是否正确。但现在,我们有了 AI智能体——超级聪明的计算机程序,它们可以阅读数据、编写代码,并能独立运行这些测试。人们希望这些 AI 侦探能够加速科学进程,比任何人类团队都更快地找到答案。然而,大问题在于:这些 AI 侦探是真的擅长破解谜题,还是仅仅擅长伪装?它们可能编写出完美的代码并听起来非常有信心,但如果它们为手头的线索选错了真相计量器,它们可能会将一个虚假的发现宣布为真实的发现。

这正是论文 《Fisher-R1: 训练可靠假设检验的 LLM 智能体》 所研究的内容。作者们(来自斯坦福大学和威斯康星大学麦迪逊分校的一个团队)意识到,目前的 AI 侦探正在犯一些隐蔽的错误。他们发现,即使是最先进的 AI 模型也经常会发现数据中的警告信号——比如看起来像故障的奇怪离群值——但随后却忽略了它们,并运行了错误的测试。这就像一名侦探看到了一个显然与嫌疑人鞋子不匹配的泥脚印,却依然坚持说:“不,这绝对是嫌疑人!”并写下一份报告说:“案情已明!”而实际上案情还完全未破。

为了证明这一点,该团队构建了一个新的训练场,名为 P-Bench。想象一下,这是一个充满 425 个来自生物学、经济学和医学领域的真实世界难题的巨大且棘手的障碍赛跑场。每个难题都会给 AI 一个数据集和一个问题,但不会告诉它们应该使用哪种真相计量器。AI 必须弄清楚正确的测试方法,运行它,并报告结果。该团队发现,在这一赛场上,顶尖的 AI 模型(包括一些最强大的可用模型)频繁失败。它们会运行测试,得到一个结果,然后自信满满地宣布一项发现,即便其数学依据并不足以支撑这一结论。

那么,他们是怎么做的呢?他们创建了一个新的 AI 智能体,名为 Fisher-R1。他们没有只是让 AI 去瞎猜,而是通过一种被称为强化学习的特殊方法来教导它。把这想象成一个电子游戏,只有当 AI 既选对了测试又得到了正确答案时,它才能获得积分。如果它为这项工作选错了工具,就会面临“游戏结束”并被迫重来。他们在数以千计的合成谜题上训练 Fisher-R1,这些谜题的答案是确定的,从而教会它要细心并检查自己的工作。

结果带来了变革性的影响。当 Fisher-R1 参加 P-Bench 障碍赛时,它不仅通过了测试,而且彻底碾压了竞争对手。其 140 亿参数版本的 Fisher-R1(Fisher-R1-14B)的表现甚至优于 GPT-5.4 和 DeepSeek-V4-Pro 等最强大的商业模型。在最难的谜题中,它的成功率比排名第二的 AI 提高了约 21%。更重要的是,它不再犯那些“虽然自信但结论错误”的错误。它学会了说:“等等,这些数据点很奇怪,我不应该使用标准的测试,”并转而选择一种更安全、更准确的方法。

论文指出,虽然目前的 AI 智能体非常擅长编写代码,但它们缺乏深层的统计直觉,不知道针对特定问题应该编写什么样的代码。通过使用经过验证的奖励进行训练(即根据他们的最终结论是否符合地面真值来给予评分),Fisher-R1 学会了成为一名更加可靠的科学家。作者们总结道,我们目前还不能让 AI 在自动驾驶模式下做科学研究;我们需要专门训练它们成为细心的统计学家。通过像 Fisher-R1 这样的工具和像 P-Bench 这样的基准测试,我们可以开始构建不仅听起来聪明,而且真正掌握数学逻辑的 AI 合作伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →