Evidence-Informed LLM Beliefs for Continual Scientific Discovery
本文引入了一个基于证据的、利用大语言模型进行持续科学发现的框架,该框架以非平稳的、基于信念更新的惊异度取代了静态的贝叶斯惊异度,并利用过滤和多样性最大化来消除伪奖励,从而显著提升了跨多个领域的假设探索能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位才华横溢但有点健忘的科学侦探——“自动发现”(AutoDiscovery)。这位侦探使用一个强大的 AI(大语言模型)通过猜测新理论(假设)并验证其真伪来破解谜团。
这位侦探的目标是寻找令人惊喜的发现。在这个世界里,“惊喜”是驱动搜索的燃料。如果一个理论让侦探感到震惊,它就被视为一次伟大的发现,侦探也会因此获得奖励,以激励它继续寻找更多此类发现。
问题:患有失忆症的侦探
原始版本的侦探有一个重大缺陷:它对自己过去的发现患有失忆症。
每次侦探猜测一个新理论时,它判断该理论有多“令人惊喜”,仅基于它在本次调查开始之前所知道的内容。它并不记得自己在当前案件中已经学到了什么。
类比:
想象你是一位美食评论家。
- 你品尝了一道新菜,心想:“哇,这种辛辣的味道真是前所未有的,太震撼了!”于是你给出了高分。
- 稍后,你品尝了第二道几乎与第一道完全相同的菜。
- 由于你对第一道菜有“失忆症”,你在品尝第二道菜时依然觉得:“哇,这种辛辣的味道也是全新的,太震撼了!”于是你又给出了高分。
实际上,第二道菜一点也不令人惊喜;它只是第一道的复制品。由于失忆,侦探不断把时间和精力(它的“搜索预算”)浪费在同一个想法的变体上,并误以为自己正在取得突破性的新发现。研究发现,大约有 30% 的“令人惊喜”的发现实际上只是侦探已经搞定的事物的重复发现。
解决方案:拥有笔记簿的侦探
作者通过给侦探一个**“笔记簿”**修复了这个问题。
现在,在侦探猜测一个新理论之前,它会翻阅自己的笔记簿,查看自己在这次特定调查中已经发现了并验证了什么。它会根据这段历史来更新它的“先验信念”(即它预期什么是真实的)。
运作方式:
- 旧方式: “我从未见过这个!太震撼了!”(即便这只是昨天那个震撼的翻版)。
- 新方式: “我昨天见过非常相似的东西。这个新想法只是那个想法的一个微小变体。它其实并没有那么令人惊喜。”
通过使用这种“基于证据的”记忆,侦探意识到许多它曾认为令人震惊的事物,实际上都是它已知事物的逻辑延伸。这过滤掉了那些“虚假的惊喜”。
搜索的两条新规则
仅仅给侦探一本笔记簿还不足以修复搜索过程。侦探仍然需要一种新的策略来寻找真正新颖的事物。作者增加了两条规则:
“过滤器”规则(信念更新过滤):
在侦探考虑一个新理论之前,它会自问:“如果我查看我的笔记簿,这个新理论是否仅仅是基于我已知事物的逻辑推论?”如果答案是“是”,侦探就会跳过它。它只保留那些即使在记住过去之后依然具有惊喜感的理论。“探索者”规则(多样性最大化):
侦探被告知要主动避开它已经探索过的区域。如果它一直在研究“辛辣食物”,它就不应该仅仅研究“更辣的食物”。它应该被引导去观察“甜味食物”或“咸味食物”,以确保它能覆盖整个可能性地图。
结果
当作者测试这个配备了记忆的新型侦探在五个不同科学领域(如考古学、生物学和社会科学)的表现时,结果非常明确:
- 更少浪费: 侦探停止了在“虚假惊喜”(即仅仅是旧想法的复制品)上浪费时间。
- 更多真正的发现: 通过过滤噪音并推动向多样化思想发展,与旧方法相比,它找到了多出 30% 的真正令人惊喜且非冗余的发现。
总结
本文认为,对于想要实现真正的、持续性的科学发现的 AI 而言,它不能仅仅是一个“一次性”的猜测者。它必须是一个学习者,能够根据它已经发现的事实,不断更新它对什么是“新”的理解。如果没有这种记忆,AI 将只是在原地打转,认为自己在不断发现世界,而实际上它只是在不断重复自身。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。