← 最新论文
🧬 biology

Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature

本文介绍了一种受本体论约束的多大语言模型(multi-LLM)流水线,该流水线通过根据定义的假设术语表对研究进行评分,来综合碎片化的预测编码文献,从而生成传统元分析无法解决的可审计差异测量和定量证据空间。

原作者: Hamed Nejat, Alexander Maier, Jesse Spencer-Smith, André M. Bastos

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Hamed Nejat, Alexander Maier, Jesse Spencer-Smith, André M. Bastos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图理解一个庞大且混乱的图书馆,里面有成千上万名科学家撰写的关于人类大脑如何预测未来的书籍。问题在于,这些书是用不同的语言编写的,使用不同的地图,而且有时还会互相矛盾。有些作者将“预测误差”(prediction errors)描述得像是电火花,而另一些人则将其描述为统计概率。试图阅读所有这些书籍并弄清楚科学界究竟达成了什么共识,就像是在拼凑一个来自不同盒子的巨大拼图。

这篇论文描述了一种解决这个拼图问题的新方法,即使用一支 AI “图书管理员”团队。

问题:碎片化的图书馆

作者关注的是一个被称为**预测编码(Predictive Coding)**的特定领域。这是指我们的大脑不断在猜测接下来会发生什么,并且只有在现实让我们感到意外时(比如在安静的房间里听到一声巨响)才会给予关注。

多年来,科学家们使用许多不同的工具研究了这一现象:脑扫描、电生理记录、计算机模型和行为测试。由于这些方法如此不同,很难将它们的发现合并成一个清晰的图像。传统的科学总结方法(称为元分析/meta-analysis)通常要求所有的研究都必须以完全相同的方式进行,但这在这里是不可能的。

解决方案:AI 管理员委员会

作者并没有让一位人类专家去阅读一切,而是构建了一个本地多 LLM 流水线(local multi-LLM pipeline)。可以把它想象成一个“委员会”,由十个不同的 AI 模型(就像十个不同的专家团队)组成,他们在(本地执行的)安全私密房间里共同工作,这样敏感数据就不会离开他们的计算机。

以下是他们让 AI 团队协同工作的过程:

  1. 规则手册(本体论/Ontology): 在 AI 开始阅读之前,人类作者创建了一个严格的“术语表”或规则手册。它定义了 36 个特定的概念,并将这些概念归纳为三个主要想法(假设):

    • 预测性抑制(Predictive Suppression): 大脑在预期某事发生时是否会变得安静?
    • 前馈误差传播(Feedforward Error Propagation): 当大脑感到惊讶时,是否会向层级结构上方发送“呐喊”式的误差信号?
    • 普遍性(Ubiquity): 这种“预测机器”是存在于大脑的各个角落,还是仅存在于特定区域?
  2. 阅读过程: AI 团队阅读了 31 篇科学论文。他们不仅阅读文本,还利用一种特殊的视觉工具查看了图表和数据,以理解数据内容。

  3. 评分: 对于每一篇论文,10 个 AI 模型中的每一个都会针对三个主要想法给出从 -1(强烈反对)到 +1(强烈赞同)的评分。它们必须准确引用论文中发现证据的具体位置,扮演着严格的同行评审员角色。

结果:绘制景观图

一旦 AI 委员会完成评分,作者就会将结果视为一张 3D 地图。

  • “局部”与“全局”奇特刺激(Oddball): 他们在两种不同的场景下测试了论文:
    • 局部奇特刺激(Local Oddball): 一个简单的惊喜(例如在一系列哔哔声中出现的一个哔声)。
    • 全局奇特刺激(Global Oddball): 一个复杂的、长期的模式变化(例如游戏规则的变化)。
  • 研究发现:
    • 一致性: AI 委员会发现,大多数论文都同意大脑存在“预测性抑制”(即对于预期中的事物会变得安静)并向前发送误差信号。
    • 分歧点: 对于这些机制是否在脑部到处发生(普遍性),一致性要低得多。
    • 转折点: 对于简单的“局部”惊喜,一致性要比复杂的“全局”惊喜强得多。“全局”语境更加混乱且分散。

衡量科学的新工具

作者发明了一些巧妙的方法来衡量科学文献的“凝聚度”:

  • 假设空间温度(Hypothesis-Space Temperature): 想象科学论文是罐子里的气体颗粒。如果它们都挤在同一个角落,那么“温度”就很低(高一致性)。如果它们在整个罐子里到处乱跳,那么“温度”就很高(高分歧)。
    • 他们发现,对于简单的局部惊喜,“温度”很(科学家们达成共识)。
    • 对于复杂的全局惊喜,“温度”很(科学家们存在分歧)。
  • 离群值(The Outlier): 他们识别出了一篇非常特别的论文(Westerberg et al., 2025),这篇论文与其他论文截然不同。它在涉及复杂全局模式时,与标准观点不符。AI 委员会成功地在没有人类偏见的情况下,将这篇论文标记为“离群值”。

为什么这很重要

这篇论文证明了,在严格的人造规则手册指导下,一个 AI 模型团队可以阅读一个混乱、碎片化的科学领域,并将其转化为一张清晰的定量地图。

  • 可审计性(Auditability): 由于 AI 模型是在本地运行并保留其推理日志的,人类可以检查它们的工作。
  • 衡量分歧: 该方法不仅仅是简单地说“科学家们存在分歧”,而是测量了他们究竟在多大程度上以及在何处产生分歧。
  • 可扩展性(Scalability): 这种方法可以处理比人类团队多得多的论文,从而使科学研究能够跟上研究快速增长的步伐。

简而言之,作者构建了一台机器,它可以阅读混乱的图书馆,将书籍分类整理成一张整洁的 3D 地图,并准确地告诉我们科学家们在哪些地方步调一致,又在哪些地方仍在争论不休。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →