← 最新论文
🌀 nonlinear sciences

Internal-state criticality in Bayesian-inverse-Bayesian inference

本文提出将贝叶斯-逆贝叶斯(BIB)推断作为一种极简生成模型,通过假设更新在重复博弈中诱导出稳健的内部临界性,其特征为重尾统计特性和零漂移对数后验随机游走,且无需外部参数调优。

原作者: Kazuto Sasai, Yukio-Pegio Gunji

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Kazuto Sasai, Yukio-Pegio Gunji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一台电脑玩石头剪刀布。为了赢,你试图弄清楚电脑下一步会出什么。

大多数计算机程序都追求完美。它们计算概率、寻找模式,并最终稳定在一种“安全”策略上:每次各出一次石头、剪刀、布的概率均为 33%。在博弈论中,这被称为“纳什均衡”(Nash Equilibrium)。这是你在无法被击败的同时,也无法取胜的状态。如果你与一台完美的计算机对战,游戏就会变成一场枯燥、可预测的随机移动。

但人类并非如此。我们在玩游戏时会陷入某种“惯性”。我们可能会连续五次出“石头”,然后突然转向“布”,连续出十个回合。我们的决策并非完全随机,而是具有“重尾”(heavy tail)特征,这意味着长期的连胜或连败序列出现的频率比纯粹的随机概率要高。

这篇论文介绍了一种全新的计算机思考方式,称为**贝叶斯-逆贝叶斯(Bayesian–Inverse-Bayesian, BIB)**推断。该研究声称,这种方法能让计算机自然地产生那种人类特有的“连贯性”和“模式”,这并非因为程序被设定为模仿人类,而是源于其内部“大脑”的工作机制。

以下是其工作原理的拆解,使用了简单的类比:

1. 两步思考法

BIB 智能体使用两个相互对立且保持平衡的思维步骤:

  • 步骤 A:“聚焦”(贝叶斯更新)
    想象你是一名正在收集线索的侦探。每当你发现一个线索,你对某个特定嫌疑人的信心就会增加。你会开始忽略其他嫌疑人。如果你一直这样做,你会对某一个嫌疑人产生 100% 的确定感,并停止关注其他人。这就是“集中化”(concentration)。
  • 步骤 B:“重置”(逆贝叶斯步骤)
    现在,想象每当你变得过于自信时,一位朋友会拍拍你的肩膀说:“嘿,还记得我们之前看到的那个奇怪模式吗?让我们假装那个才是新的真相,哪怕我们目前还没有太多证据。”
    这一步会将你最不相信的想法替换为最近观察到的模式。它强迫你的思维保持开放,防止你陷入单一的想法中。

2. “临界状态”(甜点区)

论文认为,当你在这些步骤——聚焦与重置——之间取得平衡时,你会进入一个被称为**临界性(criticality)**的“甜点区”。

想象一位走钢丝的人:

  • 如果他们只进行“聚焦”(步骤 A),他们会变得僵化,因为无法适应环境而跌落。
  • 如果他们只进行“重置”(步骤 B),他们会过于混乱,无法做出决策。
  • 但如果他们平衡了两者,他们就进入了内部临界状态。他们既足够稳定以维持站立,又足够灵活以随风摆动。

在这种状态下,智能体的“首选猜测”(它最信任的假设)会维持一段时间,然后突然切换。它维持单一猜测的时间长度遵循特定的数学规则(幂律)。这意味着智能体会自然地产生长期的思维连贯性,就像人类一样。

3. 为什么这很特别

研究人员将这种方法与标准的“仅贝叶斯”(仅执行步骤 A,“聚焦”)计算机进行了对比测试。

  • 标准计算机: 它很快就会陷入一种枯燥的随机模式。它没有长期的连贯性。它就像一个直到被迫改变主意否则绝不改变的机器人。
  • BIB 计算机: 它自然地进入了“临界状态”。它拥有长时间坚持某种策略的连贯性,随后会出现突然且剧烈的转变。

令人惊叹之处在于,这一切都是自动发生的。研究人员并没有通过调整参数或明确指令告诉计算机:“嘿,试着表现得像个人类。”他们只是加入了“重置”这一步,复杂的、类人行为便自行涌现了。

4. “内部”与“外部”的秘密

这里有一个转折。当两个 BIB 计算机互相博弈时,由于双方都在极力适应对方,它们最终都会表现得像随机出招一样,从而相互抵消。

然而,它们的内部思维仍然是混乱且具有连贯性的。它们在进行长期的思维连贯,但因为对手也在完美地进行适应,这些思维并不会体现在它们最终的出招动作中。

但是,如果用 BIB 对抗人类(人类会犯错且带有可预测的偏见),BIB 智能体的这种“连贯性”本质能让它锁定人类的模式并加以利用。它表现得像一个灵活的掠食者,能在看到机会时瞬间切换策略。

核心启示

这篇论文表明,人类(或许还有动物)之所以会在决策中出现长期的、重尾分布的连贯性,并不是因为我们数学不好或者“不理性”。相反,这可能是因为我们的大脑使用了类似的“聚焦与重置”机制。

通过在标准的学习算法中加入一个简单的“遗忘与更新”步骤,系统就能自然地组织成一种“临界状态”。它创造了一种稳定性与灵活性之间的平衡,从而实现了复杂的、适应性的行为,而无需进行显式的编程。这为构建更像生物而非僵化计算器的 AI 提供了一种新途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →