← 最新论文
🤖 machine learning

From Markov to Laplace: How Mamba In-Context Learns Markov Chains

本文证明了单层 Mamba 模型能够高效地在上下文学习中实现马尔可夫链的最优拉普拉斯平滑估计量,从而在理论上首次建立了 Mamba 基于卷积的架构与贝叶斯/极小极大最优统计估计之间的正式联系。

原作者: Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:一种新型的 AI 大脑

想象一下当前人工智能领域的超级明星——Transformer(大多数聊天机器人背后的引擎),它就像一位才华横溢但有些笨重的图书管理员。它可以阅读整本书并瞬间找到联系,但如果书太长,它就会变得疲惫且缓慢,因为它试图同时记住每一个单词。

迎来 Mamba,一种更新型的 AI 模型。它就像一个敏捷、快速奔跑的信使。它处理信息的速度更快,占用的内存更少,是那个笨重图书管理员的一个极具前景的替代方案。但科学家们并不完全理解这个信使为什么如此聪明。他们知道它效果很好,但并不清楚其中的秘诀。

这篇论文就像是一个侦探故事,旨在弄清楚 Mamba 究竟是如何解决一种被称为**马尔可夫链(Markov Chains)**的特定类型谜题的。

谜题:预测下一步

为了测试 Mamba,研究人员给了它一个名为“下一标记预测(Next Token Prediction)”的游戏。

  • 设定: 想象一个事件序列,比如一串彩色珠子(红、蓝、红、红、蓝……)。
  • 规则: 下一个珠子的颜色取决于它之前的珠子颜色。这就是一个“马尔可夫链”。
  • 挑战: 模型看到一串随机的珠子,必须猜出下一个是什么。至关重要的一点是,游戏的规则(例如红色紧跟蓝色出现的概率)会随着每一串新的珠子而改变。模型必须通过观察当前的字符串来“即时”掌握规则。这被称为上下文学习(In-Context Learning, ICL)

发现:Mamba 是完美的统计学家

研究人员发现了一些令人惊讶的事实。即使是一个单层的 Mamba(一个非常简单的模型版本),也学会了成为这个游戏的完美统计学家

在统计学领域,当你不完全了解规则时,有一种预测下一个珠子的“黄金标准”方法。它被称为拉普拉斯平滑(Laplacian Smoothing)(或“加 β\beta”估计量)。

  • 类比: 想象你正在猜测一副扑克牌中的下一张牌。如果你已经看到了 10 张 A 和 0 张 K,你可能会猜下一张是 A。但一个聪明的统计学家会想:“等等,我还没见过 K,也许只是运气不好。”所以,他们会在计数中加入一个微小的“幽灵”K 来避免过于武断。这可以防止他们在尚未观察到某种情况时就断言“概率为零!”。

论文的观点: Mamba 不仅仅是在瞎猜;它在数学上学会了完美地执行这种“幽灵计数”。它计算出之前模式出现的次数,并自动加上那一点点“平滑”处理,就像最优统计公式所要求的那样。

核心要素:卷积“手电筒”

研究人员问道:Mamba 是如何做到这一点的? 是因为它复杂的门控机制吗?还是因为它的非线性激活函数?

他们通过移除 Mamba 的部分组件并观察哪些部分失效来进行实验。

  • 发现: 最重要的部分是卷积(Convolution)
  • 类类比:卷积想象成 Mamba 用来照向近期历史的一个手电筒
    • 为了预测下一个珠子,Mamba 需要知道:“在过去的几步中,‘红色’紧跟‘蓝色’出现了多少次?”
    • 卷积就像一个在历史记录上滑动的窗口,能够瞬间统计这些模式。
    • 研究人员发现,如果你拿走了这个手电筒(卷积),Mamba 就会变“盲”并无法完成任务。如果你保留手电筒(并移除复杂的门控机制),Mamba 仍然能完美地解决这个谜题。

关键结论: 这个“手电筒”(卷积)才是英雄。它允许 Mamba 回望过去、统计模式出现的次数,并应用最优的统计平滑,而不需要一个深奥复杂的“大脑”。

局限性:手电筒需要多大?

论文还研究了谜题的难度变化。

  • 如果游戏取决于最后 1 颗珠子(一阶),一个小手电筒就能胜任。
  • 如果游戏取决于最后 5 颗珠子(五阶),手电筒就需要更宽,以便同时看清这 5 颗珠子。
  • 定理: 论文证明,要处理一个依赖于前 kk 个步骤的游戏,模型的“记忆容量”(隐藏维度)需要随 kk 指数级增长。这就像尝试记住一个密码:密码越长,要在脑海中同时记住它的难度就呈指数级上升。

与 Transformer 的对比

论文将 Mamba 与 Transformer(沉重的图书管理员)进行了对比:

  • Transformer: 为了解决这个“计数”谜题,一个 Transformer 通常需要两层(两个协同工作的脑子)来构建一种被称为“归纳头(Induction Head)”的机制来进行模式计数。单层 Transformer 则会失败。
  • Mamba: 单层 Mamba 能立即解决问题,因为其内置的卷积机制天生擅长高效计数。

总结

这篇论文揭示了 Mamba 在从上下文中学习时的超能力来自于一个特定的架构特征:卷积

  1. Mamba 学会了像一个完美的统计学家一样行动,使用被称为拉普拉斯平滑的方法来预测序列中的下一项。
  2. 它通过使用一个**卷积“手电筒”**来统计过去的模式并应用正确的统计调整来实现这一点。
  3. 即使是在一个非常简单的单层模型中也能实现,而 Transformer 则需要更复杂的结构才能完成同样的工作。

作者得出结论,这是首次有人正式将 Mamba 与这些最优统计估计量联系起来,证明了 Mamba 不仅仅是一个快速的模型,它从根本上理解如何高效地计数和对数据进行平滑处理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →