← 最新论文
📊 statistics

Transformers Can Learn Posterior Predictive Distributions In-Context

本文从理论上证明,通过实现高斯过程回归的梯度下降算法,Transformer 能够进行上下文内的后验预测分布近似,同时分析了归一化和注意力深度等架构选择如何影响其外推能力与误差界。

原作者: Gyeonghun Kang, Changwoo J. Lee, Xiang Cheng

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Gyeonghun Kang, Changwoo J. Lee, Xiang Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位超级聪明的学生(即Transformer),他从未参加过某项特定考试,但已阅读了涵盖所有可能主题的数百万份练习题。当你给他一组新的、简短的练习题(即上下文),并要求他预测最后一道题的答案时,他并非随意猜测。他会在脑海中瞬间“重读”这些练习题的模式,推断出最可能的答案,并评估自己对该答案的置信度。

本文旨在揭示这位学生如何在脑海中实际执行这一数学运算,具体针对一类称为高斯过程回归(Gaussian Process Regression)的问题(即根据散乱的数据点预测一条平滑曲线)。

以下是他们发现的分解说明,采用简单的类比:

1. 目标:预测整体图景,而非仅仅一个点

通常,人工智能模型只给出一个数值(即“点预测”),例如:“这栋房子将以 50 万美元售出。”
但本文聚焦于先验数据拟合网络(Prior-Data Fitted Networks, PFNs)。这些模型的特殊之处在于,它们提供的是不确定性的整体图景。它们不仅仅给出一个数值,而是会说:“这栋房子很可能以 50 万美元售出,但有 5% 的概率低于 45 万美元,且有 95% 的概率低于 55 万美元。”这被称为后验预测分布(Posterior Predictive Distribution, PPD)。

作者想要探究的是:Transformer 究竟如何仅凭观察少量示例,就能计算出这种复杂的“整体图景”?

2. 秘密武器:“迭代求解器”

论文揭示,Transformer 并非仅仅在猜测;它实际上在其层内秘密运行着一种数学算法,类似于徒步者缓慢攀登山丘以寻找最高点。

  • 类比:想象你试图找出地面上画出的圆的精确中心,但你只能迈小步。
  • Transformer 的做法:Transformer 中的“注意力”(Attention)层充当逐步计算器。随着网络的每一层(即徒步者迈出的每一步),它都更接近真实的数学答案。
    • 第 1 层:做出粗略猜测。
    • 第 2 层:基于前一次猜测进行修正。
    • 第 3 层:再次细化。
    • 结果:当数据到达网络末端时,它已执行了足够的“步骤”,从而完美计算出数据的平均值(mean)和离散度(variance)。

3. 将数字转化为地图(“分箱”技巧)

一旦 Transformer 计算出平均值和离散度,它就需要将这些数字转化为概率地图(即前述的“整体图景”)。

  • 类比:想象你有一座平滑、连续的山丘(概率曲线)。要在像素化的屏幕上绘制它,你必须将山丘切割成许多小方块(bins)。
  • 论文的声称:Transformer 的最后部分(一个小型的"MLP"头)充当像素化器。它利用计算出的平均值和离散度填充这些小块,从而创建出逐步的概率地图。论文证明,如果你拥有足够多的方块(bins)和足够多的步骤(层),这张像素化地图看起来几乎与完美的平滑曲线无异。

4. 成功的两大法则

作者发现了两个关键因素,决定了这位“学生”能否处理比其训练数据更大、更复杂的新问题:

法则 A:归一化是安全带

  • 问题:如果你在小型数据集(例如 100 个样本)上训练模型,然后让它解决超大数据集(例如 1000 个样本),“步骤”内部的数学运算可能会失控。这就像试图在没有速度调节器的情况下,驾驶一辆专为小镇设计的小汽车以 200 英里/小时的速度在高速公路上行驶;发动机会爆炸。
  • 解决方案:论文表明,归一化(一种在网络内部缩放数据的特定方式)充当了速度调节器。它保持“步骤”的稳定性,使模型能够泛化到比训练期间所见大得多的数据集。如果没有这一点,当数据变大时,模型将完全失效。

法则 B:深度是梯子

  • 问题:随着数据集变大,数学运算变得更难解决。“山丘”变得更加陡峭。
  • 解决方案:你需要更多的(更多的步骤)来攀登这座山。论文证明,要处理大 10 倍的数据集,你需要大约多 10 倍的层数才能获得相同的准确度。如果不增加层数,模型将无法收敛到正确答案。

5. 他们实际测试了什么

作者并未仅在纸面上进行数学推导;他们构建了一个“玩具”Transformer 并进行了测试:

  • 测试:他们在小型数据集上训练模型,然后向其投喂超大数据集。
  • 结果
    • 没有归一化的模型在数据变大时崩溃。
    • 带有归一化的模型保持完美运行。
    • 层数更多的模型更准确,尤其是在处理更困难、更大的问题时。
    • 他们甚至在实际世界数据上进行了测试(萨克拉门托的房屋价格和沃克湖的矿物品位),发现 Transformer 的预测结果与统计学家使用的黄金标准数学方法几乎完全一致。

总结

本文证明,Transformer 并非神秘的魔法黑箱。当它们学习“在上下文中”预测概率时,实际上是在执行一种特定的、逐步的数学计算(如同徒步者攀登山丘),以找出数据的平均值和离散度。要使这一机制在大型现实世界问题中发挥作用,你需要两样东西:归一化以保持数学运算的稳定性,以及深度(更多的层数)以赋予模型足够的步骤来解决更复杂的谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →