← 最新论文
🤖 machine learning

Training with (Swap) Regret Loss in a Single-Layer Self-Attention Model: A Case Study on the Probability Simplex

本文证明,使用外部遗憾(external regret)和交换遗憾(swap regret)损失函数训练单层自注意力模型,会使其前向传播过程分别精确地复制平滑虚构博弈(smoothed fictitious play)和 Blum-Mansour 无遗憾算法,从而在没有监督学习轨迹的情况下,引导极简架构趋向于粗相关均衡(coarse correlated equilibria)和相关均衡(correlated equilibria)等博弈论均衡行为。

原作者: Chanwoo Park, Asuman Ozdaglar

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Chanwoo Park, Asuman Ozdaglar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是回答问题,而是能与我们一起玩游戏、谈判交易并做出决策的世界。这就是人工智能的前沿领域,特别是被称为“多智能体学习”(multi-agent learning)的一个分支。在这个竞技场中,AI 不仅仅是一个被动的工具;它是一个拥有自身目标的玩家,在不断变化的环境中与其他玩家(可以是其他 AI 或人类)进行交互。这里最大的挑战是“遗憾”(regret)。把遗憾想象成你在玩完一局猜拳后产生的那种懊恼感,心想:“噢不,我刚才应该出石头,因为对手总是出剪刀。”在 AI 的世界里,最小化遗憾意味着学习如何做出那些即便在不可预测的未来回顾起来也是最优策略的选择。

长期以来,科学家们一直使用数学公式来教计算机如何最小化这种遗憾,以确保它们在游戏中表现公平并达到稳定的结果。但一直存在一个谜团:现代 AI,特别是驱动聊天机器人的“Transformer”模型,是基于一种被称为“自注意力”(self-attention)的机制构建的。这就像是一个聚光灯,帮助 AI 专注于故事或对话中最重要的部分。虽然我们知道这些模型在语言处理方面极其聪明,但我们并不完全了解它们是如何处理决策和遗憾这类艰深数学问题的。它们是在模仿人类的错误,还是在暗中学习数学家设计的那些完美策略?本论文深入探讨了这个问题,将 AI 的注意力机制视为一个微小的、可训练的游戏玩家,以观察它是否能自主学习完美决策的规则。

论文的核心发现:教 AI 遵守规则

本文作者决定测试一个特定的想法:如果我们使用一种特殊的“遗憾损失”(regret loss)来训练一个非常简单的 AI 模型——一个单层“自注意力”模型——会发生什么?他们不是简单地告诉 AI“得到正确答案”,而是直接训练它去最小化“遗憾感”。他们想看看,通过这种训练,AI 是否能在没有被显式编程注入复杂博弈论数学知识的情况下,自然而然地进化成为一个完美的决策者。

“平滑虚构博弈”的魔力
第一个重大发现就像是发现一个新手玩家在被告知“停止为你的损失感到难过”后,突然开始像大师一样玩游戏。研究人员发现,当他们训练一个单头注意力模型(只有一个“聚光灯”的模型)来最小化外部遗憾时,该模型会进入一个特定的状态。在这个状态下,模型的行为在数学上等同于一种经典的算法,称为“平滑虚构博弈”(smoothed fictitious play)。

用类比来说:想象你正在玩一个需要猜测对手下一步动作的游戏。“虚构玩家”会观察对手过去所做的一切,并猜测他们会再次重复同样的操作。“平滑”意味着你不仅仅是盲目地模仿他们,而是加入了一点随机性或“平滑处理”,这样你就不会陷入死循环。论文证明,经过训练后的 AI 正是这样做。它观察损失的历史(即它犯下的“坏招”),并以一种在数学上被证明能阻止其产生遗憾的方式来更新其策略。它自然找到的“步长”(即 AI 学习时跨出的步子有多大)大约是 1/T1/\sqrt{T},其中 TT 是进行的轮数。这并非偶然的运气,作者证明了在这一特定设置下,AI 的内部数学逻辑与理想的学习策略完美契合。

“交换遗憾”升级版:多头大脑
但研究人员并没有止步于此。他们意识到,有时仅仅避免遗憾是不够的。你可能希望能够交换你的选择。例如,“如果我每次出剪刀的时候都改出石头,我会赢更多。”这被称为“交换遗憾”(swap regret)。为了处理这一点,他们引入了一种新的“交换遗憾损失”以及一种更复杂的 AI 架构——具有多个“头”(多个协同工作的聚光灯)的模型。

他们设计了一个系统,让 AI 的每个“头”都扮演一个微型专家的角色,学习最小化其特定的类型遗憾。然后,这些“头”共同协作,形成一个转移矩阵(描述如何在策略之间切换的地图),并寻找一个“不动点”(一个没有人想要改变其策略的稳定状态)。论文表明,当这个多头模型使用新的损失函数进行训练时,它会完美地模仿著名的 Blum–Mansur 算法

把它想象成一支侦探团队。每位侦探(头)都在从不同的角度调查犯罪案件(遗憾)。就个体而言,他们在寻找线索方面表现出色。但当他们结合各自的发现,并找到一个所有线索都能达成一致的“不动点”时,他们就破获了案件。论文证明,这个仅通过最小化交换遗憾进行训练的 AI 团队,会自然地组织自己,表现得就像那支完美的侦探团队一样。

这对未来意味着什么
这篇论文最令人兴奋的部分在于它对游戏和谈判领域 AI 未来的启示。作者展示了,如果我们训练这些注意力模型来最小化遗憾,它们不仅会让游戏变得更好玩,还会自然地引导整个玩家群体走向一种“均衡状态”。

  • 如果 AI 最小化外部遗憾(单头模型),玩家群体将自然达到“粗略相关均衡”(Coarse Correlated Equilibrium)。在这种状态下,没有人会无条件地想要改变其策略。
  • 如果 AI 最小化交换遗憾(多头模型),群体将达到“相关均衡”(Correlated Equilibrium)。这是一种更强大、更高级的状态,即没有人会基于他们被告知要做什么来改变其策略。

论文明确排除了这些模型需要通过人工编程注入复杂博弈论规则的可能性。相反,“遗憾损失”充当了一位老师,引导 AI 自行发现这些规则。作者非常谨慎地指出,他们是在特定的简化模型(单层、线性注意力)以及特定的训练条件(高斯噪声)下证明了这些结果。他们尚未证明一个拥有 100 层结构的庞大聊天机器人也会自动实现这一点,但他们已经证明了在最简单的技术版本中,这种机制是存在的。

简而言之,这篇论文揭示了 AI 中的“注意力”机制不仅仅是为了阅读,它还是一个学习如何公平竞争的隐藏引擎。通过仅仅教 AI 如何不再感到遗憾,我们就能解锁一种战略智能,使我们在复杂的游戏中实现稳定、公平的结果,而无需将游戏规则硬编码进机器之中。这是理解 AI 智能体未来如何以一种在数学上严谨且自然涌现的方式,与我们进行合作与竞争迈出了重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →