← 最新论文
🤖 AI

Randomness is sometimes necessary for coordination

本文提出了一种名为 Diamond Attention 的交叉注意力架构,该架构利用采样的随机数来诱导瞬态的秩排序并打破同质智能体之间的对称性,从而在确定性策略失效的合作多智能体强化学习任务中实现有效的协调与零样本泛化。

原作者: Rohan Patil, Jai Malegaonkar, Henrik I. Christensen

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Rohan Patil, Jai Malegaonkar, Henrik I. Christensen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正带领一支由同卵双胞胎组成的团队执行任务。他们都穿着相同的制服,拥有相同的训练手册,并且透过窗户看到完全相同的景象。问题在于:如果他们都根据所见内容遵循完全相同的指令,他们就会在同一时间做出完全相同的事情。

在计算机智能体(机器人或软件)的世界里,这是一个巨大的问题。如果两个智能体需要执行不同的任务才能成功(例如一个站在左边,另一个站在右边),但它们是完全相同的且看到相同的内容,那么它们都会试图站在左边,相互碰撞并导致失败。这被称为“对称性问题”。

本文提出了一种巧妙的解决方案,称为钻石注意力(Diamond Attention)。其工作原理如下,分解为简单的概念:

1. 问题:“镜像”陷阱

想象一群相同的机器人试图解决一个谜题,它们必须选择不同的颜色的钥匙。如果它们都运行相同的计算机程序并查看相同的屏幕,它们都会伸手去拿红色的钥匙。它们会相互碰撞,无人获胜。

之前的解决方案试图通过以下方式解决这一问题:

  • 赋予它们不同的 ID:但在一个真正去中心化的团队中(没有谁是老板),你不能在没有某人先决定顺序的情况下,简单地说“你是智能体 1"和“你是智能体 2"。
  • 轮流行动:让它们依次行动。但这很慢,并且需要严格的顺序,这又回到了“谁先行动?”的问题。

2. 解决方案:“随机数”游戏

作者们意识到,要打破相同智能体之间的僵局,你需要随机性。但不仅仅是任何随机性——它需要是一种特定类型的“结构化”随机性。

想象每个智能体在每一秒开始时从帽子中抽取一个数字(0 到 1 之间的随机数)。

  • 智能体 A 抽到了 0.9
  • 智能体 B 抽到了 0.2
  • 智能体 C 抽到了 0.5

尽管它们是同卵双胞胎,但在这一特定秒内,由于数字不同,它们现在变得不同了。

3. 机制:“钻石注意力”

魔法就在这里发生。智能体利用这些随机数字创建一个临时的层级结构(排队顺序)。

  • 拥有最高数字(0.9)的智能体在这一秒成为“领导者”。它们观察目标并忽略其他智能体。它们独立行动。
  • 拥有中间数字(0.5)的智能体观察领导者正在做什么,然后行动。
  • 拥有最低数字(0.2)的智能体观察两者(领导者和中间智能体),然后根据其他人的行动采取行动。

这被称为钻石注意力。它就像一个钻石形状:顶部的智能体看到一切,中间的看到顶部,底部的看到所有人。

为什么这很特别?

  • 瞬间发生:它们不需要交谈数小时来决定谁是领导者。它们只需共享随机数字,层级结构就会瞬间形成。
  • 每秒变化:下一秒,智能体 B 可能抽到 0.9 并成为领导者。角色自然轮换。
  • 可扩展:无论你拥有 2 个智能体还是 100 个智能体,它们都可以这样做。如果增加成员,你无需重新训练团队。

4. 结果:他们证明了什么?

作者在三种不同的场景中测试了这种方法:

  • "XOR"游戏(完美测试):两个智能体必须选择相反的行动才能获胜。

    • 旧方法:智能体不断选择相同的行动,100% 失败(或者只是随机猜测,50% 获胜)。
    • 钻石注意力:智能体利用随机数字瞬间决定谁选“左”谁选“右”。它们100% 获胜。
    • 关键发现:如果你移除“随机数”规则,仅使用标准噪声(如随机丢弃网络部分),它们会再次失败。这证明了随机顺序的结构才是关键,而不仅仅是噪声本身。
  • “觅食”游戏(规模扩展):一个智能体团队必须收集食物。

    • 他们用 4 个智能体 训练了团队。
    • 他们在 2 到 8 个智能体 的情况下进行了测试,无需任何重新训练。
    • 结果:团队在任何规模下都完美运作。随机层级结构使它们能够自我组织,无论有多少队友出现。
  • “星际争霸”测试(困难模式):一个复杂的战争游戏,它们与敌人作战。

    • 它们在一个地图上训练,并在一个完全不同的、更难的地图上进行测试,敌人数量也不同。
    • 结果:标准 AI 完全失败。钻石注意力成功迁移了其技能,赢得了约 50% 的比赛。
    • 关键细节:当他们移除了“结构化随机掩码”时,胜率降至 0%。这证实了它们利用随机性进行自我组织的特定方式是秘诀,而不仅仅是通用随机性。

总结

本文认为,为了让相同的智能体在没有老板或固定 ID 的情况下协同工作,它们需要一种瞬间打破僵局的方法。钻石注意力为它们每秒提供一个“随机数”,临时决定谁领导、谁跟随。这使得它们能够完美协调,规模可大可小,并适应新情况,而无需重新训练。

核心启示:有时,为了完美协作,你不需要严格的计划;你只需要一种共享的随机方式,来决定此刻谁先领导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →