← 最新论文
🤖 machine learning

CooT: Learning to Coordinate In-Context with Coordination Transformers

CooT 是一个新颖的框架,它利用上下文学习使多智能体系统能够在无需参数更新的情况下快速且稳健地适应陌生伙伴,并在 Overcooked 和 Google Research Football 等基准测试中超越了现有的基于种群、微调和元强化学习方法。

原作者: Huai-Chih Wang, Hsiang-Chun Chuang, Hsi-Chun Cheng, Dai-Jie Wu, Shao-Hua Sun

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Huai-Chih Wang, Hsiang-Chun Chuang, Hsi-Chun Cheng, Dai-Jie Wu, Shao-Hua Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于**CooT(协调 Transformer)**论文的通俗解释,辅以日常类比。

核心难题:“新搭档”困境

想象你是一名专业舞者。你已花费数年与固定搭档练习,完全了解他们的动作、旋转时机以及反应方式。你们配合得天衣无缝。

现在,想象你突然被安排与一位陌生人参加舞蹈对决。你完全不了解他们的风格。他们可能动作缓慢、迅速,或者笨拙。

  • 旧有的 AI 方法就像那些只与特定一位搭档练习过的舞者。当遇到陌生人时,他们要么试图强迫对方按自己的方式跳舞,要么因为不知步法而僵住不动。
  • 其他方法则试图通过与新搭档跳上数小时(数千次)来学习其风格。这既缓慢又昂贵,尤其是当你们只有几分钟共舞时间时。

本文的目标是教会 AI 如何在仅经过几步互动后,瞬间“读懂”新搭档并与之同步共舞,而无需从头重新学习如何跳舞。

解决方案:CooT(“情境”舞者)

作者创建了一个名为CooT(Coordination Transformer,协调 Transformer)的新 AI 框架。

请将 CooT 想象成一位极具观察力的即兴表演者,而非死记硬背舞步的舞者。

  1. 它是如何学习的(训练阶段):
    在大型舞蹈对决之前,CooT 观看了成千上万对不同舞伴的视频。它不仅仅观察动作,更观察关系

    • 它看到搭档 A(喜欢向左旋转),并观察搭档 B(“最佳响应者”)如何调整向右旋转以配合。
    • 它看到搭档 C(动作缓慢),并观察搭档 D 如何耐心等待。
    • 类比: CooT 就像一位看过世间所有类型舞伴组合的学生。他们尚未与共舞,但他们已经观察过人们如何对的舞蹈风格做出反应。
  2. 它是如何工作的(“上下文”魔法):
    当 CooT 遇到新的人类或 AI 搭档时,它不会改变其大脑(即不进行“再训练”)。相反,它利用上下文学习(In-Context Learning)

    • 类比: 想象 CooT 有一个“草稿纸”(上下文窗口)。当你们共舞时,它会将过去几秒内你刚刚做的动作记录在这张草稿纸上。
    • 当它需要决定下一步动作时,它会查看草稿纸:“哦,我的搭档刚刚向左移动了。在我观看的视频中,当搭档向左移动时,最佳对策是向右迈步。”
    • 它利用这些最近的观察结果,瞬间推测出你的风格并做出适应。

这为何比旧方法更好?

  • 对比“自博弈”(与自己练习):
    旧 AI 通过与自己的镜像共舞来练习。它们非常擅长与自己共舞,但与陌生人共舞时却表现糟糕。CooT 学会与所有人共舞。
  • 对比“微调”(边做边学):
    有些 AI 试图通过与你共舞数小时、不断犯错并修正来学习。这非常缓慢。CooT 则像一位天才,只需一两首歌的时间,仅通过观察你就能摸清你的风格。它能瞬间适应,而无需“重新训练”其大脑。
  • 对比“群体”方法(试图精通一切):
    其他 AI 试图通过与一大群随机搭档训练,成为“万事通”。但如果你遇到一个真正古怪的人,它们仍可能失败。CooT 会观察你具体的近期动作,并专门针对进行适应。

结果:它奏效了吗?

研究人员在两个截然不同的“舞池”中测试了 CooT:

  1. Overcooked(煮过头): 一款混乱的电子游戏,两名厨师必须在狭小的厨房里共同煮汤。(类似于高压的厨房轮班)。
  2. Google Research Football(谷歌研究足球): 一款足球游戏,球员必须配合传球和跑位。(类似于团队运动)。

研究发现:

  • 速度: CooT 几乎立即开始良好配合,并随着游戏进行表现越来越好。
  • 人类测试: 当真实人类与 CooT 共舞时,他们将其评为最佳搭档。他们感觉 CooT 理解他们、适应他们的风格,且不会碍手碍脚。
  • 韧性: 如果搭档突然改变策略(例如,停止传球并开始独自奔跑),CooT 会在接下来的几秒内察觉这一变化,并立即调整其计划。

总结

CooT 是 AI 与人类或其他 AI 协作的一种新方式。CooT 不像强迫所有人学习相同僵化规则那样,而是像变色龙一样行动。它观察与其协作的人,记住其近期行为,并瞬间调整自身行为以完美匹配对方。

这就好比区别在于:一个机器人说“我将执行预编程的舞蹈”,而另一个机器人说“我看到你向左移动,所以我会向右移动来帮助你”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →