← 最新论文
🤖 AI

Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning

本文证明,异构视觉智能体仅通过去中心化学习与局部感知评估即可发展出共享且富含信息的通信符号,而所形成语言的特异性与对称性直接由它们底层视觉表征的相似性所塑造。

原作者: Mikako Ochiai, Masatoshi Nagano, Tadahiro Taniguchi

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mikako Ochiai, Masatoshi Nagano, Tadahiro Taniguchi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象两个人试图互相描述一幅画,但他们戴着不同种类的“魔法眼镜”。

  • A 人戴着能看清世界锐利、高清细节的眼镜。
  • B 人戴着能看到世界略显模糊、低分辨率风格的眼镜。

两人都无法透过对方的眼镜看到对方眼中的景象。他们只能通过自己的镜片观察这幅画。他们的目标是商定一套描述这幅画的秘密代码(一组数字),以便当 A 说出代码时,B 能确切知道 A 看到的是哪幅画,反之亦然。

这就是论文中的核心实验:两个拥有不同“视觉”的智能体,能否在没有教师告知对错的情况下,学会说同一种语言?

游戏:“猜测或拒绝”

教师不再负责评分,智能体们玩一种名为**梅特罗波利斯 - 黑斯廷斯图像描述游戏(MHCG)**的游戏。其运作方式如下:

  1. 说话者:智能体 A 透过自己的眼镜观察照片,并想出一个他们认为能描述该照片的秘密代码(一串数字)。
  2. 倾听者:智能体 B 透过他们自己不同的眼镜观察同一张照片。他们也会生成自己的代码。
  3. 决策:智能体 B 必须决定:"A 的代码是否很好地描述了眼中的这张照片?”
    • 如果 B 认为“是的,这个代码很符合我的画面”,他们就接受它。
    • 如果他们认为“不,这个代码不符合我的画面”,他们就拒绝它,并保留自己的代码。
  4. 学习:经过数千轮回合,他们互换角色。他们仅基于那些被接受的代码来更新自己的“大脑”(文本生成器)。他们纯粹通过检查对方的猜测是否对自己有意义,来学习一种适用于两套眼镜的语言。

他们的发现

研究人员在三种场景下测试了这一点:

1. 双胞胎(相同的眼镜)
当两个智能体佩戴完全相同的眼镜时,他们迅速学会了一种丰富、详细的语言。他们可以描述许多不同的事物,并且彼此完全理解。

2. 中度不匹配(略有不同的眼镜)
当一个智能体佩戴高清眼镜,而另一个佩戴分辨率略低的眼镜时,他们仍然学会了沟通。

  • 结果:他们发展出了较小的词汇量。他们同意的具体代码数量不如双胞胎那么多。
  • 转折:然而,他们确实达成一致的代码非常精确。他们只保留了那些清晰到两种眼镜都能看到的描述。这就像他们同意只谈论“巨大、明显的事物”(如“一只狗”或“一辆车”),而忽略了只有一副眼镜能看到的微小细节。

3. 巨大不匹配(非常不同的眼镜)
当智能体拥有非常不同的眼镜(一副高清,一副完全不同的架构)时,沟通变得困难得多。

  • 结果:他们学会的代码非常少。他们学会的代码是“粗糙”的(模糊的)。
  • 偏差:语言变得不平衡。它开始更像拥有“更强”眼镜的智能体的语言。拥有较弱眼镜的智能体必须更多地适应较强一方看待世界的方式。这种语言并非公平的混合体,而是严重偏向一方。

秘密武器:“倾听者的直觉检查”

论文发现,这个游戏最关键的部分是倾听者说“不”的能力

如果研究人员强迫倾听者接受说话者提供的每一个代码,智能体们就会开始一遍又一遍地重复同样无聊的代码(例如对每幅画都说"1-1-1-1-1")。“拒绝”步骤对于迫使他们找到真正承载有用视觉信息的代码是必要的。倾听者内部的“直觉检查”(将其代码与自己的视觉数据进行评估)是防止语言崩溃为胡言乱语的唯一因素。

主要结论

这篇论文证明,共享的符号可以从私人的、不同的经验中涌现。你不需要共享的教师或共享的目标来创造一种共同语言。你只需要两个智能体不断检查某个猜测是否符合他们自己对世界的私人视角。

然而,他们的视角差异越大,他们的语言就越简单、越片面。他们仍然可以交流,但必须在细节上做出妥协,而由此产生的语言往往更多地反映了“更强”观察者的视角,而非较弱的一方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →