← 最新论文
💻 computer science

An Entropy-based Framework for Hybrid Coalitions in Game Theory. Part I: Human Arbitration

本文介绍了新博弈论(NeoGame Theory),这是一种基于熵的框架,旨在将经典博弈论扩展到虚拟自然环境下的人机混合联盟,并确立了其第一个范式——人类仲裁,即人工智能通过观察和频率匹配进行学习,而人类保留最终执行权。

原作者: Salome A. Sepulveda-Fontaine, Jose M. Amigo

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Salome A. Sepulveda-Fontaine, Jose M. Amigo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个人类与人工智能(AI)试图共同驾驶同一辆汽车的世界。在传统的“博弈论”(用于研究人类如何做决策的数学)中,我们通常假设驾驶员拥有一套单一且明确的规则来表达其意图。但当人类与 AI 的想法不一致,并且需要决定在任何特定时刻由“谁”来踩油门时,会发生什么呢?

这篇论文引入了一种被称为**“新博弈论”(Neo-Game Theory)**的新思维方式。它是专门为这种权力可以在人类与计算机之间来回切换的“混合型”团队而设计的。

以下是他们利用简单类比对这些理念进行的拆解:

1. 问题所在:“双头”驾驶员

在旧有的规则中,如果人类与 AI 协作,我们通常只是将他们的偏好揉合在一起,取一个大的平均值。但作者认为这是错误的。

  • 类比: 想象一位想要慢速安全驾驶的人类驾驶员,和一位想要快速高效驾驶的 AI 驾驶员。如果你仅仅把他们的欲望取个平均值,你会得到一辆以中速行驶、却对“为何这样做”感到困惑的汽车。
  • 现实情况: 在这个新框架中,汽车并没有一个“揉合后”的偏好。相反,在每一秒钟,要么是人类在控制,要么是 AI 在控制。论文指出,由于“驾驶员”在不断切换,团队的整体行为并不遵循传统数学中那种平滑、逻辑严密的规则。这就像一场接力赛,接力棒传递得如此之快,以至于两名跑手的风格产生了冲突。

2. 解决方案:“虚拟自然”与“交通灯”

论文引入了**“虚拟自然”(Virtual Nature)**的概念。你可以把它理解为电子游戏中“命运”或“随机性”的数字化版本。它是对汽车动作做出反应的环境。

为了决定由谁来驾驶,系统使用了一个基于人类与 AI 之间分歧程度的**“交通灯”。我们使用一种名为詹森-香农散度(Jensen-Shannon Divergence)**的数学工具来衡量这种分歧(我们可以称之为“分歧测量仪”)。

交通灯根据测量仪的数值分为三种颜色:

  • 绿灯(一致): 人类与 AI 的想法几乎完全相同。测量仪数值较低。此时由 AI 驾驶(λ = 0)。
  • 红灯(分歧): 他们的想法差异巨大。测量仪数值较高。此时人类立即接管,以防止发生碰撞(λ = 1)。
  • 黄灯(上下文相关): 他们处于中间状态。这是最棘手的部分。论文建议在这里进行一次“抛硬币”,但这个硬币是经过加权的。如果分歧较大(但还没到极端的程度),人类更有可能夺回方向盘;如果分歧较小,AI 则更有可能继续驾驶。

3. 第一个实验:“人类仲裁”

作者在一个被称为**“人类仲裁”(Human Arbitration)**的特定场景中测试了这一设定。

  • 设定: AI 是学生,人类是老师。AI 通过观察人类的行为来学习人类想要什么。
  • 规则: 只有当 AI 确信自己与人类意见一致时,才被允许驾驶。如果 AI 开始偏离人类的风格,人类就会介入并接管控制权。
  • 结果: 随着时间的推移,AI 学会了匹配人类的驾驶风格。“分歧测量仪”降至接近于零。人类不再需要频繁驾驶,因为 AI 已经学会了如何像人类一样“思考”。

4. “词典序”规则(“谁是老大”规则)

论文提出了一个关键点,即团队如何衡量成功。

  • 旧方法: 我们计算人类的分数和 AI 的分数,然后将它们相加。
  • 新方法: 论文使用了**“词典序”(Lexicographic)**规则。这就像查字典一样。你先看第一个字母,如果第一个字母不同,你甚至不需要看第二个字母。
  • 在车内: 团队首先关心的是**“谁在驾驶”**。如果人类在驾驶,人类的目标最为重要;如果 AI 在驾驶,AI 的目标则最为重要。你不会将两者混合。这创造了一种“停停走走”的逻辑,而非平滑的融合。

5. 模拟实验展示了什么

作者运行了计算机模拟,以观察这套系统是否真的有效。

  • 学习曲线: 起初,人类与 AI 的表现非常混乱(分歧度高)。人类必须频繁接管方向盘。
  • 收敛: 随着 AI 观察人类,它开始模仿人类。其“分歧测量仪”数值下降。
  • 终局: 最终,AI 与人类实现了完美的同步。人类很少需要干预,因为 AI 已经在做人类原本会做的事情。
  • 教训: 特定的设置(AI 学习的速度有多快、规则有多严格)改变了他们学习的速度,但并未改变最终的结果。只要让他们运行足够长的时间,他们总能实现同步。

总结

这篇论文为人类-AI 团队提出了一种新的数学框架。它并没有强迫双方达成单一的“平均”目标,而是让它们根据彼此的契合程度轮流驾驶。

  • 如果一致: 由 AI 驾驶。
  • 如果分歧: 由人类驾驶。
  • 如果不确定: 由加权硬币决定。

其结果是一个通过观察来进行学习的系统,AI 通过观察来模仿人类的风格,最终达到一种高度对齐的状态,从而让渡出控制权,让 AI 处理后续工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →