Nash without Numbers: A Social Choice Approach to Mixed Equilibria in Context-Ordinal Games
本文通过将数值效用替换为经由社会选择理论聚合的序数偏好排序,将纳什均衡推广至“情境序数”博弈,从而确立了直接源于人类偏好而无需精确效用提取的均衡的存在条件、复杂度界限及学习规则。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图找出像“石头剪刀布”这样的游戏中最佳的一步棋,但你没有记分牌。你不知道获胜得"10 分”、失败得"0 分”。你只知道自己的感受:“我更喜欢赢而不是平局,更喜欢平局而不是输。”
几十年来,博弈论(策略的数学)一直受困于此。著名的“纳什均衡”——即无人愿意改变其策略的状态——通常要求知晓那些精确的分数值。如果没有这些数字,数学模型就会失效。
这篇题为《无数字的纳什》("Nash without Numbers")的论文提出了一种巧妙的解决方法。它建议我们停止试图编造虚假的数字,转而利用投票理论(社会选择)的工具来寻找最佳策略。
以下是他们想法的分解,使用简单的类比:
1. 问题:“沉默”的游戏
在正常游戏中,如果你的对手 25% 的时间出石头,30% 出布,45% 出剪刀,你会计算你每种可能移动的“预期得分”。然后你选择得分最高的那个。
但在这种新设定下,你无法计算得分。你只有一份偏好列表。如果对手出石头,你可能会说:“我更喜欢布胜过剪刀胜过石头。”如果对手出布,你可能会说:“我更喜欢剪刀胜过石头胜过布。”
旧数学问:“平均得分是多少?”
新数学问:“如果我们在所有这些不同情境中进行投票,谁会获胜?”
2. 解决方案:“大众投票”隐喻
作者设想了一个场景,其中对手的混合策略(他们随机混合的移动)创造了一个选民群体。
- 类比:想象对手的策略是一份天气预报。25% 晴天,30% 多云,45% 雨天。
- 投票:对于每种天气类型,你对穿什么有不同的偏好。
- 如果是晴天,你投票:“短裤 > 牛仔裤 > 大衣。”
- 如果是多云,你投票:“牛仔裤 > 短裤 > 大衣。”
- 如果是雨天,你投票:“大衣 > 牛仔裤 > 短裤。”
- 选举:现在,想象一场大规模选举,其中 25% 的选民是“晴天选民”,30% 是“多云选民”,45% 是“雨天选民”。
- 获胜者:你不计算平均温度。相反,你在这个群体上运行一个投票规则(如博尔达计数法或最大概率法)。赢得选举的物品就是你的“最佳应对”。
这篇论文称之为情境序数纳什均衡(Context-Ordinal Nash Equilibrium)。这是一个稳定状态,在这种状态下,如果每个人都玩他们的“投票获胜者”,就没有人有动力改变策略。
3. 为何重要:现实世界的人类
论文认为,这就是人类在许多情况下的实际思维方式。
- 选举:选民通常不会说:“我给候选人 A 打 8.4 分,给候选人 B 打 7.9 分。”他们只是排名:“A > B > C。”
- AI 评估:在测试 AI 智能体时,我们通常只知道某个智能体在特定游戏中“更好”,但没有通用的记分牌来在所有游戏中比较它们。
作者在两个现实世界场景中测试了这种方法:
- 视频游戏智能体:他们评估了玩 Atari 游戏的 AI 智能体。他们没有使用原始分数,而是根据智能体在不同任务中的表现对它们进行排名。他们的新方法发现了一个稳定的“最佳”智能体组合,该组合对任何对手都具有鲁棒性。
- 人类领导选举:他们分析了“海上迷失”实验中群体选举领导人的数据。他们发现,人类通常没有以符合完美均衡的方式投票(他们犯了错误或以令人困惑的方式采取策略行动)。然而,他们的新数学可以成功计算出在那个混乱的现实世界场景中,“完美”的策略性投票会是什么样子。
4. “正则化”技巧
一个技术障碍是投票可能是“跳跃式”的。如果多一个人改变投票,获胜者可能会突然从候选人 A 翻转到候选人 B。这使得学习或寻找均衡变得困难。
作者引入了一种“正则化”技巧。将其想象为在投票过程中添加一点点噪音或混乱。
- 想象偶尔会有选民感到困惑,随机投票给某个选项,或者“天气预报”稍微有些模糊。
- 这平滑了“跳跃”,使投票结果逐渐变化而不是突然变化。这使得计算机能够使用标准的学习算法(如梯度下降)来寻找均衡,就像它们在带有数字的游戏中所做的那样。
总结
这篇论文用"运行加权选举"取代了"计算平均得分"的概念。
- 旧方法:“如果我出石头,我平均得到 5.2 分。”
- 新方法:“如果我出石头,并且我们根据对手的出招方式进行投票,石头将赢得选举。”
通过这样做,他们创造了一种新型纳什均衡,即使玩家只有排名而没有数字也能发挥作用,证明了即使无需给赢或输分配具体数值,也能找到稳定、理性的策略。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。