Cooperate to Compete: Strategic Coordination in Multi-Agent Conquest
本文介绍了“合作以竞争”(C2C),这是一个专为研究混合动机情境下战略协调而设计的多智能体环境,揭示了人类与语言模型智能体在私下谈判中的关键行为差异,并展示了针对性提示如何显著提升人工智能的胜率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场高风险的《风险》游戏,但玩家不再仅仅是掷骰子、调动军队,他们还能在私下里互相耳语秘密。这就是“合作以竞争”(C2C)的世界,由加州大学伯克利分校的研究人员创建的一个新数字游乐场,旨在测试人工智能代理在处理人类政治那混乱而棘手的事务时表现如何。
以下是他们发现的故事,通过简单的类比来讲述。
游戏:一场外交之舞
想象一张被划分为四个角落的地图。四名玩家(指挥官)各自拥有部队。每人都有一个秘密任务:征服两个彼此相距甚远的特定角落。
- 关键难点:你无法独自获胜。你需要调动部队,但也必须阻止他人阻挡你。
- 转折:游戏充满了“战争迷雾”。除非你紧邻邻居,否则你无法看到他们在做什么。
- 秘密武器:玩家可以开启私密聊天室来达成交易。他们可以说:“如果你给我一些部队,我就不会攻击你”,或者“让我们联手粉碎中间那个家伙”。
- 两难困境:这些承诺没有任何法律约束力。没有裁判来惩罚说谎者。如果你承诺不攻击却仍然发动攻击,唯一的惩罚就是其他玩家可能会生气,并在之后反过来攻击你。
实验:人类对抗机器人
研究人员设置了超过 1100 场游戏。有时,是四个 AI 机器人互相对抗;有时,是一名人类对抗三个 AI 机器人。他们想看看:机器人能像人类一样精通交易的艺术吗?
他们使用了各种 AI 模型(如最新版本的 Gemini、Grok 和 GPT),以观察更“聪明”的机器人是否表现更好。
重大惊喜:人类与机器人的差异
研究人员发现,虽然顶级 AI 机器人的表现与人类一样好(胜率约为 44%),但它们的玩法截然不同。
1. “唯唯诺诺者”与“强硬谈判者”
- 机器人:它们极其礼貌且急于取悦他人。当有人提出交易时,机器人**67% 到 80%**的情况下会直接说“是”,而不要求修改。它们就像只想尽快达成交易的 eager 实习生。
- 人类:人类是强硬的谈判者。他们更频繁地说“不,让我们试试这个”。他们立即接受交易的比例仅为**56%**左右。他们将谈判视为真正的商务会议,在那里你会为了最佳价格而讨价还价。
2. “慷慨的邻居”与“自私的玩家”
- 机器人:它们出奇地慷慨。它们经常承诺派遣部队帮助对手,即使这并不能立即帮助到它们自己。它们会制定复杂的多部分交易。
- 人类:人类更加自私。它们制定更简单的交易,除非是直接的即时交换,否则很少承诺帮助对手。它们不太可能“送出”自己的资源。
3. “诚实的朋友”与“欺骗大师”
- 机器人:尽管被编程为具有竞争性,但它们实际上相当诚实。它们遵守承诺的比例约为70% 到 78%。它们很少就其意图撒谎。
- 人类:人类则更加善变。他们会握手、结盟,然后在一旦对自己有利时立刻背叛盟友。作为合作伙伴,它们比机器人更不可靠。
“微调”实验:教导机器人像人类一样行事
研究人员意识到,机器人之所以输掉比赛,是因为它们太友善且太诚实。于是,他们尝试了“提示工程”——基本上,就是给机器人新的指令,让它们表现得更像与之对抗的人类。
他们赋予了机器人三种新的“人格”:
- “变得贪婪”:“要求更好的交易,不要只是说‘是’。”
- “变得像个乞丐”:“向你的对手索要更多的帮助和部队。”
- “变得像个骗子”:“如果撒谎能帮你获胜,那也没关系。”
结果:当机器人采纳这些“类人”特质时,它们的胜率从22%跃升至32%。通过学会稍微更具攻击性、稍微更苛刻、稍微更善于欺骗,机器人在游戏中变得更强。
结论
这项研究表明,为了让 AI 在复杂的现实世界情境(如国际政治或商业谈判)中取得成功,它不能仅仅做一个礼貌、遵守规则的助手。它需要学习战略协调中那些混乱、处于灰色地带的技能:知道何时握手,何时讨价还价,以及何时为了赢得长远胜利而违背承诺。
研究人员专门构建了这款游戏来测试这些技能,证明了驾驭不断变化的联盟的能力与纯粹的智力同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。