GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes
该论文介绍了 GPTNT,这是一个基于游戏《保持通话,无人爆炸》(Keep Talking and Nobody Explodes)构建的实时协作基准测试,它揭示了当前多模态智能体在处理时间压力、信息不对称和动态通信方面的关键缺陷,因为与人类玩家相比,测试中的所有模型都未能成功拆除哪怕一个炸弹。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场在着火建筑中进行的、高风险版本的“传声筒”游戏,但其中有一个转折:一个人被蒙着眼睛并抱着一个滴答作响的定时炸弹,而另一个人被锁在另一个房间里,手里拿着一本巨大的说明书,却完全看不见炸弹。
这正是现实世界中电子游戏《保持沟通,没人爆炸》(Keep Talking and Nobody Explodes, 简称 KTANE)背后的场景。研究人员已将这款游戏变成了一项严谨的 AI 测试,并将这个新基准命名为 gptnt。
以下是利用日常类比对他们所做的工作、发现以及其重要性进行的简单拆解。
设置:一场高速接力赛
在游戏中,两名玩家必须合作在计时器归零前拆除炸弹。
- 拆解者(Defuser): 能看到炸弹(上面有电线、按钮和闪烁的灯),但不知道该如何剪断它们。他们只能描述自己所看到的内容。
- 专家(Expert): 拥有包含所有规则的手册,但对炸弹一无所知。他们必须根据描述告诉拆解者具体该做什么。
AI 挑战: 研究人员用 AI 模型取代了人类玩家。他们建立了一个“实时”环境,即使 AI 在“思考”和输入回复时,炸弹的计时器也会持续跳动。这意味着 AI 不仅仅是在解谜;它是在与时间赛跑,同时试图理解一个它看不见的伙伴。
重大发现:AI 卡住了
研究人员测试了目前最智能的 AI 模型(包括 GPT-5、Claude 和 Gemini 等巨头)。结果令人惊讶,甚至可以说让 AI 显得有些尴尬:
- 人类获胜: 即使是从未玩过这款游戏的真人组合,也能解决大约 10 个炸弹中的 3 个。
- AI 失败: 零个 AI 模型能在实时环境下拆除哪怕一个炸弹。一个都没有。
这就像把一个超智能机器人放在一个带着滴答作响的炸弹的房间里,并给它一本手册,但机器人却因为无法与伙伴进行足够快速的协调,而陷入僵局、感到困惑,或者剪错了电线。
为什么 AI 会失败?
论文深入探讨了 为什么 AI 会挣扎,并使用了一些形象的比喻来识别四个主要的“瓶颈”:
“思考太久”的问题:
在真实的比赛中,AI 每花一秒钟“思考”(生成文本),炸弹的计时器就减少一秒。AI 模型往往会过度思考,写出冗长、啰嗦的解释,而不是简洁明了的指令。等到它们打完字,炸弹已经爆炸了。- 类比: 想象你在解一道数学题,同时有人在往你的纸上浇水。如果你花太长时间写答案,纸就会湿透,答案也就丢了。
“翻译丢失”的问题:
拆解者 AI 必须向专家 AI 描述一个复杂的 3D 物体(炸弹)。AI 经常出错。它可能会说:“有三根红色的电线”,但实际上有四根;或者它可能会完全忽略一个闪烁的灯。- 类比: 这就像是通过一个很差的电话连接向朋友描述一种特定的蓝色。如果你把颜色说错了一点点,你的朋友就会买错油漆,最后墙面的颜色看起来就很糟糕。
“记忆黑洞”的问题:
有些谜题需要记住一系列事件(例如:“我按了红按钮,然后按了蓝按钮,现在我需要按绿色的”)。AI 模型经常会忘记两步之前发生了什么。- 类比: 这就像是在遵循食谱操作,却忘记了你已经加了盐,结果又加了一次,把菜给搞砸了。
“幻觉”问题:
有时,AI 会凭空捏造事实。拆解者可能会说:“我看到一个电池”,但那里其实并没有电池。专家 AI 信任其伙伴,于是基于一个并不存在的电池给出了指令。- 类比: 这就像是一个导游自信满满地对游客说:“看那座著名的雕像!”但实际上那里只有一面白墙。游客们感到困惑,而导游还在继续说着。
“单人”测试:它们是作弊了吗?
研究人员想知道:“也许这些 AI 只是从训练数据中背下了游戏手册?”为了测试这一点,他们同时把炸弹和手册都给了 AI(从而无需配合伙伴)。
- 结果: AI 的表现好多了,但仍不完美。这证明了虽然 AI 确实从训练中了解了一些规则,但在实际观察炸弹、计数电线以及正确按下按钮方面仍然存在困难。
总结
论文的结论是,虽然 AI 擅长阅读书籍和观察图片,但实时团队协作是另一回事。
目前的 AI 模型就像是那些能考出高分的优秀学生,但当被要求在一个嘈杂、节奏极快的小组项目中工作,且必须同时倾听、说话并行动时,它们就会陷入恐慌。研究人员构建 gptnt 是为了作为一个“动态”测试:随着 AI 变得越来越聪明,他们可以把炸弹变得更难,把时间限制缩得更紧,从而确保这项测试永远不会变得过于简单。
简而言之:AI 可以阅读手册,但它仍然无法与伙伴协作来拆除炸弹。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。