Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita
本文介绍了 Incognita,这是一个用于评估在知识分布于角色隔离实体之上的社会化分布式任务环境中生成式智能体的框架,并证明了尽管目前的模型在知识启发和减少过早完结等行为方面表现有所提升,但其整体成功率仍然较低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:“秘密配方”难题
想象一下,你正试图烤制一个复杂的蛋糕,但你并没有完整的食谱。相反,原料和指令分散在房间里的五个人手中:
- 人物 A 知道客户的姓名和地址。
- 人物 B 知道库存中有哪些蛋糕。
- 人物 C 知道如何处理退款。
- 人物 D 知道修改订单的规则。
- 人物 E 是客户,他只知道自己想买什么,并不了解技术细节。
如果你(AI 智能体)只是向人物 A 询问地址,你无法烤好蛋糕。你必须先找人物 B 检查库存,然后找人物 C 处理付款,以此类推。如果你靠猜测配方,或者过早停止交谈,蛋糕就会失败。
这篇论文介绍了一种测试 AI 智能体的新方法,名为 Incognita。它迫使 AI 玩这场“知识分散”的游戏,以观察它们是否真的能在社交环境中解决问题,而不仅仅是遵循单一的指令列表。
实验设置:一个新的游戏版图
研究人员采用了现有的一个测试(称为 tau-bench,类似于 AI 的标准驾驶测试),并将其拆解。他们将一个单一的“全知”系统变成了一个社交分布式任务环境(Socially Distributed Task Environment)。
可以这样理解:
- 旧方式: AI 坐在一个拥有巨型地图和直接连接仓库电话的控制室里。它可以瞬间看到一切并做任何事。
- Incognita 方式: AI 身处一个繁忙的办公室。它一次只能向特定的同事(专家实体)或客户发送一条短信。除非它询问正确的人,否则它无法看到仓库或客户的私人笔记。
游戏规则
AI 在这个环境中扮演三个截然不同的角色:
探索者(提问):
AI 必须弄清楚谁知道什么。它通过向“客户”(持有目标的人)和“专家”(持有数据的人)提问来获取信息。这就像侦探通过询问证人来构建案件。AI 逐渐明白,它不能靠猜,必须收集线索。执行者(采取行动):
一旦 AI 掌握了足够的线索,它就必须采取行动。但它不能直接“做”事情,而是必须请求一位专家执行特定任务(例如“修改收货地址”)。系统会检查该请求是否合理。如果 AI 尝试为一个尚未发货的订单修改地址,系统会说“不行”。这确保了 AI 的行为是**基于现实(grounded)**的,而不是凭空幻觉出来的。裁判(决定何时停止):
最难的部分是判断工作何时完成。AI 必须决定:“好了,我已经掌握了所有信息,也完成了工作。我可以结束了。”如果 AI 过早结束(过早完结),它会失败;如果它不停地没完没了地提问,它也会失败。
研究发现
研究人员在 18 个不同的任务上测试了三个版本的 AI(我们称之为“初级”、“中级”和“高级”智能体)。
- 初级智能体: 它非常缺乏耐心。它试图立即完成任务,而不询问任何人。它 100% 失败了,因为它既不知道规则,也不了解客户的需求。
- 中级智能体: 它开始提问并与更多人交谈。它完成了一些任务(成功率约 9%),但有时仍然会过快放弃。
- 高级智能体: 这个智能体在探索方面表现得更好。它与更多的专家交谈,提出了更深入的问题,并尝试了更多行动。它的成功率约为 17%。
关键启示:
即使是“高级”智能体也不完美。它的失败次数仍然多于成功次数。然而,论文表明进步体现在行为中,而不仅仅是最终得分。 更聪明的智能体不仅更频繁地获得正确答案,它们还改变了工作方式:
- 它们请求了更多的隐藏信息。
- 它们联系了更多不同的人。
- 它们尝试了更多真实的动作(如更新数据库)。
- 它们停止了猜测,并在拥有足够证据后再说:“我完成了。”
为什么这很重要
论文认为,我们不能仅仅通过观察 AI 是否完成了任务来判断它是否“聪明”。我们需要观察它如何与世界互动。
在现实世界中,知识是分散的。没有一个人(或一个 AI)知道全部。要成为真正高效的 AI,它需要知道:
- 何时提问(探索)。
- 问谁(来源选择)。
- 何时行动(基于现实的执行)。
- 何时停止(对完成的信念)。
Incognita 是一个工具,让我们能够实时观察这四种情况的发生,从而准确展示 AI 智能体在哪里卡住了,以及它们是如何学习变得更好的。
一句话总结
这篇论文构建了一个新的测试场,要求 AI 智能体通过与不同的“专家”交谈来收集分散的信息以解决问题,证明了更聪明的智能体会学会提出更好的问题,并等待正确的时机采取行动,即便它们并不总是能完美地达成最终结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。