GroundAct: Can LLM Agents Ground Actions in Environmental States?
本文介绍了 GroundAct,这是一个综合性基准测试,表明当指令省略可行性细节时,大语言模型智能体难以将行动与环境状态相联系,从而揭示这一多维挑战无法仅靠规模扩展来解决,而需要属性、工具和协调推理方面的特定能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位非常聪明的机器人助手来帮你打扫房间。你给它一个简单的指令:“清理工作台。”
人类会立刻审视眼前的混乱,并意识到三件事:
- 那个咖啡杯很轻,可以单手拿起。
- 那卷 50 公斤重的电缆太重了,一个人搬不动;你需要找朋友帮忙。
- 那个咖啡渍需要用布擦掉;你不能直接用手去抓。
论文《GroundAct》指出,虽然当前的人工智能模型(大语言模型)在答案显而易见时非常擅长遵循指令,但当它们必须自行推断物理世界的规则时,往往会失败。它们可能会试图独自搬起那卷沉重的电缆,失败后便直接说“好了,我完成了”,而没有意识到自己需要工具或帮手。
作者将这种缺失的技能称为“行动具身化”(Action Grounding)。它是指观察环境、理解隐藏约束(如重量、温度或工具需求),并判断实际可行操作的能力。
三种“具身化”类型
研究人员将这一概念分解为三项具体技能,并巧妙地借用电子游戏作为类比:
属性推理(“比较”技能):
- 场景: “拿起最重的箱子。”
- AI 挑战: AI 不能只寻找标有“重”的箱子。它必须查看所有箱子,比较它们的重量(这些是具体数值,而不仅仅是“重”或“轻”),并通过计算找出胜者。
- 比喻: 这就像被要求在人群中找出最高的人。你不能只寻找“高”的标签,而必须将每个人相互比较测量。
工具推理(“解锁”技能):
- 场景: “清理污渍。”
- AI 挑战: AI 并没有一个现成的“清理”按钮。它必须意识到:“我不能徒手清理。我得先找一块布。”一旦抓起布,它就“解锁”了清理的能力。如果它丢掉了布,就会失去这种能力。
- 比喻: 想象一款电子游戏,在你找到钥匙之前无法打开锁着的门。AI 必须意识到门是锁着的,找到钥匙,然后知道这把钥匙现在能让它打开门。
协调推理(“团队合作”技能):
- 场景: “搬钢琴。”
- AI 挑战: 指令中并没有说“寻求帮助”。AI 必须观察钢琴的重量,意识到一个机器人搬不动,并主动请求第二个机器人帮忙。
- 比喻: 这就像试图搬动沙发。如果你试图独自搬起却失败了,聪明的人会意识到“我需要个帮手”,然后叫人来帮忙。而不太聪明的人则会继续独自尝试搬动,直到放弃。
新测试:GroundAct
为了测试 AI 是否具备这些技能,研究团队构建了一个名为GroundAct的大型测试套件。
- 设置: 为了避开真实 3D 机器人(速度慢且昂贵)的局限,他们构建了一个基于文本的模拟环境。想象一下对房间进行极其详细的文字描述,列出每个物体、其重量、颜色及位置。
- 规模: 他们创建了 1,500 个不同的“房间”和超过 16,000 个不同的任务,范围从简单指令(“把杯子放这里”)到复杂谜题(“清理最重的桌子,但你需要一块布和一个伙伴”)。
- 转折: 指令中从未告知 AI 关于重量限制或工具需求的信息。AI 必须从环境描述中推断出来。
他们的发现
研究人员测试了 15 种不同的 AI 模型(从小型到超大型超级智能模型),发现了一些令人惊讶的结果:
- “聪明”并不意味着“具身化”: 一个模型可能在数学和逻辑(属性推理)方面表现出色,但在意识到需要工具或伙伴方面却表现糟糕。反之亦然,一个模型可能在团队合作方面很出色,但在比较重量方面却很差。这是不同的技能,而不仅仅是“更多的智能”。
- 知晓一切可能是一件坏事: 当他们给 AI 提供一张包含房间完整地图的“小抄”(不隐藏任何信息)时,它在寻找工具方面表现更好(因为它无需搜索)。但在团队合作方面却变差了!为什么?因为看到每一个细节分散了它的注意力,使其忽略了“这个物体太重了”这一简单事实。它迷失在噪音中。
- 训练存在局限: 他们试图通过向小型 AI 模型展示任务示例来“教导”它。该模型在遵循直接指令(如“拿起杯子”)方面有了很大进步。但在判断何时寻求帮助方面几乎没有改善。它学会了做什么,但没学会何时改变策略。
核心结论
该论文得出结论:仅仅让 AI 模型变得更大或在更多数据上进行训练,不足以使其真正具备“具身化”能力(即与物理世界互动)。
要构建一个能在凌乱的房子里真正帮上忙的机器人,我们需要教会它将行动扎根于现实。它需要学会,世界存在着规则(重力、重量、工具需求),这些规则并未写在操作手册中,而是隐藏于环境本身。在 AI 能够做到这一点之前,它将仍然是一个出色的交谈者,但在实际干活方面却一塌糊涂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。