← 最新论文
💻 computer science

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP 是一种通过将无需训练的物理启发式探索层集成到代码即策略(code-as-policy)框架中的新型智能体,通过双智能体规划与优先级排序系统,实现高效且具针对性的信息寻求,从而推断质量和刚度等潜在物体属性,以此增强机器人操控能力。

原作者: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是可见世界的专家。如果一项任务涉及将杯子从桌子移到水槽,现代机器人通常能够看到杯子、规划路径,并以令人印象深刻的优雅姿态执行移动。这种成功依赖于视觉-语言-动作策略(vision-language-action policies),即通过观察人类执行任务并模仿其动作来进行学习的系统。然而,这些系统存在一个根本性的局限:它们只能看到表面。它们无法感知易拉罐的重量以判断其是否为空,也无法感知水果的硬度以判断其是否成熟。在现实世界中,许多任务都取决于这些隐藏的物理属性。一个正在清理厨房的人可能会摇晃苏打罐以听取其是否为空,或者挤压牛至以检查其成熟度,利用触觉和听觉来填补视觉留下的空白。如果没有这种主动寻求隐藏信息的能力,机器人对于那些决定任务成败的关键细节仍然是“盲目”的。

国立台湾大学和 NVIDIA 的研究人员开发了一种新方法来弥补这一差距,创建了一个被称为 PhysCaP 的系统。该系统教会机器人像好奇的人类一样行动,将编写自身指令的能力与一种新的物理探索能力相结合。PhysCaP 不仅仅是观察和模仿,它被设计为向物理世界“提问”。当面对一张答案隐藏在物体之下的桌子时,机器人不会进行猜测。它会决定进行交互,通过拿起或挤压物品来收集所需的特定数据。该系统建立在“代码即策略”(code-as-policy)框架之上,这意味着机器人生成可执行的计算机代码来控制其运动,使其能够像人类规划一系列动作一样进行逻辑推理。PhysCaP 的独特之处在于它增加了一个物理启发式探索层(physics-informed exploration layer)。这一层允许机器人仅通过其电机和关节的反馈来估算质量和刚度等属性,而无需使用像触觉皮肤或秤之类的特殊传感器。

这个新系统的核心是一个管理“过早行动”与“浪费时间”之间微妙平衡的双智能体设计。其中一个智能体是“规划器”(Planner),它观察场景并决定机器人是否拥有完成工作所需的信息。如果信息缺失,规划器会创建一个潜在行动列表以寻找信息。第二个智能体是“优先级排序器”(Prioritizer),它随后审查此列表,并根据视觉线索对行动进行排序。例如,如果任务是在四个罐子中找到一个空的苏打罐,优先级排序器会注意到两个罐子是密封的,而另外两个插着吸管。它逻辑地推断出密封的罐子很可能是满的,因此优先检查打开的那些。这防止了机器人将能量浪费在不太可能包含答案的物体上。一旦机器人收集到足够的证据,系统就会停止探索并执行最终任务。

为了测试这一想法,研究人员在真实的桌面上设置了三个不同的挑战。在第一个任务中,一个蓝色立方体被隐藏在三个杯子之一之下,但其中一个杯子太小,无法容纳该立方体。依赖纯视觉的机器人可能会拿起所有的杯子,但 PhysCaP 利用其推理能力看到了尺寸差异,并跳过了不可能的杯子,只拿起了可行的候选者。在另一个任务中,机器人必须在四个苏打罐中找到一个空的。利用其通过电机反馈测量重量的能力,它成功识别出了空的罐子。在第三个任务中,它必须从一群绿色和深色的牛至中挑选出一个成熟的。通过挤压深色的牛至来测量其硬度,它选择了成熟的,同时忽略了坚硬未熟的水果。在所有这些场景中,该系统都在其他方法失败的地方取得了成功。仅依赖视觉的机器人无法解决这些任务,因为它们无法看到隐藏的属性;而能够测量属性但缺乏优先级排序推理能力的机器人,则会检查每一个物体,导致耗时更长且消耗更多能量。

结果显示,PhysCaP 能够以极高的成功率完成这些任务,同时与竞争对手相比,与之交互的物体数量更少。在现实世界的测试中,该系统通过比盲目检查所有物体的系统更少的物理接触和更短的时间,找到了隐藏的立方体、空的罐子和成熟的牛至。研究人员还进行了模拟实验,以观察该系统在数字环境中的表现,结果同样成立:这个能够推理何时测量以及何时停止的系统,其表现优于那些仅仅尝试猜测或检查一切的模型。这项研究证实,对于机器人要在混乱、不可预测的现实世界中真正运作,它们必须能够主动寻求视觉无法揭示的物理真相。通过赋予机器人提出正确问题并倾听物理世界所提供的答案的能力,这项研究让我们离能够处理人类生活中细微、触觉复杂性的机器又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →