Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems
本文介绍了 Onto-EV-WM,这是一种以本体为基础的接口,它通过显式追踪未满足的任务谓词并将其与纠错机制相联系,增强了现有的世界模型,从而在 LIBERO 和 PointMaze 等多种物理 AI 基准测试中,实现了闭环故障诊断与修复的高成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:用于故障诊断与闭环修复的 Onto-EV-WM
1. 问题陈述
利用世界模型(如 EV-WM)的物理 AI 系统通过特征向量或事件向量来预测候选未来并进行评分。然而,这些标量分数或事件向量往往缺乏关于“为何”候选方案失败的显式语义信息。具体而言,它们无法记录:
- 特定的任务谓词为何仍未满足(例如,空间关系或关节约束)。
- 与失败相关的类型化参数(typed arguments)。
- 指示应应用哪种纠正机制的路由标签(route label)。
- 基于原生任务谓词的纠正后验收结果。
因此,虽然系统可以识别出低分候选方案,但它缺乏一个结构化的接口来诊断具体的未达标条件、分配兼容的纠正策略,并使用闭环协议验证结果。本文旨在解决高维预测与符号化任务验证之间的鸿隙,目标是在不替换底层世界模型或视觉运动控制器的情况下,提供一个用于诊断和修复的显式接口。
2. 方法论:Onto-EV-WM
作者提出了 Onto-EV-WM,这是一个叠加在现有 EV-WM 架构之上的、基于本体论引导的诊断与验证门控纠正接口。它不是一个替代性的世界模型,而是一个管理从预测到纠正流程的符号层。
2.1 架构与组件
该系统通过涉及三个主要组件的结构化流水线运行:
- 本体记录层(TBox 与 ABox):
- TBox(任务框): 定义了包含实体类型(如物体、区域、关节)、谓词签名(如
in_region、contact)及类型约束的任务局部模式(schema)。它作为特定任务的可重用词汇表。 - ABox(断言框): 实例化当前状态。系统构建了三个针对特定溯源的 ABox:
- :从结构化任务规范 () 中编译而来的必要断言。
- :从世界模型预测输出中提取的断言。
- :直接从模拟器状态中提取的断言。
- TBox(任务框): 定义了包含实体类型(如物体、区域、关节)、谓词签名(如
- 确定性诊断与路由:
- 诊断 (): 将要求的 ABox () 与观测/预测的 ABox 进行比较。它识别未满足的断言 (),并保留特定的谓词、其类型化参数以及任何连续值的边界违反情况。这会生成一个类型化的失败记录(例如:
relation_missing(plate, stove_front))。 - 路由 (): 一个确定性规则库将类型化失败映射到特定的“路由标签”。路由是用于调度兼容纠正机制的派遣标签(例如,“源关节位姿”、“物体关系谓词”),而非直接的机器人动作。
- 诊断 (): 将要求的 ABox () 与观测/预测的 ABox 进行比较。它识别未满足的断言 (),并保留特定的谓词、其类型化参数以及任何连续值的边界违反情况。这会生成一个类型化的失败记录(例如:
- 验证门控纠正循环:
- 提议生成: 一个提议者(基于学习、启发式或规划)根据失败记录和选定的路由生成纠正方案 。
- 应用: 通过直接修改模拟器状态(如修改 $qpos$)或通过控制器介导的执行来应用纠正。
- 验证: 原生任务验证器检查结果状态是否符合任务谓词。
- 有界重试: 如果验证失败,系统会增加尝试预算 (),重新对齐状态,并可能重试相同的路由或更换路由。循环在成功或预算耗尽时终止。
2.2 操作流程
该接口将预测、接地(grounding)、诊断、应用和验证分离。
- 输入: 任务规范、源标签(预测或模拟)以及状态。
- 过程: 将状态接地为 ABox 诊断缺失谓词 分配路由 生成纠正 应用 验证。
- 输出: 一个被接受的状态、一个保留的规划候选方案,或一个未解决的类型化失败追踪。
3. 核心贡献
本文做出了三个主要的工程技术贡献:
- 操作型机器人任务本体: 一种显式的接地接口设计,在共享词汇和类型约束下,将预测状态和模拟观测状态表示为不同的、特定任务的 ABox。
- 确定性诊断与路由: 一个基于规则的系统,在不丢弃原始上下文的情况下,保留被违反的谓词及其类型化参数,并将其映射到特定任务的纠正路由。
- 验证门控纠正契约: 一个记录纠正尝试全生命周期(诊断、路由选择、提议、应用模式及原生谓词验收)的协议,并强制执行有界重试机制。
4. 实验结果
作者通过模拟协议在三个不同的基准设置中对 Onto-EV-WM 进行了评估。
4.1 PointMaze(对齐比较)
- 设置: 在 50 次试验的随机状态规划比较中,对比 EV-WM 与 Onto-EV-WM。
- 结果: 两种方法均达到了 94% 的成功率。然而,Onto-EV-WM 取得了显著更低的平均最终状态距离 (0.61177),而 EV-WM 为 (0.90573),这表明其在满足任务条件方面具有更高的精度。
- 注: 在使用更大的搜索预算和“成功优先”选择的独立配置下,成功率达到了 100%,但由于预算差异,这与对齐设置下的结果不具直接可比性。
4.2 LIBERO-Goal(采样窗口纠正)
- 设置: 在 10 个操纵任务上进行评估,使用 4 个评估采样种子。协议采样 25 步的演示窗口。纠正通过直接作用于模拟器状态的固定学习源/关节 $qpos$-delta 机制进行应用。
- 结果:
- 种子 0: 93.8% 的纠正窗口成功率(469/500)。
- 跨 4 个种子: 94.05 ± 0.30% 的纠正成功率。
- 恢复: 在 261 次回放失败中,有 142 次(54.4%)被纠正机制“挽救”。
- 背景: 本体提供了将失败与固定纠正头联系起来的诊断记录;报告的指标反映了完整的本体落地配置。
4.3 LIBERO-Plus(固定注册表)
- 设置: 在包含四个套件(LIBERO-10, Goal, Object, Spatial)共 10,030 个扰动任务的固定注册表上进行评估。
- 结果:
- 总体成功率: 85.00%(8,526/10,030 个任务)。
- 套件细分:
- LIBERO-Goal: 91.39%
- LIBERO-Object: 91.38%
- LIBERO-Spatial: 91.38%
- LIBERO-10: 65.98%(被识别为剩余失败计数最高的套件)。
- 比较: Onto-EV-WM 配置的表现优于多种基准模型,包括 DINO-WM + CEM (61.57%) 以及各种 VLA 模型,尽管这种比较是系统级的,并未隔离本体本身的因果贡献。
5. 重要性与声明
本文将 Onto-EV-WM 定位为一个 系统级接口,通过在故障诊断和修复过程中加入显式的类型化推理,增强了物理 AI 系统。
- 范围限定: 作者明确指出,其结果并不构成:
- 真机机器人恢复或从模拟到现实(sim-to-real)的验证。
- 通用的开放世界知识图谱或通用机器人本体。
- 仅靠本体论实现的因果增益(性能提升归功于完整的配置)。
- 替换现有控制器的新的学习策略类。
- 核心价值: 其重要性在于能够记录 为何 任务失败(类型化谓词与参数),并以一种与底层预测模型解耦的方式来结构化修复过程(路由与验证)。这使得在模拟协议中实现“闭环”修复成为可能,其中验证门控了纠正方案的验收。
- 局限性: 评估依赖于基于模拟的协议。“闭环”是指在模拟器内的有界“验证-重试”循环,而非物理硬件上的实时反馈控制。定量结果反映的是集成系统在特定协议下的表现,而非孤立本体的有效性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。