HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities
本文介绍了 HOME-KGQA,这是一个专注于家庭日常活动的知识图谱问答新型多模态基准数据集,该数据集揭示了当前基于大语言模型的方法在处理真实世界具身智能应用所需的复杂时空推理与多模态 grounding 时存在显著的性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位名叫"LLM"(大型语言模型)的超级智能机器人管家。这位机器人几乎读遍了图书馆里的每一本书,并能就任何话题进行交谈。然而,它有一个坏习惯:有时它会编造内容(产生幻觉),因为它依赖的是它记住的东西,而不是当下实际真实的情况。
现在,想象你还有一个巨大的、超有条理的文件柜,称为“知识图谱”(KG)。这个文件柜不仅存放事实,还存放着关于确切发生何事、何地、何时以及与谁发生的一张结构化地图。
这篇论文介绍了一项名为HOME-KGQA的新测试,旨在考察我们能否教会这位机器人管家停止猜测,转而查阅文件柜以获取关于家庭日常生活的答案。
以下是他们工作的分解,使用了简单的类比:
1. 问题所在:“百科全书”与“家庭录像”
以往针对这些机器人的大多数测试,就像是在问百科全书里的常识题。
- 旧测试:“谁是 1990 年的总统?”或“法国的首都是哪里?”
- 问题所在:机器人已经从训练中知道了这些答案。它不需要查阅文件柜。此外,这些问题是静态的;它们不会改变。
HOME-KGQA则不同。它就像是在询问关于一个人独居的100 天家庭录像的问题。
- 新测试:“在 4 月 3 日晚上 7:56 到 5 月 27 日早上 6:38 之间,这个人把水杯放进厨房多少次?”
- 挑战:机器人不能仅靠“记忆”来回答。它必须查看具体的视频数据,找到确切的时间,定位物体,并统计事件次数。这需要时空推理(同时理解空间和时间)。
2. 构建过程:打造“数字孪生”
为了创建这项测试,研究人员并没有拍摄真实的房屋(为了保护隐私)。相反,他们使用了一个虚拟模拟器(VirtualHome)来创建一个家庭的“数字孪生”。
- 他们生成了 100 天的合成日常生活(起床、做饭、打扫)。
- 他们将这些视频转化为一个庞大的知识图谱(一个包含事实的巨大数据库),其中包含超过1.5 亿个事实(三元组)。
- 该数据库是“多模态”的,意味着它将文本(问题)与视觉数据(视频帧)和三维坐标(物体在房间中的位置)连接起来。
3. 测试内容:“翻译”游戏
核心任务是文本到 SPARQL 的转换。
- 输入:人类用通俗的英语提出一个复杂的问题。
- 目标:机器人必须将该英语句子翻译成精确的计算机查询语言(SPARQL),以便向数据库询问答案。
- 类比:想象你问图书管理员:“把作者住在巴黎期间写的所有书都展示给我看。”图书管理员(机器人)必须将你的句子翻译成图书馆计算机系统能理解的具体代码,以取出正确的书架。
研究人员创建了 1,050 个这样的问题。他们通过以下方式使问题变得棘手:
- 询问计数(多少次?)。
- 询问时间范围(在 X 和 Y 之间?)。
- 询问聚合数据(平均持续时间是多少?)。
- 改写:他们将生硬、机械的问题重写为听起来像自然人类对话的形式,这使得翻译变得更加困难。
4. 结果:机器人表现挣扎
研究人员在最新测试中测试了可用的最先进 AI 模型(如 GPT-4o 和 Llama 3),并将其表现与它们在旧式百科全书风格测试中的表现进行了比较。
- 令人震惊的是:模型在 HOME-KGQA 上的表现远差于在旧测试中的表现。
- 原因:
- 复杂性:问题需要连接许多点(多跳推理)。例如,找到一个物体,检查其位置,检查时间,然后进行计数。
- “智能体”失败:他们尝试了一种“交互式智能体”方法,即机器人可以一次向数据库提出一个小问题(就像侦探询问线索)。然而,机器人经常陷入困境,耗尽了“回合”(提问时间),或者被数据库的巨大规模搞得不知所措。
- 语法错误:即使机器人试图编写代码(SPARQL),它也经常在代码中犯语法错误,导致查询失败。
5. 结论
该论文得出结论,虽然 AI 擅长聊天和了解一般事实,但目前它尚未准备好成为可靠的助手,去处理需要检查特定日志、视频和传感器数据的现实世界中的细粒度日常任务。
核心要点:
我们为 AI 构建了一个非常困难的“驾驶考试”。目前,AI 可以在笔直、空旷的高速公路上行驶(百科全书式事实),但当被要求在有红绿灯、行人和变化天气的繁忙复杂城市街道上导航时(家庭日常活动),它就会发生碰撞。HOME-KGQA数据集就是帮助解决这一问题的新训练场。
注:该论文明确指出数据是合成的(来自模拟器),不包含真实人物或私人信息。它还指出,为了测试技术的极限,这些问题比自然的人类对话更为复杂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。