← 最新论文
💬 NLP

Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval

本文提出了一种能够从原始多源数据中自动发现可执行模式契约(schema contracts)的系统,用以指导知识图谱构建并约束多工具检索智能体,通过实现结构化、可追溯且具备模式感知能力的证据整合,显著提升了问答性能,并优于基准方法。

原作者: Padmaja Jonnalagedda, Yuguang Yao, Xiang Gao, Hilaf Hasson, Kamalika Das

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Padmaja Jonnalagedda, Yuguang Yao, Xiang Gao, Hilaf Hasson, Kamalika Das

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个巨大的谜团,但你的线索散落在杂乱无章的房间里。有些线索写在整洁的账本(表格)上,有些写在便利贴(PDF)上,有些记录在凌乱的数字日志(JSON)中,还有些只是白板上的随手涂鸦。

目前,大多数试图破解这个谜团的 AI 系统就像是一个只顾着拿手电筒到处乱照、随机阅读一切内容的侦探。他们可能会发现一条线索,但因为不理解房间的“结构”,往往会忽略线索之间的联系。他们无法分辨出账本上的名字与便利贴上的名字是同一个人,也无法理解一个笔记是如何成为另一个笔记的“子集”的。

这篇论文介绍了一个全新的系统,它就像一位超级严谨的建筑师,在侦探开始寻找之前,先为这个房间绘制了一份蓝图

以下是它的工作原理,分为简单的几个步骤:

1. “自动蓝图”(模式发现/Schema Discovery)

系统不需要人类花费数周时间来绘制哪里有什么东西的地图,而是通过观察原始且杂乱的数据,自动推导出其中的规则。

  • 问题所在: AI 经常会产生“幻觉”(编造事实)。它可能会在数据中根本没有“利润”字段的情况下,凭空创造出一个名为“利润”的列。
  • 解决方案: 系统创建了一个**“封闭世界目录”(Closed-World Catalog)**。你可以把它想象成一本严格的规则手册:“你只能讨论数据中实际存在的事物。”如果 AI 试图发明一个新的字段,系统会说:“不行,目录里没有这个,”并强制它必须基于真实存在的内容进行讨论。
  • 结果: 它构建了一个 “模式契约”(Schema Contract)。这是一个共同的协议,规定了:“‘产品’长什么样,‘交易’长什么样,以及它们是如何相互关联的。”

2. 构建“知识图谱”(有序的图书馆)

一旦蓝图准备就绪,系统就会利用它将杂乱的数据组织成一个整洁、互联的图书馆,即知识图谱(Knowledge Graph)

  • 神奇之处: 它不仅仅是堆砌数据,而是利用蓝图来理清关系。
    • 身份键(Identity Keys): 它知道一个文件中的“ID: 123”与另一个文件中的“ID: 123”是同一个人。
    • 外键(Foreign Keys): 它意识到销售表中的“订单 #55”属于客户表中的“客户 #99”。
    • 溯源(Provenance): 每一条信息都附带了一张“收据”,显示它究竟来自哪份原始文档。这意味着如果 AI 给出了答案,它可以精准地指出是在哪一页、哪一行找到了证据。

3. “智能侦探”(查询时检索/Query-Time Retrieval)

当你提出问题(例如:“在 2018 年合并后,哪些产品赚取的利润最高?”)时,系统不会仅仅靠猜测。它会利用蓝图来决定如何寻找答案。

  • 路由(The Routing): 系统会自问:“我需要查看电子表格中的精确数字吗?我需要阅读 PDF 中的长篇文本吗?还是我需要沿着不同文件之间的连接链条进行追踪?”
  • 契约(The Contract): 因为 AI 拥有蓝图,它确切知道该使用哪种工具。它不会盲目游走;它会采取最直接的路径,只有当蓝图显示两者有关联时,才会从电子表格跳转到 PDF。
  • 安全网(The Safety Net): 如果问题涉及蓝图未知的领域(比如一个尚未被添加的新产品),系统可以暂时“扩展”蓝图来处理它,或者承认自己不知道,而不是编造一个虚假的答案。

为什么这比我们现在的技术更好?

作者将此方法与其它方法(如标准的 AI 搜索,或试图在没有蓝图的情况下猜测连接关系的系统)进行了对比测试。

  • 结果: “蓝图系统”在回答需要结合不同来源信息的复杂问题时,表现得显著更好。
  • 类比:
    • 旧方法 (RAG): 就像是向图书管理员大喊关键词来找书。他们可能会找到一本包含“利润”这个词的书,但那可能并不是你要找的那本。
    • 这种方法: 就像是拥有一位已经建立好了完美索引卡系统的图书管理员。他们清楚地知道哪张卡片指向利润数字,哪张卡片指向合并日期,以及如何将它们链接在一起,从而给你一个精准的答案。

核心结论

这篇论文声称,通过在尝试回答问题之前,先为杂乱的数据自动创建一个严格的可执行地图(模式/Schema),AI 系统可以变得更加准确、可靠,并且能够解释它们是从哪里找到答案的。它将一个充满混乱线索的房间变成了一个组织有序的图书馆,使侦探的工作变得更加轻松,结果也更加值得信赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →