← 最新论文
🤖 AI

Provenance-Enhanced Statements in Knowledge Graphs

本文介绍了 DEC,一个将知识图谱中的溯源(provenance)解释为认识立场指标的框架,旨在将带有属性的断言组织进“认知世界”中,从而实现对分歧和假设的有原则推理,而不会将它们坍缩为不一致性。

原作者: Fabio Vitali, Valentina Pasqual

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Fabio Vitali, Valentina Pasqual

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:“谁说了什么?”的混乱

想象一个巨大的图书馆(知识图谱),人们在那里存储事实。通常,图书馆非常擅长存储硬事实,比如“天空是蓝色的”或“水在100°C时沸腾”。这些是数据(Data):无论谁来看,它们都是真实存在的。

但我们所知道的大量信息并不属于此类。它们是摄取物(Capta,源自拉丁语,意为“被获取的事物”):即由某人“声称”的事物。例如:

  • “根据艺术史学家 X 的说法,这幅画是达芬奇创作的。”
  • “根据科学家 Y 的说法,这种疾病是由压力引起的。”
  • “根据历史学家 Z 的说法,地球是在公元前4004年创造的。”

在目前的计算机系统中,我们可以给这些陈述贴上“谁说的?”(溯源)的标签。但系统仅仅将该标签视为一张便利贴。它并不理解标签背后的含义。它无法区分以下差异:

  • “马丁·肯普(Martin Kemp)写道……”(关于一本书的事实)。
  • “马丁·肯普相信……”(一种观点)。
  • “马丁·肯普证明了……”(一个强有力的事实)。
  • “马丁·肯普假设……”(一个大胆的猜想)。

目前,如果计算机看到“根据肯普的说法,地球是平的”,它可能会感到困惑。地球是真的平的吗?还是肯普说错了?系统通常试图将一切都强行归纳为单一的“真理”,这会导致错误,或者忽略了历史和科学中的细微差别。

解决方案:DEC(信念、认知、猜想)

作者提出了一个名为 DEC 的新框架。DEC 不仅仅是将陈述标记为一个名字,而是将陈述视为生活在特定的**“认知世界”(Cognitive World)**之中。

把“认知世界”想象成房子里的不同房间,或者屏幕上播放的不同电影

  1. 现实室(认知世界/Epistemic World): 这是我们存放 100% 确信的事实的房间。如果一个陈述在这个房间里,计算机就会将其视为真理。
  2. 信念室(信托世界/Doxastic World): 这是我们存放人们“认为”是事实(即便可能是错的)的地方。如果布鲁斯(Bruce)相信鲸鱼是鱼类,那么这就会进入布鲁斯的“信念室”。计算机知道布鲁斯对现实的认知是错误的,但它尊重布鲁斯的“信念”。
  3. 猜想室(猜想世界/Conjectural World): 这是我们存放假设的地方。如果卡尔(Carl)猜想龙是爬行动物,那么这个猜想就会进入“猜想室”。计算机知道这是一个假设,但它仍然可以在这个房间内运行逻辑(例如:“如果龙是爬行动物,那么‘图牙’也是爬行动物”)。

它是如何运作的:“渗透”(Permeation)魔法

DEC 的神奇之处在于这些房间是如何相互交流的。作者称之为**“渗透”(Permeation)**。

  • 单向门: 通常,来自“现实室”的事实可以流向“猜想室”。如果我们知道“龙是虚构的”,那么“猜想室”(卡尔关于龙的猜想)也会自动知道这一点。
  • 无回流: 但是,在“信念室”(布鲁斯认为鲸鱼是鱼类)中发生的事情,并不会流回到“现实室”。计算机不会仅仅因为布鲁斯这么认为,就突然认为鲸鱼是鱼类。
  • “超人”修正: 有一个著名的逻辑谜题叫做“超人悖论”。如果露易丝·莱恩(Lois Lane)知道超人会飞,而超人实际上是克拉克·肯特(Clark Kent),那么露易丝是否知道克拉克·肯特会飞?在常规逻辑中,答案是肯定的。但在现实生活中,答案是否定的,因为她不知道他们是同一个人。
    • DEC 通过保持“露易丝·莱恩世界”的独立性来解决这个问题。在她的世界里,超人和克克克是不同的个体。计算机尊重她的视角,不会将“现实”中的身份强加到她的“信念”世界中,除非她明确学习到了真相。

这让我们能做什么

通过分离这些世界,系统可以处理复杂的状况而不至于崩溃:

  • 分歧: 你可以有一个房间说“莎士比亚写了《哈姆雷特》”,而另一个房间说“德·维尔(De Vere)写了《哈姆雷特》”。系统不会报错“错误!”,它只会说:“这两个房间存在分歧。”
  • 妄想: 如果一个房间说“地球是平的”,而“现实室”说“地球是圆的”,系统可以将“平地论”房间标记为**“妄想”(Delusional)**。它知道该陈述被正确归因了(确实有人这么说过),但其内容与现实相悖。
  • 个人观点: 如果爱丽丝(Alice)说“披萨比热狗好吃”,而鲍勃(Bob)说“热狗比披萨好吃”,系统知道这只是观点。它们不需要被“修正”或被证明真伪;它们只是作为个人观点存在。

原型:数据库的“监督员”

作者构建了一个原型工具(一个“推理器”),它运行在标准数据库软件(如 Apache Jena/Fuseki)之上。

把这个工具想象成一位在任何人进入图书馆之前先巡视一遍的**“监督员”**。

  1. 监督员查看每一条陈述。
  2. 他们会询问:“谁说了这个?是怎么说的?”
  3. 他们将陈述分类到正确的“房间”中(现实、信念、猜想)。
  4. 他们让标准的计算机逻辑在每个房间内部进行运算。
  5. 他们检查是否有房间在互相冲突(分歧)或与现实冲突(妄想)。
  6. 最后,他们向用户展示结果,清晰地标注哪些是可靠事实,哪些是信念,哪些仅仅是猜想。

总结

本文认为,我们不应该再把计算机中的所有知识都视为单一、坚固的真理块。相反,我们应该将知识视为不同视角的集合。

DEC 提供了一种方法来表达:“这是一个事实”、“这是一个信念”以及“这是一个猜想”,并让它们在同一个数据库中和谐共存,而不会让计算机感到困惑或崩溃。它让我们能够保留辩论的历史、错误理论的存在以及人类观点的细微差别,同时确保“硬事实”的安全稳固。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →