ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering
本文介绍了 ENTLORE,这是一个基于图谱的基准测试,旨在通过从常规文档中重建经过审计的企业世界,来评估企业问答系统在执行潜在组织推理方面的能力,从而测试其在简单事实检索之外恢复隐性关系的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图在一座巨大的、混乱的图书馆中破解谜题的侦探。这不仅仅是一座普通的图书馆;它是某家大型公司的“大脑”,里面充满了数百万份文档,如电子邮件、项目报告、会议记录和电子表格。在人工智能(AI)的世界里,有一个流行的游戏叫做“问答”(Question Answering)。通常,AI 会被给定一个问题和一叠文档,它的任务是找到包含答案的那句确切的话。这就像是在玩一个“我看到了”的游戏,答案就隐藏在显眼处,等待着被拾起。
但在现实的公司环境中,情况比游戏要复杂得多。通常,问题的答案并不会写在单一的句子中。相反,真相隐藏在不同文档之间的“关系”之中。也许一封邮件说“爱丽丝负责模块 X”,而另一份报告说“模块 X 是项目 Y 的一部分”,但没有任何一份文档曾明确表示“爱丽丝负责项目 Y”。为了找到答案,AI 必须亲自将这些点连接起来,利用公司组织的那些“隐形规则”。这篇由 ScitiX.ai 研究人员撰写的论文,正是关于如何教计算机进行这种“侦探式推理”,而不仅仅是擅长寻找单词。
问题所在:“隐藏真相”陷阱
大多数 AI 基准测试(AI 测试标准)就像是一场地图已经画好的寻宝游戏。测试设计者编写一个问题,然后确保答案明确地写在提供给 AI 的文档中。这就像是问“红球是什么颜色的?”并递给 AI 一张红球的照片。AI 只需要找到“红色”这个词即可。
本文作者认为,这太简单了,无法反映真实公司的运作方式。在现实世界中,“红球”可能在某个文件中被提及,而“它是一个球”的事实可能在另一个文件中,但两者之间的联系从未被明说。AI 必须根据公司的结构,推断出“模块 X”属于“项目 Y”,即使没有任何文档明确将它们联系在一起。研究人员称这种缺失的能力为潜在组织推理(Latent Organizational Reasoning)。即从日常工作的杂乱副产品中,推断出组织内部隐形规则的能力。
解决方案:ENTLORE,“真相图谱”
为了测试 AI 是否真的具备这种能力,团队构建了一个名为 ENTLORE 的新基准测试。想象一下,他们提取了一家真实私有公司的整个数字历史——数千份文档、组织架构图和运营日志——并在幕后构建了一个巨大的、秘密的“真相图谱”(Truth Graph)。这个图谱就像一份主蓝图,基于严格且经过审计的规则,精确掌握着每位员工、每个项目和每个模块之间是如何连接的。
随后,他们为 AI 创建了一个“发布世界”来进行游戏。这个发布世界包含相同的文档,但所有名称都经过了脱敏处理(例如,将“爱丽丝”变为“员工 #42”,将“项目 Alpha”变为“项目 Beta”)。至关重要的是,AI 无法 看到那个秘密的“真相图谱”。它只能看到那些杂乱且匿名化的文档。
团队随后提出了 907 个问题。他们将这些问题分为三个难度等级:
- 等级 1(查找型): 答案就在一个文档中。(例如:“谁是项目 Beta 的经理?”)
- 等级 2(组合型): 答案需要阅读两份文档并合并事实。(例如:“谁管理着开发模块 X 的团队?”)
- 等级 3(潜在推理型): 答案需要连接那些并未被显式链接的点。(例如:“谁对项目 Beta 的整体成功负责?”——尽管没有任何文档说“员工 #42 负责项目 Beta”,但真相图谱知道这一点,因为该员工管理着项目内的模块。)
研究发现:AI 擅长阅读,但不擅长连接
研究人员测试了 8 种不同的 AI 模型,使用了从简单的关键词搜索到能够像人类一样浏览文档的复杂“智能体(Agent)”系统等多种方法。以下是他们的发现:
1. “隐藏的真相”难以寻获
当答案明确写在文档中时(等级 1 和 2),AI 模型表现得相当不错。但当它们遇到等级 3(潜在推理)时,表现大幅下降。即使是最优秀的模型,也只能答对约 36.2% 的这类难题。
2. 结构比速度更重要
研究人员尝试了不同的方法来帮助 AI 寻找信息。
- 简单搜索 (BM25): 仅仅寻找匹配的单词。这的效果出奇地好。
- 稠密搜索 (Flat RAG): 使用高级数学方法来寻找相似的概念。这实际上比简单搜索的表现还要差。
- 基于图谱的系统 (GraphRAG): 这些系统尝试在回答问题之前建立文档之间的连接图谱。事实证明,这是最强的方法,平均而言击败了其他方法。这表明 AI 需要理解的是公司的结构,而不仅仅是单词。
3. 即便拥有“黄金文档”,AI 依然失败
最令人震惊的发现出现在研究人员将“黄金文档”(即回答问题所需的精确文件)直接交给 AI,跳过搜索环节的时候。
- 对于简单问题(等级 1),AI 几乎全对。
- 对于中等问题(等级 2),它依然表现良好。
- 但对于困难的潜在推理问题(等级 3),即便 AI 面前摆着完美的文档,仍有 30.4% 的答案是错误的!
这意味着问题不仅在于 AI 找不到正确的文件,更在于即使面对所有证据,它也无法通过那些隐形的组织规则进行推理。这就像是给一名侦探提供了犯罪现场的照片,但由于照片中并未明确说明管家和园丁其实是同一个人,侦探却依然无法意识到这一点。
这为什么重要
论文总结道,我们不能仅仅构建更好的企业搜索引擎。我们需要能够理解组织“灵魂”的 AI——那些不成文的规则、项目层级以及隐藏的联系。ENTLORE 证明了目前的 AI 仍在这一领域挣扎。它擅长阅读“所写之物”,但在学习思考“所隐含之意”方面仍处于起步阶段。
研究人员公开了其数据和代码,以便其他科学家可以尝试解决这个谜题。在 AI 能够掌握这种“潜在组织推理”之前,它始终会像一名虽然读过员工手册、却还不了解公司实际运作方式的新员工。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。