EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval
该论文介绍了 EnterpriseRAG,这是一个包含跨六个领域的 983 个经专家验证的样本的全面基准测试,它揭示了企业级检索增强生成(RAG)系统中存在的关键“编排差距”,即虽然大语言模型通常能满足单个约束,但在涉及噪声检索、知识空白和事实冲突的真实生产条件下,其整体指令遵循能力会显著崩溃。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个超级聪明的机器人如何成为一名得力的助手。你给了它一个图书馆(它的知识库),然后向它提问。机器人会去图书馆,取出几页纸,阅读它们,然后写出答案。这被称为 RAG(检索增强生成)。这就像学生参加开卷考试:他们不需要死记硬背所有内容,但需要找到正确的那一页并仔细阅读,以获得正确的答案。
但问题在于:在现实世界中,图书馆是混乱的。有时机器人抓取的页面与问题毫无关系(噪声)。有时书里根本没有答案(知识空白)。有时两本书对同一个事实的说法却截然相反(冲突)。大多数针对这些机器人的测试都假设图书馆是完美的,且问题很简单,比如“法国的首都是哪里?”但现实生活更像是问:“请用表格总结上季度的营收,但如果数据缺失,请说‘我不知道’而不是瞎猜;如果两份报告有分歧,请把两者都列出来。”
这就是棘手之处。我们希望我们的机器人助手不仅能寻找事实,还要能遵循严格的规则、在遇到困难时承认自己无法处理,并在面对混乱情况时不编造事实。如果机器人做不到这一点,它可能会给出一个自信但错误的答案,对于试图做出重要决策的公司来说,这可能是一场灾难。
巨大的“执行力”失败
来自中国移动九天研究院的研究团队开发了一个全新的、更严苛的测试——EnterpriseRAG,旨在观察这些 AI 机器人究竟在多大程度上能应对现实世界的复杂性。你可以把这个测试看作是 AI 的“压力测试”,旨在观察当指令变得复杂或者发现的信息是破碎或矛盾时,它们是否还能保持冷静。
他们创建了 983 个复杂的场景,涵盖了能源、医疗、法律和金融等六个不同领域。在这些场景中,他们不仅仅是提出简单的问题。他们给了机器人复杂的指令,包含多项规则,例如“使用表格”、“不要猜测”、“引用来源”以及“如果你发现矛盾,请告诉我”。然后,他们故意破坏了机器人找到的信息:他们加入了无关的垃圾信息,删除了答案,或者植入了虚假的矛盾。
重大发现:“编排差距”
结果令人震惊。当研究人员检查机器人是否能遵循单个规则时,它们表现得还不错。大约 84% 的情况下,机器人能正确执行单项规则,比如使用正确的格式或引用来源。这就像一个学生每一步数学步骤都做对了,却忘了写下最终答案。
然而,当研究人员检查它们是否能同时遵循所有规则时,得分骤降至仅 27%。研究人员称之为 57 点的“编排差距”(orchestration gap)。事实证明,虽然这些 AI 模型擅长一次只做一件事,但当它们必须同时处理多个复杂指令时,就会崩溃。它们可能会格式正确,但却在事实方面产生了幻觉;或者它们找到了正确答案,却忘记了在数据缺失时说“我不知道”。
“乐于助人”的陷阱
最有趣的发现之一是机器人如何处理书中没有答案的情况。人类知道,如果你不知道某件事,你应该说“我不知道”。但这些 AI 机器人有一种强烈的“乐于助人偏好”。它们非常渴望提供帮助,所以当找不到答案时,它们经常会凭空捏造一个答案。
在测试中,当信息缺失时,机器人仅在约 42.7% 的情况下能正确拒绝回答(表现最好的模型是 Claude-Opus-4.5)。在另外 57.3% 的情况下,它们会自信地进行猜测或产生幻觉。这是危险的,因为一个自信的错误答案往往比没有答案更糟糕。
推理虽有帮助,但并非万能灵药
研究人员还测试了“推理”模型——即那些在回答之前会像学生停下来思考难题一样进行“思考”的 AI 模型。这些模型的表现优于标准模型。例如,它们在发现文档冲突方面做得更好。表现最好的推理模型能识别出约 44.3% 的冲突,而其他模型的表现则低得多。
然而,即使是这些“思考型”模型也不完美。它们仍然难以同时遵循所有规则,并且在应该承认失败时仍然会进行猜测。论文指出,仅仅让 AI “思考”得更深入是不够的;机器人需要接受更好的训练,以判断何时拥有足够的信息,以及如何在不感到吃力的情况下遵循复杂的协议。
底线
该论文并不认为 AI 永远坏掉了,但它确实表明,我们高估了这些系统处理严肃、现实工作时的准备程度。仅仅因为一个 AI 能写诗或回答简单问题,并不意味着它能处理带有混乱数据和严格规则的复杂业务任务。为了让这些系统变得可靠,我们需要停止在完美、干净的环境中测试它们,而是开始在它们实际将要生活的那个混乱、嘈杂、充满矛盾的世界中进行测试。在我们能够填补这 57 点的差距之前,对于让这些机器人独立做出重要决策,我们应当保持谨慎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。