想象一下你在一家大型银行或复杂的物流公司工作。你的公司拥有一张巨大的、活生生的数据地图(一个“属性图”),展示了资金如何流动、谁认识谁以及货物如何运输。这张地图是您公司独有的,它使用着无人知晓的特殊名称、规则和秘密代码。
现在,想象你想构建一个智能助手(AI),让你的员工可以用自然语言提问,例如:“请显示上周所有向被封禁用户转账的账户。”并让 AI 自动编写获取该答案所需的复杂计算机代码(称为 Cypher)。
问题在于,你不能直接在公开、通用的地图上测试这个 AI。它需要在你的特定地图上,并遵循你的特定规则进行测试。但构建这样一个测试简直是一场噩梦:
- 地图每天都在变化。
- AI 写的代码可能看起来是对的,但问错了问题。
- 你不能将你的秘密数据发送到公共 AI 服务来进行测试生成。
PIPE-Cypher 就是作者构建的解决方案。你可以把它想象成一个完全运行在你公司安全计算机内部的自动化“测试厨房”。
这个“测试厨房”是如何运作的
与其让人类编写数千个测试问题,PIPE-Cypher 提供了一个流水线(生产线),承担了繁重的任务:
地图检查员(模式剖析/Schema Profiling):
首先,系统会悄悄观察你公司的的数据地图。它学习节点(如“账户”或“人”)的名称、连接它们的路径(如“转账至”)以及使用的特定值(如“信用卡”或“已封禁”)。它创建了一份关于什么是可能的“菜单”。
逆向工程师(逆向锚定/Reverse Grounding):
这是最聪明的部分。系统不是靠猜测一个问题并寄希望于答案存在,而是从答案开始。它通过运行安全的只读查询来寻找实际存在的真实数据点。
比喻: 想象你想测试一位厨师。与其问他“做一碗汤”并祈祷他有食材,不如先检查储藏室,看看是否有胡萝卜和洋葱。然后你问:“用胡萝卜和洋葱做一碗汤。”这保证了问题是可回答的。
严格编辑员(约束生成/Constrained Generation):
一个本地 AI(运行在你自己的服务器上,而非云端)根据这些真实的“食材”编写英文问题和 Cypher 代码。但它不被允许进行危险的创作。它必须遵循严格的规则:“只能读取数据,绝不能删除数据”、“必须使用精确的名称”、“不要发明不存在的路径”。
安全门卫(确定性验证/Deterministic Validation):
在测试被接受之前,一个非 AI 的计算机程序会检查代码。它就像俱乐部的保镖:
- 代码安全吗?(没有删除数据的操作)。
- 是否使用了真实名称?(没有幻觉术语)。
- 它是否真的能运行?(如果代码返回结果为空,则会被拒绝)。
- 方向是否正确?(在图中,“A 到 B”与“B 到 A”是不同的)。
- 裁判(LLM 评审员/LLM Reviewer):
最后,第二个本地 AI 充当裁判。它查看问题、代码和实际结果。它会问:“这段代码真的回答了这个问题吗?它表达得清晰吗?”如果代码可以运行但给出了错误答案,裁判会拒绝它。
结果:一个“活的”基准测试
作者利用这个流水线创建了一个包含 3,000 个问题 的大规模测试集,使用的是真实的金融和社会网络数据。
- 它具有辨别力: 当他们用这个新基准测试标准 AI 模型时,大多数模型表现得很糟糕(正确率低于 4%)。这证明了仅仅因为一个 AI 能写出看起来正确的代码,并不意味着它理解你的特定数据地图。
- 它是可刷新的: 由于该流水线是自动化的,如果你的公司下个月增加了新的数据类型(比如“加密货币钱包”),你只需再次运行流水线即可立即生成新的测试。你不需要等待公共数据集进行更新。
- 它是私密的: 一切都在你自己的计算机上完成。敏感数据永远不会离开你的建筑。
核心启示
该论文认为,对于企业级 AI 而言,静态测试集已经过时了。你不能用一个通用的、冻结的数据集,去评估一个旨在处理你独特的、不断变化的业务的系统。
PIPE-Cypher 通过将基准测试的创建转变为一个可重复的、自动化的工厂流程,改变了游戏规则。它确保了测试是:
- 真实的: 基于实际存在的真实数据。
- 安全的: 保证不会破坏你的数据库。
- 诚实的: 严格检查 AI 是否真正解决了问题,而不仅仅是写出了漂亮的程序代码。
简而言之,PIPE-Cypher 是一个工具,让公司能够构建属于自己的高质量“驾驶考试”,确保其 AI 助手能够实际导航在公司复杂且独特的路径上,而不会发生“车祸”。
技术摘要:PIPE-Cypher
问题陈述
企业级属性图在模式结构、内部术语、领域假设、治理约束以及用户交互模式方面,与公开基准测试存在显著差异。因此,公开的 Text-to-Cypher 数据集无法评估模型是否能够处理组织的特定标签(Labels)、关系方向(Relationship Directions)、数值(Values)以及业务问题。此外,静态的公开数据集无法在生产环境模式发生演进时进行适配。
创建一个相关的基准测试非常困难,原因如下:
- 唯一性: 模式和数值对每个组织而言都是唯一的。
- 动态性: 随着产品交付和集成增加,图结构会随时间发生变化。
- 要求: 每一对自然语言(NL)到 Cypher 的映射必须是可执行的,需使用真实的图实体,保持多样性,并在查询类型和难度等级上保持平衡。
- 隐私性: 组织无法将敏感的模式或数值发送给付费生成 API。
- 可靠性: 虽然本地模型可以编写单个查询,但它们往往难以完成包含真实值落地、保留关系方向、避免不安全子句以及类别平衡在内的完整闭环。
方法论:PIPE-Cypher 流水线
PIPE-Cypher 是一个本地基准生成流水线,它能将实时属性图和可选的种子查询(来自客户问题、日志或智能体调用)转化为平衡且可执行的 NL-to-Cypher 基准。它作为一个受约束的流水线运行,由模型处理语言和生成任务,而确定性的图检查则确保了可重复性、可扩展性和可审计性。
该流水线由七个阶段组成:
- 模式与数值剖析(Schema and Value Profiling): 记录标签、关系类型、属性、观察到的方向以及有界的低基数分类值。
- 工作负载规划(Workload Planning): 针对八个业务类别:简单/复杂检索、简单/复杂聚合、布尔存在性、否定/差集、路径/时间事务,以及排序/Top-k。
- 反向 Cypher 落地(Reverse Cypher Grounding): 运行只读 Cypher 查询以寻找能实际产生行数据的槽位值(Slot Values)。这防止了生成看似合理但图中并无答案的问题。
- 受约束生成(Constrained Generation): 使用本地大模型(Qwen3.5-9B)基于填充了反向绑定值的负载模板生成候选集。它采用占位符化的检索示例,以防止模型记忆特定的租户数值。
- Cypher 治理(确定性门控)(Cypher Governance - Deterministic Gates): 在接受前执行严格规则:
- 只读安全性: 拦截写操作/管理权限的 Token。
- 模式有效性: 确保标签、属性和分类值存在。
- 方向有效性: 验证关系遍历的方向。
- 规范化: 强制执行
RETURN DISTINCT 并拒绝危险的构造(如 UNION、CALL、UNWIND)。
- 执行验证(Execution Validation): 使用只读凭据运行生成的 Cypher。检查是否存在语法/运行时错误,并确保在需要时结果非空。
- LLM 评判审查(LLM Judge Review): 本地 LLM 评判仅审查通过执行验证的候选集。它评估歧义性、语义对齐度和模式使用情况,并根据一小组人工标注进行校准。
隐私与脱敏: 系统包含可配置的数值采样策略和脱敏规则。提示词和结果中的敏感值会被替换为稳定的占位符以供更广泛的内部审查,从而确保基准可以在不泄露 PII(个人身份信息)的情况下进行共享。
核心贡献
本文提出了四个主要贡献:
- 本地模型工作流: 一种无需依赖付费 API,即可利用组织自有图数据生成私有 NL-to-Cypher 基准的方法。
- 面向结果的落地与验证: 一个结合了反向落地与 Cypher 特定验证器的系统,用于确保只读安全、关系方向、精确字面量、分类值及保守重写。
- 规模化公开代理评估: 对 FinBench、SNB 和 ICIJ Offshore Leaks 进行了全面的评估,包括消融实验、评判校准、脱敏审计以及 11 个模型的本地迁移研究。
- 可复现性产物: 提供用于入驻、数值采样、基准刷新、证据打包和审计追踪的工具。
结果
使用本地 Qwen3.5-9B 进行生成和评判,PIPE-Cypher 从 4,925 个候选集中产生了 3,000 个被接受的样本(其中 2,000 个来自 FinBench,1,000 个来自 SNB)。
- 接受率: 总体约为 61%。
- 覆盖度: 在两个图中均实现了所有 8 个工作负载类别的完美平衡。
- 可靠性: 在消融实验中,受治理的流水线对每个非受限单元格都达到了 100% 的目标覆盖率,而不受约束的生成未能产生平衡且可执行的覆盖。
- 多样性: 虽然由于模板引导导致查询签名(Query-signature)的多样性较低,但通过多样性驱动的选择器提升了结构覆盖度、调整了 Distinct-2 以及属性覆盖度。
- 评判校判: 对 80 行数据的后期人工审计显示,本地 LLM 评判与人工的一致性为 80%(Cohen's κ = 0.60)。该评判非常保守,在样本中未观察到误判接受的情况。
下游评估:
- 零样本性能(Zero-Shot Performance): 在留出集的零样本迁移表现较弱,平均执行准确率在 0.000 到 0.203 之间波动(均值为 0.036)。
- 少样本效用(Few-Shot Utility): 特定模式的示例库提升了性能。排除精确查询签名匹配的“无签名”对照组使平均准确率提升至 0.200,而有序同类别示例库则达到了 0.269。
- 失效模式: 该基准成功暴露了语义失效问题;许多模型生成的 Cypher 语法正确且能执行,但回答了错误的问题(例如,52.1% 的错误属于答案不匹配)。
意义与主张
本文将 PIPE-Cypher 定位为一种可重复的 enterprise 工作流,而非静态数据集。其意义在于:
- 从静态转向动态: 它使组织能够随着其图数据和工作负载的演进来刷新基准,而不是依赖过时的公开语料库。
- 隐私保护: 它允许在不将敏感数值暴露给外部 API 的情况下,对私有数据进行基准测试。
- 可执行的真相: 通过将正确性视为通过执行和确定性门控进行检查,而非仅仅通过提示词来期望,它过滤掉了那些看起来正确但语义失效的“幻觉”查询。
- 诊断价值: 该流水线提供了清晰的诊断工具(拒绝日志、多样性指标、失效分类法),帮助组织理解模型在何处失效(如方向错误、空结果或语义失配)。
作者谦虚地指出,虽然该基准揭示了仅靠语法评估无法发现的下游模型失效问题,但它并不保证语义正确性(执行有效性 = 语义正确性)。他们还提到,研究结果是基于公开代理数据(FinBench, SNB, ICIJ)得出的,且租户特定的微调是该研究所提供的产物所支持的技术路径,而非本研究已完成的声明。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。