← 最新论文
💻 computer science

A Community-driven Hub for High-Quality Text2Cypher Benchmarks and Resources

本文介绍了 Text2Cypher-Hub,这是一个通过发布三个经过策划的特定领域基准测试,并建立一个用于共享数据集、模型和工具的标准注册表,从而解决将自然语言转换为 Cypher 查询的高质量评估资源匮乏问题的社区驱动型平台。

原作者: Emanuele Cavalleri, Nada Bou Kanaan, Marco Mesiti

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Emanuele Cavalleri, Nada Bou Kanaan, Marco Mesiti

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,海量的信息并非存储在简单的列表中,而是存储在复杂的网络之中。想象一座图书馆,每一本书都与其提到的每一本其他书、每一位作者以及每一项主题相连,形成了一个错综复杂的知识网。这就是属性图(property graphs)的工作方式:它们描绘了事物之间的关系,例如某个特定基因如何与某种疾病相关联,或者一个银行账户如何连接到一系列金融交易。虽然这些结构在存储数据方面功能强大,但对其进行提问却非常困难。为了获取答案,人类必须使用一种非常特定且僵化的计算机语言——Cypher,这要求使用者必须精确了解数据的组织方式。这为那些精通专业领域(如生物学家或金融分析师)但不精通数据库语言的专家们制造了障碍。

Text2Cypher 任务的目标就是通过允许人们用普通的英语提问,并让计算机将这些问题翻译成正确的 Cypher 指令,来弥补这一差距。大型语言模型(即能够撰写文章或与人聊天的同类人工智能)在执行这种翻译任务方面已展现出潜力。然而,为了让这些模型能够有效地学习,并让研究人员了解它们是否真的在进步,它们需要高质量的练习材料。直到目前为止,该领域一直缺乏一个共享、有序的寻找这些材料的场所,而且许多现有的练习集要么过于简单,要么是由机器生成,无法反映真实的人类好奇心。

来自米兰大学的一个研究小组通过构建一个新的社区枢纽并发布三个高质量的数据集,解决了这一问题,旨在训练和测试这些翻译系统。他们创建了一个名为 Text2Cypher-Hub 的平台,该平台作为一个中央目录,让研究人员可以在不强制要求所有人将文件存储在单一位置的情况下,分享他们的数据、代码和结果。该团队不仅仅是在收集数据,更专注于质量。他们人工编写了 6,500 对自然语言问题及其对应的计算机查询语句,涵盖了三个截然不同的领域:微 RNA 与基因的复杂生物学、针对特定网络喷子调查的社交媒体帖子的混乱流向,以及用于检测欺诈的复杂金融交易网络。

研究人员并非简单地要求计算机生成这些问题。他们采用了严格的多步骤人工流程,以确保每一对数据都准确无误。首先,一位熟悉特定数据库的开发人员会编写一个真实的专家可能会提出的问题。然后,他们制定出回答该问题所需的精确计算机查询语句。接着,由一名数据库专家检查该查询语句是否能无误运行,最后,由一名领域专家(即在生物学、社交媒体或金融领域拥有深厚知识的人员)验证计算机给出的答案是否确实符合原始问题的意图。这种细致的人工监督确保了问题捕捉到了真实的实际信息需求,而非仅仅遵循僵化的模板。

最终生成的基准测试集命名为 bio2C、twt2C 和 fin2C,涵盖了广泛的难度等级。有些问题询问简单的事实,例如查找特定的账户持有者;另一些问题则需要复杂的推理,例如追踪跨多家银行的资金转账链,或识别疾病在生物网络中传播的模式。研究人员通过将这些数据集输入到几种不同的人工智能模型中进行了测试。他们发现,当模型不仅获得问题,还获得几个类似的问答示例以及数据库结构的地图时,效果最好。有趣的是,最有效的工具组合因数据类型而异;适用于金融数据的最佳方案并不总是适用于生物数据。

这项工作表明,尽管人工智能在将人类语言翻译成数据库命令方面正变得越来越出色,但未来的路径在很大程度上取决于训练材料的质量。新的枢纽提供了一种标准化方式供全球社区共享这些材料,从而确保未来的系统可以进行公平的比较。通过提供这些资源,研究人员为开发更可靠的工具奠定了基础,这些工具最终将允许科学家和分析师仅使用自己的语言即可探索复杂的数据库网络,从而无需学习专门的编程语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →