← 最新论文
💬 NLP

REAP: Relation-Aware Elicitation and Parsing for Closed-Book Knowledge Base Construction from LLMs

REAP 系统基于一个未经微调的 24B 参数 Mistral 模型构建,通过采用结构化思维链推理、特定关系的查询以及基于推理的空集门控机制,将参数化知识提取并解析为有效的 JSON 数组,从而在 AKBC Shared Task 2026 中实现了 0.62 的 macro-F1 分数。

原作者: Thanh-Dan Bui, Thanh-Trung Do, Tuan-Phong Nguyen

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Thanh-Dan Bui, Thanh-Trung Do, Tuan-Phong Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个朋友,他读过世界上几乎所有的书,并记住了惊人的事实,从法国的首都是什么到特定星系中有多少颗恒星。这个朋友就是一个“大语言模型”(LLM)。通常,当你问他一个简单的问题,比如“谁获得了诺贝尔奖?”,他会给出一个快速的回答。但如果让你列出每一个曾经获得过该奖项的人,或者准确告诉你是哪些国家与一个微小的岛国接壤呢?突然间,这项任务变得困难得多。这位朋友可能会忘记几个名字,编造一个虚假的获奖者,或者在搞不清一个岛屿是否真的有邻居时感到困惑。

这就是“知识库构建”面临的挑战。科学家们希望将这些巨大的、充满事实的大脑转化为计算机可以可靠使用的组织化数据库。棘手之处在于,这位朋友(AI)并没有可以查阅的图书馆;他必须完全依赖于大脑内部的东西(他的“参数”)。如果答案是“没有人”,朋友需要知道应该说“为空”而不是瞎猜。如果答案是一个长列表,他们需要确保每一个项目都准确无误,一个都不掉队。这篇论文探讨了如何向这些 AI 朋友提出正确的问题,以获得完美、有序的列表,而不让他们产生幻觉或陷入混乱。


REAP 系统:AI 记忆的侦探指南

认识一下 REAP(关系感知提取与解析)。不要把 REAP 仅仅看作一个提问者,而要把它看作一个聪明的侦探团队,正在与一位非常聪明但有时有点丢三落四的证人(AI 模型)合作。目标是什么?是从证人的记忆中构建出一个完美、有序的事实列表,而不让其信口开河。

研究人员发现,如果你只是问 AI,“列出与 X 接壤的所有国家”,它可能会感到不知所措、遗漏一些,或者不小心发明一个不存在的边界。这就像要求一名学生一口气背诵一整章教科书;他们可能会磕绊。相反,REAP 将这项工作分解为两个截然不同的阶段,就像一个两步走的面试过程。

第一阶段:侦探的审讯(推理)
在第一阶段,REAP 不仅仅是索要答案。它要求 AI 在开口说话之前先进行思考。根据问题的类型,侦探会使用特殊的策略:

  • 针对边界: 与其问“谁与此接壤?”,不如告诉 AI 扮演一名地理专家,并向四个方向(北、南、东、西)扫描地图,以确保不会遗漏任何小的邻国。
  • 针对奖项: 如果 AI 需要列出获奖者,它不会直接猜测。它会将时间拆解成年代,询问:“谁在 1970 年代获奖?谁在 1980 年代获奖?”这确保了 AI 不会跳过整个时代。
  • “空集”闸门: 这是一个至关重要的安全网。有时答案是“没有人”(比如尚未去世的在世之人,或不是上市公司的私人公司)。REAP 教会 AI 识别属性不存在的情况,并自信地说“列表为空”,而不是编造一个虚假的名字。

第二阶段:抄录员的清理(解析)
一旦 AI 完成了它的思考并生成了一个凌乱的事实列表,第二阶段就会介入。这个阶段的角色是负责清理笔记的抄录员。系统使用严格的规则来抓取答案,并将其完美地格式化为 JSON 列表(一种标准的计算机格式)。如果 AI 搞混了,写成了一段话而不是一个列表,抄录员会尝试修复它。如果无法修复,系统会尝试用更简单的提示词再次提问。

研究发现

研究人员使用了一个名为 Mistral-Small-24B-Instruct-2501 的特定 AI 模型来测试该系统,该模型拥有约 240 亿个“脑细胞”(参数)。他们遵循着严格的规则:不得在互联网上查找信息,不得修改 AI 的大脑(不进行微调),并且使用的模型参数不超过 320 亿。

结果非常令人鼓舞。在一组困难的问题测试集中,REAP 系统实现了 0.62 的 macro-F1 分数。为了让你理解,这显著优于组织者的基准系统(得分为 0.30),也优于使用 Llama 或 Gemma 等其他流行 AI 模型并采用相同方法的结果。

该系统在特定类型的问题上表现最为出色:

  • 国家边界: 它获得了 0.95 的分数,这意味着它在列出邻国方面几乎达到了完美。
  • 证券交易所: 它在寻找公司交易地点方面得分为 0.73
  • 面积: 它在计算地理区域大小方面得分为 0.77

然而,该系统并非在所有领域都完美。它在场馆容量方面表现稍弱(得分为 0.23),经常会将一个小型的当地体育场与一个名字相似的著名体育场混淆。研究人员认为这是因为 AI 的内部记忆在处理非常具体的数字或罕见的“长尾”事实时并不总是足够精确。

这意味着什么(以及不意味着什么)

论文指出,从 AI 获取更好答案的关键不仅在于拥有更大的大脑,还在于以正确的方式提出正确的问题。通过强制 AI 进行“逐步思考”(使用思维链推理)并为不同类型的事实提供特定的策略,该系统可以提取出更准确的信息。

不过,作者也谨慎地指出,这并不是万灵药。该系统完全依赖于 AI 已经记忆的内容。如果 AI 不知道某个非常罕见实体(如一个小岛或一个次要奖项)的事实,系统无法凭空创造它。此外,由于 AI 是在特定的计算机芯片(TPUs)上运行,结果中存在极小的随机性,但这种随机性小到不会改变整体结论。

简而言之,REAP 表明,只要有一点结构化的引导和足够的耐心,我们就能从这些 AI 朋友那里诱导出更加可靠的事实,将他们混乱的记忆转化为整齐、可用的列表。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →