← 最新论文
💬 NLP

Is It Novel and Why? Fine-Grained Patent Novelty Prediction Based on Passage Retrieval

本文介绍了 FiNE-Patents,这是一个细粒度数据集以及一种新颖的基于大语言模型的工作流程,它将专利新颖性预测从粗略的二元分类转变为细粒度的检索与推理任务,在识别具体现有技术段落方面展现出更优的性能,并具备对虚假相关性的鲁棒性。

原作者: Valentin Knappich, Anna Hätty, Simon Razniewski, Annemarie Friedrich

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Valentin Knappich, Anna Hätty, Simon Razniewski, Annemarie Friedrich

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名专利审查员。你的工作是判断一项新发明是否真正“新颖”,或者是否已有他人在旧文档库(称为“现有技术”)中描述过。

传统上,计算机程序试图通过扮演是非保安来协助这项工作。你会向它们输入一项专利权利要求和一份旧文档库,而计算机仅基于简单的猜测,就会大喊“新颖!”或“不新颖!”。

正如本文所解释的,问题在于这些保安在作弊。它们并非真正阅读文档以寻找真相,而是在寻找捷径。例如,它们发现如果一项专利权利要求非常长,通常就是“新颖”的(因为发明人会增加细节以应对旧的驳回);如果权利要求很短,通常就是“旧的”。计算机学会了仅仅通过统计字数来猜测,而从未真正理解该发明。

本文介绍了一种更聪明的新方法,称为FiNE-Patents

新方法:“侦探”与“猜谜游戏”

作者不再要求计算机简单地猜测“是”或“否”,而是让它扮演一名侦探,必须逐步解开谜题。

以下是他们新系统的工作原理,使用一个简单的类比:

1. 旧方法(“猜谜游戏”):
想象一名学生参加考试。老师问:“这个故事是新的吗?”学生并没有阅读故事,而是注意到故事有 10 页长。他们记得“长故事通常是新的”,于是写下“是”。他们得到了正确答案,但实际上什么都没学到。这就是旧计算机模型所做的。

2. 新方法(“侦探”):
新系统(FiNE-Patents)迫使计算机将专利拆解成微小的部分,就像单个乐高积木一样。

  • 第一步:拆解。 计算机将庞大的专利权利要求拆分为细小的特征(例如,“一个摄像头”、“一个特定角度”、“一个移动屏幕”)。
  • 第二步:寻找证据。 对于每一个微小的乐高积木,计算机必须进入旧文档库,找到确切页码,其中提到了该特定积木。这就像说:“向我展示旧书中谈论这个特定摄像头的段落。”
  • 第三步:做出裁决。 只有在找到每一个部分的证据后,计算机才会做出决定:“好吧,这个特定摄像头是旧的,但这个特定角度是新的。因此,整个发明是新的。”

新数据集:线索的“金矿”

为了教会计算机这种侦探工作,作者构建了一个名为FiNE-Patents的大型新数据集。

  • 它来自哪里? 他们查阅了欧洲专利局的真实驳回通知书。当审查员驳回一项专利时,他们会撰写一份详细的报告(称为 ESOP),解释确切哪些部分属于现有技术,并指出旧文档中证明这一点的具体页码。
  • 它有何特别之处? 以前的数据集就像一张模糊的地图,只说“旧东西在这本书的某处”。而这个新数据集就像一本高亮标注的教科书。它指出:“特征 A 在第 5 页第 2 段,特征 B 在第 10 页第 4 行。”
  • 规模: 他们收集了 3,658 项带有这种精确到页的线索的专利权利要求。

结果:智能模型与作弊模型

作者使用强大的 AI 模型(大语言模型,即 LLM)测试了这个新系统,并将其与旧的“作弊”模型进行了比较。

  • 作弊者: 旧模型(如标准的 BERT 分类器)如果允许使用捷径(如统计字数),在“是/否”测试中表现很好。它们的准确率达到 75%。但是,当作者创建一个“技巧测试”使字数不再重要时,作弊者惨败。他们意识到这些模型并没有真正学会阅读;它们只是记住了模式。
  • 侦探: 基于 LLM 的新工作流程,通过将专利拆解为特征并搜寻证据,在查找旧文档中的具体页码方面表现更好。
    • 它们不依赖捷径。即使在“技巧测试”中,它们依然表现稳健。
    • 它们在查找旧文档中与新技术完全匹配的确切句子方面,表现要好得多。

核心结论

本文认为,我们需要停止将专利新颖性视为一个简单的“是/否”问题。这对它来说太复杂了。

相反,我们应该将其视为一项法医调查。我们需要能够:

  1. 将发明拆解为小部分。
  2. 为每个部分找到具体证据。
  3. 通过指向确切来源来解释为什么它是新的或旧的。

作者已将他们的新数据集和他们的“侦探”代码向公众发布。他们希望这将有助于构建专利审查员真正可以信赖的 AI 工具,因为这些工具不会仅仅猜测——它们将展示其工作过程,并用证据证明其结论。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →