← 最新论文
💻 computer science

Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction

本文提出了"ThinkTwice"框架,该框架通过利用采样生成多个候选输出,并经由无监督一致性或监督奖励模型选择最佳结果,从而提升文档级信息提取效果,进而超越传统的贪婪解码方法。

原作者: Mikel Zubillaga, Oscar Sainz, Oier Lopez de Lacalle, Eneko Agirre

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mikel Zubillaga, Oscar Sainz, Oier Lopez de Lacalle, Eneko Agirre

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图根据一个冗长且杂乱的故事来解决一个复杂的谜题。你的目标是提取具体事实(例如谁做了什么、在哪里、何时发生),并将它们组织成一份整洁、结构化的报告。这就是该论文所称的“文档级信息抽取”。

长期以来,当计算机(特别是大型语言模型或 LLM)尝试执行此任务时,它们使用了一种称为“贪婪解码”的方法。这就像一名正在参加考试的学生,在每一步都只选择当下看起来最可能正确的一个答案,而不向前看或考虑其他可能性。他们只是沿着第一条看似清晰的路径匆忙冲向终点。

这篇论文的作者米克尔·祖比利亚(Mikel Zubillaga)及其团队认为,这种“匆忙冲向终点”的方法实际上阻碍了计算机的进步。他们提出了一种名为THINKTWICE的新框架。

以下是THINKTWICE的工作原理,分解为简单的概念:

1. “三思而后行”策略(采样)

THINKTWICE不是要求计算机只给出一个答案,而是要求它生成报告的多个不同版本(论文中使用了 64 次不同的尝试)。

  • 类比:想象你是一位厨师,试图制作完美的汤。
    • 贪婪解码就像尝了一口刚做好的汤,然后立即决定:“这就是最终食谱”,而从不尝试调整盐分或添加更多香草。
    • THINKTWICE则像是烹饪 64 种略有不同的汤。其中一种可能太咸,一种可能太辣,但其中一种可能是完美的。

2. “裁判”(选择)

一旦计算机生成了 64 份不同的报告,你需要一种方法来挑选最好的一份。论文测试了两种担任“裁判”的方式:

  • 无监督裁判(F1 投票):这位裁判查看所有 64 份报告,并问道:“哪一份与其他报告最一致?”如果 64 份报告中有 50 份说嫌疑人是“约翰”,只有 10 份说是“简”,裁判就会选择包含“约翰”的版本。这就像一种众包决策,最常见、最一致的答案获胜。
  • 有监督裁判(奖励模型):这是一位更聪明的裁判,它经过“好”报告与“坏”报告示例的训练。它学会了识别使报告高质量的细微差别,即使该答案不是最常见的。

3. “推理”提升

论文还发现,使用专为“思考”而设计的模型(推理模型)会产生巨大差异。

  • 类比:标准模型就像一名快速的打字员,只是把想到的第一个东西打出来。而推理模型则像一名侦探,会停下来思考:“等等,如果炸弹在下午 5 点爆炸,嫌疑人就不可能在下午 4 点出现在银行。”
  • 论文发现,这些“侦探”模型为THINKTWICE系统提供了更好的原始材料,特别是在处理复杂任务时。

4. 解决“没有答案键”的问题

要训练“有监督裁判”,你通常需要一个包含计算机本应使用的思维过程(推理轨迹)的答案键(黄金标准数据)。但针对这种特定类型的任务,这些答案键并不存在。

  • 解决方案:作者使用了一种称为拒绝采样的巧妙技巧。他们让计算机生成多次尝试,保留最好的那些,并将这些“好”的尝试用作假答案键,以此教导计算机如何更好地思考。这就像一名学生给自己做的练习题打分,只保留做对的那些,并用它们来为真正的考试做准备。

他们发现了什么?

  • 思考优于匆忙:使用“三思而后行”方法(生成多个选项并挑选最佳者)始终胜过标准的“贪婪”方法(选择第一个可能的答案)。
  • 推理至关重要:专为推理(逐步思考)而设计的模型表现明显优于标准模型。
  • “裁判”有帮助:简单的“大众投票”裁判和经过训练的“奖励”裁判都提高了结果。经过训练的裁判表现最佳,创造了计算机从文档中提取信息能力的最新纪录。
  • 跨语言有效:即使系统仅在英语数据上进行训练,使用这种方法时,它仍然能在其他语言(如阿拉伯语或中文)上表现良好,其表现优于专门针对这些语言训练的系统。

简而言之:这篇论文表明,如果你想让计算机从长文档中提取事实,你不应该只要求它给出一个答案。你应该让它头脑风暴出 64 个不同的答案,然后使用一个智能系统来挑选最好的一个。这一简单的改变,结合“思考”模型,能带来更准确的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →