← 最新论文
💬 NLP

DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification

DecomposeRL 是一个半监督、可追溯的声明验证框架,它利用数据筛选漏斗和基于 GRPO 的强化学习来训练一个紧凑的 7B 模型,在产生可解释推理轨迹的同时,实现了与更大规模基线模型相当的性能。

原作者: Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文 DECOMPOSERL 的解释,将其拆解为简单概念并辅以日常类比。

核心难题:“黑盒”与“慢侦探”的对立

想象一下,你正在核实一个荒谬的谣言,例如:“《1984》的作者获得了诺贝尔奖。”

目前,计算机尝试解决此类问题主要有两种方式:

  1. “黑盒”分类器:这就像一名超级快速的保安,看到谣言后立刻大喊:“假的!”它速度快且通常准确,但如果你问“为什么?”,它只会耸耸肩。它无法提供任何证据。在高风险情境下(如医疗或政治),若看不到证据,你无法信任其裁决。
  2. “慢侦探”(分解法):这就像一名侦探,将谣言拆解为小问题:“谁写了《1984》?” -> “那个人获得过诺贝尔奖吗?” 它会记录下每一步,让你看到证据。然而,这些侦探往往速度慢、易犯错,且若无人类教师手把手指导,很难从新案例中学习。

DECOMPOSERL 是一个新系统,试图结合两者的最佳之处:既是一名快速、准确的侦探,又能为每个答案留下清晰、可审查的证据链。


工作原理:“智能提问者”

DECOMPOSERL 并非直接猜测答案,而是被训练成为一名审讯大师。它的任务不是直接回答主张,而是提出完美的问题组合来查明真相。

这就像玩二十个问题游戏,但计算机是在与自己对抗,以寻找通往真相的最有效路径。

1. “奖励系统”(教练)

为了教会这个 AI 提出好问题,研究人员没有仅仅说“做得好”或“做得差”。他们构建了一个多维奖励系统(就像一位拿着清单的严厉教练)。只有当 AI 提出的问题满足以下三个特定标准时,它才能获得积分:

  • 有用性(“游戏规则改变者”):如果去掉这个问题,最终答案会改变吗?
    • 类比:想象一个陪审团。如果一名陪审员问:“被告拥有一辆红色汽车吗?”而裁决结果不变,那这个问题就是无用的。但如果他们问:“被告当时在现场吗?”且这改变了裁决,那这个问题就是有用的。DECOMPOSERL 只保留那些能真正改变结果的问题。
  • 信息性(“仅事实”规则):问题必须仅使用提供的证据即可回答,且必须是单一、清晰的事实。
    • 类比:问“这个主张是真的吗?”是个坏问题,因为它只是重复了问题本身。问“这本书有多少页?”如果书的长度无关紧要,这也是个坏问题。AI 学会提出像“谁写了这本书?”这样具体且基于事实的问题。
  • 多样性(“不重复”规则):问题不应冗余。
    • 类比:如果你先问“谁写了这本书?”,接着又问“这本书的作者是谁?”,你就浪费了时间。AI 学会提出不同的问题,覆盖谜题的不同部分。

2. “数据漏斗”(过滤器)

训练一个聪明的 AI 通常需要数百万个示例,这既昂贵又缓慢。研究人员有一个巧妙的技巧:数据漏斗

  • 他们从互联网上收集了 155,000 个事实核查示例的庞大堆栈。
  • 他们通过一系列过滤器(就像咖啡滤纸)处理这些数据:
    • 过滤器 1:丢弃太短或太长的主张。
    • 过滤器 2:丢弃太容易(即使是简单的 AI 也能解决)或太混乱的主张。
    • 过滤器 3:去除重复项。
  • 结果:他们将这庞大的堆栈提炼成仅 5,000 个主张 的微小、高质量的“精华”。
  • 类比:想象试图通过品尝 155,000 道随机菜肴来学习烹饪,其中大多数要么烧焦要么淡而无味。相反,DECOMPOSERL 的创建者将其过滤为 5,000 份完美、厨师级水准的食谱。AI 从这个小型、高质量的集合中,比从那个庞大、混乱的堆栈中学习得更快、更好。

3. “半监督”技巧(无师自通)

通常,要训练一个 AI,你需要人类对每一个答案进行评分(金标准标签)。但人类速度慢且昂贵。

DECOMPOSERL 有一种特殊模式,即使 90% 的答案未评分,它也能学习。

  • 如何做到? 它使用一种称为自一致性的技术。AI 为同一个主张生成多个不同的“路径”(问题集)。如果 8 条路径中有 7 条对最终裁决达成一致,AI 就会假设该裁决是正确的,并将其作为“伪标签”用于自我教学。
  • 类比:想象一名学生在没有答案键的情况下参加考试。如果学生用五种不同的方法解题,且每次都得到相同的答案,即使没有老师检查,他们也会确信自己是对的。

结果:小身材,大能量

研究人员测试了他们的 70 亿参数模型(在 AI 世界中相对较小),将其与更大的模型(320 亿参数)甚至顶级专有系统(如 GPT-4)进行了对比。

  • 准确性:DECOMPOSERL 的表现与大它四倍的模型相当。
  • 效率:它仅使用 5,000 个主张的微小、精选数据集就实现了这一目标。
  • 半监督成功:即使仅使用 10% 的标注数据(其余 90% 为自评分)进行训练,它仍然优于所有其他同规模模型。

“痕迹”(纸质档案)

DECOMPOSERL 最重要的特点是,它不仅仅给你一个“真/假”的答案。它提供了一条痕迹

  • 类比:如果普通 AI 是一个从帽子里变出兔子的魔术师(你看到了结果,但没看到戏法),那么 DECOMPOSERL 就是一个向你展示空帽子、兔子以及它们放入帽子的确切时刻的魔术师,一步步展示全过程。
  • 输出看起来像一场对话:
    1. 问题:“谁写了《1984》?” -> 答案:“乔治·奥威尔。”
    2. 问题:“乔治·奥威尔获得过诺贝尔奖吗?” -> 答案:“没有,文档显示他没有。”
    3. 裁决驳斥(该主张为假)。

这允许人类审查工作。如果 AI 犯错,你可以查看“痕迹”,确切地看到是哪个问题或答案导致了错误。

总结

DECOMPOSERL 是一个聪明、高效的事实核查 AI,它学会提出正确的问题来解决谜题。它利用“过滤器”从少量高质量数据集中学习,并利用“自检查”系统在没有老师的情况下也能学习。其结果是一个与巨型超级计算机一样准确的系统,但能生成清晰的、逐步的解释,说明它是如何得出结论的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →