← 最新论文
💬 NLP

OCC-RAG: Optimal Cognitive Core for Faithful Question Answering

本文介绍了 OCC-RAG,这是一个由任务特化型小语言模型组成的家族,这些模型是在一种新型多跳推理数据集上训练而成的,在忠实且基于上下文的问答任务中,其表现优于规模为自身 2 到 6 倍的通用模型。

原作者: Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze, Alla Chepurova, Dmitrii Tarasov, Nikita Andriianov, Daria Pugacheva, Vasily Konovalov, Andrey Galichin, Ivan Oseledets

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze, Alla Chepurova, Dmitrii Tarasov, Nikita Andriianov, Daria Pugacheva, Vasily Konovalov, Andrey Galichin, Ivan Oseledets

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一名侦探来破解谜案。你有两种类型的侦探:

  1. “百科全书型”侦探: 这位侦探读过世界上所有的书。他博学多才,但有时会因为过于自信于自己“认为”知道的东西,而忽略了你刚刚递给他的具体线索。如果你告诉他:“是管家干的。”但他在记忆中读到过“是园丁干的”,他可能会反驳你并说:“不,是园丁!”因为那是他脑子里的印象。

  2. “OCC-RAG”侦探: 这位侦探的图书馆规模较小,但他们接受过一个黄金法则的训练:“只看现在桌上的线索。” 如果桌上的线索显示是管家干的,他们就会说管家干的——即便他们的记忆在尖叫着反对。如果线索缺失,他们会诚实地说:“我现在还无法破解,”而不是胡乱猜测。

这篇论文介绍了一种名为 OCC-RAG 的这类“服从线索型”侦探家族。他们规模小、效率高,并且经过专门训练,能够忠实于你提供的信息,而不是依赖于他们自己记忆中的知识。

问题所在:当“聪明”成为阻碍

大型 AI 模型(如“百科全书型”侦探)非常出色,但它们有一个缺陷,叫做幻觉(hallucination)。当你基于一段特定的文本向它们提问时,它们往往会将自己在海量训练中学到的事实混入其中。

  • 论文中的例子: 假设你给出一个文本,其中写道:“查尔斯·戴高乐是首位美国总统。”(这是错误的)。
    • 一个庞大且聪明的模型可能会忽略你的文本,而说出“乔治·华盛顿”,因为那是现实世界中的“真相”。
    • 一个较小的、未经训练的模型可能会随口编造一个随机的名字,比如“唐纳德·特朗普”。
    • OCC-RAG 会看着你的这段虚假文本并说:“查尔斯·戴高乐”,因为它严格遵循了你提供的文档。当两者发生冲突时,它优先考虑的是忠实性(坚持原文)而非真实性(坚持现实世界的知识)。

他们是如何打造完美侦探的

研究团队不仅仅是缩小了一个大模型的规模,他们还建立了一套全新的训练流程,来教会这些小模型如何像侦探一样思考。

1. “虚假案件”工厂(合成数据)
为了训练这些模型,研究人员建立了一个能够创造 325 万个练习案例的工厂。

  • 设定: 他们提取真实的维基百科文章,将其拆解,并创建了“金牌”线索(真相)和“干扰项”线索(红鲱鱼/误导信息)。
  • 转折: 他们还制造了一些无法破解的案例。如果线索中没有答案,模型应该回答“信息不足”。
  • 结果: 模型学会了忽略噪音,寻找所需的特定线索,并知道何时停止并承认自己不知道。

2. “循序渐进”笔记本(结构化推理)
OCC-RAG 不仅仅是给出答案,它被强制要求以特定的格式写出其思考过程,就像侦探的笔记本一样:

  • 查询分析: “问题在问什么?”
  • 来源分析: “哪一段包含答案?”
  • 推理: “我是如何将线索串联起来的。”
  • 状态: “这题可解吗?是或否。”
  • 答案: 最终结论。

这迫使模型展示其推导过程,并引用所使用的确切句子,以便你可以验证它是否只是在瞎猜。

结果:小而强大

研究人员将这些小型模型(0.6 亿和 17 亿参数)与规模大得多的模型(高达 320 亿参数)进行了对比测试。

  • 比赛: 想象一场比赛,小模型骑着自行车参赛,而大模型则开着法拉利。
  • 结果: 在需要严格关注所提供文本的任务(例如多跳推理,即需要从不同段落连接线索)中,OCC-RAG 的自行车击败了法拉利
  • 具体优势:
    • 它们在忠实性方面表现更好:即使文本与它们的训练内容相冲突,它们也会坚持原文。
    • 它们在拒绝能力方面表现更好:它们知道何时说“我不知道”,而不是胡编乱造。
    • 由于规模极小,它们运行起来更快、成本更低。

核心启示

论文指出,对于那些准确性和证据比通用知识更重要的任务,你不需要一个巨大的、昂贵的“大脑”。你需要的是一个专门的、有纪律性的“大脑”。

通过训练一个小模型成为文本的“忠实追随者”而非“万事通”,研究人员创造了一个具备以下特性的系统:

  1. 值得信赖: 它不会对文档内容撒谎。
  2. 透明度高: 它能向你展示它究竟在哪里找到了答案。
  3. 高效: 它能以极小的能耗完成巨型模型的工作。

简而言之,OCC-RAG 证明了,有时候,做一个规模小且听话的跟随者,比做一个庞大且自以为是的专家要好得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →