← 最新论文
💬 NLP

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

该论文提出了 RIMS,这是一个针对检索增强生成中小型语言模型的三阶段偏好优化框架,该框架利用自生成的合成数据和一种可微的软聚合机制来有效地利用多个偏好对,从而在噪声检索条件下超越了最先进的基准模型。

原作者: Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但身材娇小的机器人如何回答棘手的问题。这个机器人是一个“小规模语言模型”(SLM)。把它想象成一个读过几本书但还没背下整个图书馆的优秀高中生。当你问它一个难题时,它会变得紧张,甚至可能会胡编乱造。为了提供帮助,你给了它一份来自互联网的搜索结果“小抄”,这种技术被称为检索增强生成(RAG)。

然而,这里有一个陷阱:互联网是混乱的。你的小抄可能包含真事实、混乱的传闻和彻头彻尾的谎言。一个庞大且超级强大的机器人(大语言模型)可能能够识别出这些谎言并忽略它们。但我们的这个小机器人呢?它经常会被噪音搞糊涂,相信错误的信息并给出错误的答案。科学家们尝试通过教机器人进行“在不同答案之间进行选择”来解决这个问题,这种方法被称为“偏好优化”。但旧的教学方式就像一位严厉的教练,只盯着机器人犯下的最严重的那个错误,而忽略了其他一切。事实证明,忽略其他线索会让机器人变得更加困惑。

这篇论文介绍了一种新的训练方法,叫做 RIMS(通过平滑多对聚合实现的检索增强生成)。RIMS 不再像那位只盯着单个“最差”错误进行纠正的严厉教练那样行事,而是像一位睿智的导师,观察机器人生成的所有示例。它将好的和坏的线索温柔地融合在一起,形成一个单一的、平滑的教训。这有助于这个小机器人更好地识别其小抄中的噪音,即使信息非常混乱。研究人员在四种不同的困难问答游戏中测试了该方法,发现与旧的严厉方法相比,RIMS 能让小机器人获得正确答案的次数显著增加。

问题所在:小机器人与混乱的图书馆

让我们深入了解这个故事。我们拥有这些小型、高效的 AI 模型(SLM),它们非常适合在手机或小型计算机上运行,因为它们不需要消耗大量的电力。但它们的“大脑容量”较小。它们掌握的知识没有巨型模型那么多。为了解决这个问题,我们将它们连接到搜索引擎(RAG),以便它们可以查找事实。

问题在于搜索引擎并不完美。有时它们带回的文件完全无关,甚至相互矛盾。当一个微型 AI 试图阅读包含真相和一堆废话的文件堆时,它往往会被淹没。它可能会抓取错误的事实,并自信满满地将其陈述为真理。

旧的方法:“最难错误”教练

为了教这些 AI 变得更好,研究人员使用了一种名为偏好优化的技术。想象一下,你向 AI 展示了针对一个问题的十个不同答案。有些是好的,有些是坏的。目标是教 AI 偏好好的答案并拒绝坏的答案。

此前,一种流行的方法(称为 RoseRAG)表现得像一位非常严厉的教练。当 AI 生成十个答案时,教练会看着它们说:“好吧,我看到了一个非常糟糕的答案和一个非常好的答案。我要忽略另外八个。我们将只针对这一对‘最好’和‘最差’的组合进行训练。”

论文指出,这是一种信息的浪费。通过扔掉另外八个答案,这位教练忽略了关于为什么其他答案更好或更差的宝贵线索。这就像一个学生在考试中答错了一道题,而老师只纠正了这一个特定的错误,却忽略了学生同时也把另外三道题也答错了一点点的事实。学生因此错失了大局。

新的方法:RIMS 与“平滑融合”

作者提出了 RIMS,它彻底改变了这种教学风格。RIMS 不再仅仅挑选一个“赢家”和一个“输家”,而是观察 AI 生成的所有答案。

这里有一个神奇的技巧:RIMS 使用了一个叫做 LogSumExp (LSE) 的数学工具来创建一个“平滑融合”。想象一下,你有一个装有十种不同配料(十个答案)的汤碗。旧的方法只会舀出一勺最咸的和一勺最淡的,然后把剩下的都扔掉。而 RIMS 则会将整个汤碗搅拌在一起,调配成一种完美的、平衡的味道。

这种“平滑”的混合物创造了一个单一的、统一的教训,其中包含了来自每一个答案的信号。它既不忽略简单的,也不忽略困难的;它将它们全部加权在一起。这被称为“可微软聚合”。它是“可微”的,因为数学允许 AI 平滑地从这种混合物中学习;它是“软”的,因为它不会对关注哪个答案做出非黑即白的生硬决定。

他们的发现

研究人员在四种不同的“多跳”(multi-hop)问答基准测试中测试了 RIMS。这些测试就像是智力竞赛,你必须连接多个信息碎片才能得到答案,而且搜索结果通常充满了干扰项。他们使用了两种不同的小型 AI 模型(Qwen2.5-1.5B 和 Gemma-2-2b)进行了测试。

结果非常明确:

  • 更高的分数: RIMS 在获得精确匹配(Exact Match)和匹配正确词汇(F1 分数)方面,始终优于现有的最佳方法(如 RoseRAG)。
  • 处理噪音的能力: 当研究人员在搜索结果中加入越来越多的“噪音”(无关文档)时,旧的方法开始失效。然而,RIMS 却能保持良好的表现。它证明了自己对混乱信息具有极强的鲁棒性。
  • 理论证明: 作者不仅仅是凭直觉认为这行得通;他们还进行了数学推导。他们证明了这种“平滑”方法减少了学习过程中的“方差”(或随机性)。简单来说,旧的方法就像一只手颤抖着试图画一条直线,而 RIMS 则是一只稳健的手。他们还展示了这种平滑方法的“误差”是可以被控制并保持在极小范围内的。

为什么这很重要

这篇论文表明,对于小型、高效的 AI 模型,我们不应该丢弃数据。即使 AI 生成了一堆答案,每一个答案都蕴含着线索。通过使用一种“平滑”的方式来结合所有这些线索,我们可以让这些微型机器人变得更加聪明和可靠,即使它们找到的信息非常混乱。这是朝着让强大的 AI 在日常设备上普及、而无需依赖超级计算机迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →