← 最新论文
💬 NLP

Enhancing LLMs through human feedback: a journey towards self-improvement

本文提出了一种新颖的人机回环方法,该方法通过集成一个辅助反馈 RAG 系统,利用持续的用户反馈来迭代优化主 RAG 系统的性能,并通过 LLM-as-a-Judge 评估,证明了其在多种基准测试中在准确性和相关性方面的显著提升。

原作者: Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人图书管理员,名叫 RAG。这位图书管理员非常擅长寻找书籍(文档)并根据它们编写答案。但有时,这位图书管理员会出错,或者给出的答案感觉有些生硬、机械化。在传统情况下,如果你不喜欢一个答案,你只会给一个“踩踩”图标。这就像是一个二进制开关:只有“好”或“坏”两种状态。它告诉机器人“不好”,但并没有告诉它为什么不好,或者应该如何修正。

这篇论文介绍了一种教导这位图书管理员的新方法,叫做 FLARE(反馈驱动的 LLM 自适应 RAG 增强)。FLARE 不仅仅是提供一个“踩踩”,它允许用户留下详细的笔记、纠正意见,甚至是风格建议。这就像是一个学生在考试中得到的是一个红色的“X”,与得到老师的一句评语——“日期对了,但你忘了提到国家,而且你的语气太生硬了”——之间的区别。

两步舞步:离线准备与在线魔法

FLARE 的运作方式是两个在后台进行的步骤,就像是在图书管理员工作时进行的“两步舞步”。

第 1 步:离线准备(学习阶段)
当用户留下详细笔记时,FLARE 并不仅仅是将它存档。它会将笔记通过一个“上下文富集”过程。想象一下,用户说:“错了,是唐纳德·特朗普。”FLARE 会利用聊天历史将这个片段转化为一个清晰、完整的句子:“截至 2025 年,美国的现任总统是唐纳德·特朗普。”

然后,一个特殊的 AI(“裁判”)会将这些笔记分类到两个桶中:

  1. 事实检查: “嘿,更新数据库,总统换人了!”
  2. 风格指南: “嘿,下次请更有礼貌,并包含更多的历史背景。”

这些笔记随后会被转化为数字化的“搜索标签”,并存储在一个特殊的图书馆(向量数据库)中。这就是“离线”部分,即系统从过去中学习的过程。

第 2 步:在线魔法(现场表演)
现在,一位新用户提出了问题。在图书管理员回答之前,FLARE 会进行快速的侧面检查。它会问:“以前有人问过类似的问题吗?他们留下过笔记吗?”如果答案是肯定的,FLARE 会抓取这些笔记,并在图书管理员编写答案的过程中,直接将其注入到图书管理员的大脑里。这就像是图书管理员突然想起了之前一位顾客留下的便签,上面写着:“别忘了添加更多细节!”

证明:它奏效了吗?

作者在三个不同的“游乐场”中测试了这个想法,以观察它是否真的让图书管理员变得更聪明。

  1. 虚构游乐场: 他们使用了关于虚构人物的虚构对话。在没有 FLARE 的情况下,图书管理员有点困惑,在缺少上下文时得分仅为 1 分(满分 5 分)。有了 FLAFRE,图书管理员在几乎所有问题上都获得了接近完美的得分(5 分)。
  2. 知识问答游乐场: 这是最棘手的部分。他们询问了关于 2024 年和 2025 年的事件——这些是机器人原本不应该知道的事情,因为其训练数据在更早之前就停止了。
    • 没有 FLARE: 图书管理员会猜错或给出模糊的答案,平均分为 3.06(满分 5 分)。
    • 有了 FLARE: 图书管理员利用之前用户的反馈来学习新的事实。平均分跃升至 3.91(满分 5 分)。
    • 示例: 当被问及 2025 年奥斯卡奖时,基础版的图书管理员答错了获奖者。FLARE 将其纠正为正确的人选,甚至还增加了关于特定人群历史性胜利的精彩细节。
  3. 技术支持游乐场: 他们在关于无线网络(英特尔内部数据)的真实世界问题上测试了它。在这里,他们发现 FLARE 在找到正确反馈方面表现出色(成功率达到 95%)。然而,该系统仅在 利用 这些反馈来改进最终答案方面达到了 61% 的成功率。

FLARE 不是什么(以及它仍然需要什么)

了解这篇论文没有声称什么非常重要。作者谨慎地表示,FLARE 并不是一个能瞬间解决一切问题的魔杖。

  • 它不是完美的解决方案: 在技术支持测试中,尽管系统找到了 95% 的正确笔记,但它仅在 61% 的情况下利用这些笔记来修复答案。作者认为这是因为他们“注入”笔记的方式(将其嵌入文本中)有时会导致机器人忽略最重要的部分。
  • 它尚未实现完全自主: 该系统目前将所有反馈视为同等对待。它不知道一条笔记是来自世界级专家还是困惑的用户,也不知道一条笔记是来自昨天还是去年的。作者承认他们需要建立一种更聪明的方法来决定哪些笔记更重要。
  • 它不是一个“已解决”的问题: 论文明确指出,该系统存在“进一步完善的机会”。他们计划添加诸如检查谁写了反馈,以及如果答案看起来很弱则重新阅读笔记等功能。

核心结论

主要的发现是,给机器人图书管理员提供详细的、书面的反馈——并在它回答新问题时让它阅读这些笔记——能显著提高它的准确性和帮助性。在他们进行的模拟和测试中,这种“人类在环(human-in-the-loop)”的方法将一个优秀的系统变成了一个卓越的系统,尤其是在处理机器人此前不知道的新信息时。但正如作者指出的,通往完全自我进化的机器人的旅程尚未结束;他们仍需弄清楚如何让机器人去倾听那些最好的笔记,而不仅仅是任何笔记。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →