← 最新论文
🤖 AI

Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models

本文介绍了 SLIFT,这是一个选择性自学习框架,它将用户反馈分解为任务有效修复、特定条件规范和空组件,从而在冻结的骨干网络上训练互补的通用型(Generalist)和专家型(Specialist)LoRA 适配器,使大语言模型能够在适当的泛化范围内实现持续改进。

原作者: Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有点固执的机器人如何成为一个更好的对话者。你不仅仅是想让它背诵剧本,而是希望它能从与真实人类的每一次聊天中学习。这就是**大语言模型(LLM)**的世界——它们是聊天机器人和写作助手背后超级聪明的 AI 大脑。这些模型就像是人类知识的巨型图书馆,但它们可能会犯错、抓不住重点,或者给出一些技术上正确但乏味得令人恼火的答案。

为了解决这个问题,我们通常依赖用户反馈。当人类说“这不对”或“再简短一点”时,模型就会得到一个提示。但棘手的地方在于,用户的一条评论往往是多种不同指令的复杂混合物。一句话里可能包含“修正这个数学错误”(硬性规则),下一句可能是“我更喜欢幽默的语气”(可选偏好),而第三句则是“顺便给我讲个关于猫的笑话”(这与原本的数学问题毫无关系)。如果机器人试图将所有这些内容视为同类并同时进行学习,它可能会感到困惑,甚至在数学考试时讲笑话,或者忘记如何进行基础算术。研究人员提出的核心问题是:我们如何教机器人去倾听信息中“正确”的部分,并忽略其余部分,从而让它在变得更聪明的同时,不会变得行为怪异?

这篇论文介绍了一个名为 SLIFT(代表通过任务相关专业化进行交互反馈自我学习,Self-Learning from Interaction Feedback via Task-Relative Specialization)的巧妙新系统来解决这个难题。你可以把 SLIFT 想象成一个由两个机器人组成的超有组织的团队,它们协作处理一条混乱的用户评论。

首先,该系统扮演着侦探的角色。当用户发送反馈信息时,SLIFT 会将其分解成微小的、原子化的碎片,然后将每个碎片归入三个“桶”中的一个:

  1. 修正(Fix):这些是“必须具备”的内容。如果用户说“答案应该是 5,而不是 3”,这就是一条规则,即未来针对此类问题的每一个回答都必须遵循此规则。这是对机器人默认行为的永久性改变。
  2. 特定要求(Spec):这些是“锦上添花”或特定的偏好。如果用户说“用一个厨房类比”,这对于这个特定的数学题很好,但对于历史问题可能并不适用。这是一种条件性的优化。
  3. 无效(Null):这些是“忽略我”的部分。如果用户在询问数学解法时突然要求写一首关于猫的诗,这就是无关的噪音。它不应该影响机器人的任何学习过程。

一旦反馈被分类完毕,SLIFT 会使用两个不同的“学习者”(称为适配器/adapters)来处理更新,而不是试图强迫一个大脑去做所有的事。

第一个学习者是通用者(Generalist)。它就像机器人的核心人格。它只关注**修正(Fix)**项。如果用户指出了一个事实错误,通用者会学习确保在未来的默认回答中不再发生该错误。它将这种纠正“烘焙”进其永久记忆中,这样它就不需要每次都去思考这个问题。

第二个学习者是专家(Specialist)。它是“上下文检查员”。它不会改变通用者的核心人格。相反,它会在通用者给出答案后进行观察,并询问:“嘿,我们是不是漏掉了针对这个特定情况的某些特定要求(Spec)?”如果通用者给出了正确的数学答案,但忘记使用用户想要的厨房类比,专家就会介入。它会说:“保留数学部分,但加上类比,”并提供一个微小且有针对性的推动,以修复仅仅那一个问题。如果通用者已经做得尽善尽美,专家则会说:“保持原样,”然后什么都不做。

作者在两种不同类型的数据上测试了这个系统:一种是计算机扮演用户的模拟聊天,另一种是来自真实人类的真实世界聊天。结果表明,SLIFT 的表现非常出色。在模拟测试中,它的得分显著高于其他方法。在真实世界的测试中,它提高了模型遵循指令的能力和写作质量,同时没有破坏其解决复杂推理问题的能力。

作者发现,成功的关键在于不要将所有反馈视为一个巨大的整体。通过将“必须修正”的规则与“锦上添花”的偏好以及“无效”的噪音区分开来,模型才能在正确的时间学习正确的内容。通用者在基础方面变得更聪明,而专家则学会了成为特定情境下的得力编辑。这种方法表明,对于 AI 而言,要真正向人类学习,它需要具备选择性,明确知道哪些东西需要永远记住,哪些东西只需用于当下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →