← 最新论文
🤖 AI

RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection

本文介绍了 RoCo-ACE,这是一种基于展开(rollout)调控的在线蒸馏框架,通过将蒸馏权重动态重新分配给受参考支持的标记(tokens),并应用稀疏锚定修正,从而在增强预训练多模态大语言模型(MLLMs)知识注入能力的同时,有效保持模型的原始行为保留,实现了卓越的注入知识准确性。

原作者: Yan Hong, Wei Li, Kedong Xiu, Jun Lan, Shuheng Zhou, Zhongcai Lyu, Huijia Zhu, Weiqiang Wang, Jianfu Zhang

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yan Hong, Wei Li, Kedong Xiu, Jun Lan, Shuheng Zhou, Zhongcai Lyu, Huijia Zhu, Weiqiang Wang, Jianfu Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它读过图书馆里几乎所有的书,也看过数以百万计的图片。这个机器人非常擅长聊天、解谜和描述它所看到的事物。但问题在于:世界每天都在变化。新的电影上映,新的科学发现诞生,名人也在做着新的事情。如果你想让你的机器人朋友了解这些新鲜的事实,你必须教它。但教导一个巨大的机器人是很棘手的。如果你只是强迫它死记硬背一个新的事实,它可能会忘记它以前的旧本领,比如画一只猫或者回答一个安全问题。这就像试图教一位国际象棋大师一个新的开局招式,却在这个过程中让他忘记了如何玩这局游戏。这篇论文解决的正是一个这样的问题:如何在不破坏机器人原有的、可靠的技能的情况下,将新的、特定的事实悄悄植入它的脑海。

这项研究背后的研究人员(与蚂蚁集团及多所大学合作)意识到,通常教导这些机器人的方法有点笨拙。一种方法就像是强迫机器人逐字逐句地抄写教科书;它学会了这个事实,但也开始听起来像个枯燥的机器人,并失去了它的个性。另一种方法试图非常小心,只微调大脑的一小部分,但它往往抓不住重点,导致新事实学得半吊子。由 Yan Hong 和 Jun Lan 领导的团队提出了一种巧妙的新策略,叫做 RoCo-ACE。把它想象成一个“智能荧光笔”系统。与其让机器人背诵整本教科书,不如让他们先尝试回答问题。然后,我们将机器人的答案与来自老师的“正确”答案进行对比。

这就是其中的魔术技巧:系统会观察机器人的答案,并问道:“老师的帮助是否让这个特定的词变得更有可能被说出来?”如果机器人猜中了一个正确的细节(比如一个特定的日期或名字),并且老师的存在让这个猜测变得更加笃定,系统就会给这个词一个“击掌”,并告诉机器人要牢记它。但如果机器人只是在使用一些通用的词汇(比如用“一座大建筑”而不是“埃菲尔铁塔”),系统就会忽略它们。这就是 RoCo 部分。接着是 ACE 部分。有时,机器人会完全错过那个新的事实。ACE 系统就像是一个温柔的提醒,说道:“嘿,你忘了那个博物馆的名字了!让我们只修正那一个缺失的部分吧。”通过结合这两者,机器人可以准确地学习新事实,而不会失去其自然聊天的能力或保持安全性。

团队在三种不同类型的知识更新上测试了它,从关于名人的新闻到科学事实。他们发现,RoCo-ACE 在教授新事实方面比其他方法表现得更好。在一项测试中,它将机器人的知识准确度提升到了 27.6(相比之下,标准的“抄写教科书”法为 20.1)。至关重要的是,当其他方法导致机器人的旧技能退化(其通用性能得分降至低至 31.8)时,RoCo-ACE 却让机器人的通用技能几乎保持在初始水平,约为 56.5。该论文表明,这种方法提供了一个更好的平衡点:你既得到了新信息,又不会让机器人失去自我。这是迈向让机器人每天都能学习新事物而不忘初心的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →