← 最新论文
💻 computer science

Robust Trajectory Distillation: Hybrid Reweighting Meets Teacher-Inspired Targets

本文提出了鲁棒轨迹蒸馏(Robust Trajectory Distillation),这是一种标签保持框架,通过结合选择性引导重加权(Selective Guidance Reweighting)和教师启发式辅助目标(Teacher-Inspired Auxiliary Targets),在无需干净锚点或重新标记的情况下,有效地在噪声监督下的数据集蒸馏中抑制噪声并保留可迁移知识。

原作者: Kaifeng Chen, Lechao Cheng, Jiyang Li, Shengeng Tang, Fan Zhang, Yantao Pan, Yaxiong Wang, Tuanrui Hui, Zhun Zhong

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaifeng Chen, Lechao Cheng, Jiyang Li, Shengeng Tang, Fan Zhang, Yantao Pan, Yaxiong Wang, Tuanrui Hui, Zhun Zhong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名学生如何识别动物。你拥有一个庞大的教科书库(数据集),但不幸的是,一个淘气的恶作剧者调换了一些图片和标签。在“猫”这本书里,现在放着被贴上“猫”标签的狗的照片;而在“狗”这本书里,放着的却是卡车的照片。

问题所在:“嘈杂”的图书馆
标准的教学方法试图从这整个混乱的图书馆中学习。因为图书馆规模巨大,学生会感到困惑,记住错误的事实,并最终考试失败。

解决方案:数据集蒸馏(“小抄”)
与其让学生阅读整个混乱的图书馆,研究人员使用了一种名为**数据集蒸馏(Dataset Distillation)**的技术。目标是创建一个微小的、完美的“小抄”(一个小型的合成数据集),其中只包含最重要的知识点。如果学生只学习这份小抄,他们的表现应该能达到学习了整个图书馆后的水平。

变数:恶作剧者依然存在
问题在于,如果原始图书馆充满了恶作剧者的错误(噪声标签),那么“小抄”的制作者也可能会不小心复制错误的事实。例如,他们可能会在狗的照片旁边写上“这是一只猫”,仅仅是因为那份混乱的图书馆里就是这么写的。

论文的创新:一位更聪明的老师
这篇论文提出了一种更聪明的方法来制作这份小抄,即使面对充满错误的原始图书馆。他们称之为鲁棒轨迹蒸馏(Robust Trajectory Distillation)。你可以将其看作是一个涉及“老师”(从混乱图书馆中学习的 AI)和“学生”(从小抄中学习的 AI)的两步走策略。

以下是这两个主要工具的工作原理,使用了简单的类比:

1. 选择性引导重加权 (SGR) —— “值得信赖的图书管理员”

想象一下,老师正在阅读那本混乱的图书馆。有些书显然是错的,但有些是对的。

  • 工作原理: 系统充当一名超级聪明的图书管理员,观察老师的学习过程。
    • “遗忘”技巧: 如果老师学得很快,但随后又忘记或对某个事实感到困惑,图书管理员就会将其标记为“可疑”(很可能是恶作剧者的错误)。
    • “邻居”技巧: 图书管理员还会检查“邻居”。如果一张狗的照片周围都是其他狗的照片,但标签却说是“猫”,图书管理员就知道出问题了。
  • 结果: 图书管理员为每一条信息分配了一个“信任分数”。在制作小抄时,系统会忽略那些低信任度的信息,而专注于高信任度的信息。这就像是在写最终总结之前,先过滤掉恶作剧者的笔记。

2. 教师启发式辅助目标 (TIAT) —— “安全网作业”

即便有了图书管理员的帮助,老师仍可能被剩余的噪声干扰而产生困惑。

  • 工作原理: 系统创建了一个“安全网”。它选取一小组最自信、最可靠的样本(即图书管理员百分之百确定的那些例子),并利用它们为学生制作一份特殊的“家庭作业”。
  • 目标: 这份作业不仅仅是说“去学习这个”。它是在说:“确保你对这些特定且安全的样本的理解,与老师最好的理解相匹配。”它起到了连贯性检查的作用。如果学生试图学习某种奇怪的、有噪声的模式,安全网会将他们拉回正确的路径。

总结

你可以把整个过程想象成一位大厨(老师)试图通过一本被篡改了食材的食谱来教徒弟(学生)做菜。

  1. 大厨(老师) 尝试烹饪,但图书管理员(SGR)会在一旁低声提醒:“忽略那个食材,它变质了”以及“相信这个,它是新鲜的”。
  2. 徒弟(学生) 试图通过观察大厨来学习烹饪技巧。
  3. 安全网(TIAT) 会介入并说:“嘿,徒弟,确保你能完美地复刻大厨在这些我们已知正确的特定佳肴上的技艺。”

最终成果
通过使用这两个技巧,论文表明他们可以创造出一份微小的、完美的“小抄”(蒸馏后的数据集),即使在原始素材充满错误的情况下,也能帮助学生正确学习。他们在各种图像数据集(如识别猫、狗和汽车)上进行了测试,在不同程度的“恶作剧”噪声下,他们的方法始终比以往的方法表现得更好,且无需手动修复标签。

简而言之: 他们找到了一种方法,通过让 AI 扮演智能过滤器(SGR)和严格质检员(TIAT)的角色,从混乱的数据集中提取出“精华”,从而确保最终的学习指南既干净又准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →