← 最新论文
💻 computer science

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

本文介绍了 CARE,一种能力感知型奖励塑造框架,该框架通过根据模型不断演进的性能,实现从以探索为导向的长篇推理向以效率为导向的简洁推理的过渡,从而在不增加推理开销的情况下,动态调整视频多模态大语言模型(video-MLLMs)的推理长度,进而提高准确性、训练稳定性和 Token 效率。

原作者: Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人通过视频片段来解决复杂的谜题。你希望机器人能在给出答案之前,“边做边说”(展示其思考过程)。但有一个难点:机器人应该“思考多少”,取决于两件事:机器人当前有多聪明,以及谜题有多难。

这篇论文介绍了一种名为 CARE(能力感知奖励塑造,Competence-Aware Reward Shaping)的新型训练方法,旨在解决一个特定问题:现有的方法将机器人的“思考时间”视为一种固定的规则书。它们要么规定“始终思考 5 分钟”,要么规定“始终控制在 2 分钟以内”。

作者认为,这就像是在教一个孩子游泳时,无论是在浴缸里还是在深海里,都告诉他要“始终踢腿 50 次”。

以下是 CARE 的工作原理,使用简单的类比进行说明:

1. 问题所在:“一刀切”的陷阱

过去,研究人员使用静态规则

  • 训练初期: 机器人是一个“新手”。它需要探索许多不同的路径来找到正确答案。如果你强迫它保持简洁,就会切断它的学习过程。
  • 训练后期: 机器人成为了“专家”。它能很快找到正确的路径。如果你仍然让它啰里啰嗦地思考很长时间,它只会浪费能量并不断重复(就像一个已经知道答案的学生,为了凑字数而反复书写同样的句子)。

静态规则之所以失败,是因为它们不知道机器人何时已经“长大成人”。它们要么在过早阶段阻止机器人探索,要么在后期让机器人变得懒散且冗长。

2. 解决方案:CARE(“聪明的教练”)

CARE 扮演着一位聪明的教练的角色,实时观察机器人的进步情况并随时调整规则。

  • “能力监测器”(教练的眼睛):
    教练会记录机器人表现的移动平均值。如果机器人今天解开了一个很难的谜题失败了,教练不会惊慌,而是观察长期趋势。这告诉教练:“这个机器人现在是新手、探索者、熟练学生,还是大师?”

  • “阶段路由”(规则书的变更者):
    根据教练的评估,规则会发生变化:

    • 新手阶段: 教练说:“尽情发挥吧!需要思考多久就想多久。不用担心啰嗦。我们需要找到解决方案。”
    • 探索者阶段: “你进步了。继续探索,但开始删减冗余内容。”
    • 熟练/大师阶段: “你现在是专家了。请保持简洁。如果用 10 个词就能解决,就不要用 100 个词。我们要的是效率。”
  • “难度归一化器”(上下文检查):
    教练知道有些谜题本身就比其他的更难。如果机器人正在解决一个超级困难的视频谜题,教练会允许更长的回答。如果是一个简单的谜题,教练则要求简洁。这防止了机器人因为回答短就认为难题“简单”,或者因为回答长就认为简单题“难”。

  • “惊喜放大器”(啦啦队):
    有时,一个新手机器人通过偶然或运气猜中了一个超级难的问题。教练会注意到这种“意料之外的成功”,并给予巨大的奖励,说:“哇!太精彩了!保持这种特定的思考方式!”这有助于机器人在困难任务上学得更快。

3. 结果:“倒 U 型”旅程

如果你观察机器人随时间变化的行为,它会遵循一个特定的模式,就像一座山丘:

  1. 上升期(扩张): 在开始阶段,机器人的回答会变得更长。它正在探索每一个角落以掌握基本功。
  2. 顶峰: 它达到了知识的巅峰。
  3. 下降期(压缩): 随着它掌握了这项技能,它的回答会变得更短、更精炼。它不再啰嗦,而是开始传递完成任务所需的“高密度”信息。

4. 为什么这很重要

作者在视频推理(观看视频并回答问题)上测试了这一点。

  • 旧方法: 机器人要么陷入简短、不完整的想法中,要么浪费时间写冗长的重复故事。
  • CARE 方法: 机器人学会了完美地分配它的“思考预算”。它会在困难的视频上花费更多时间,而在简单的视频上花费极少的时间。

核心结论:
CARE 教会了 AI 如何适应环境。它明白,变得“聪明”不仅仅是得到正确答案,而是要懂得为了得到那个答案应该投入“多少精力”。到训练结束时,机器人不仅更准确,而且更快速、更高效,能用更少的“词汇”(Token)表达同样的意思。

作者提供了这个“聪明教练”系统的代码,证明了它在实际测试阶段不需要任何额外的计算能力——它只是让训练过程变得更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →