← 最新论文
🤖 machine learning

From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

该论文提出了一种名为“从探索到利用”的两阶段熵优化 RLVR 方法,通过在训练初期最大化 Token 级熵以增强模型对噪声标签的鲁棒性,并在后期最小化熵以巩固知识,从而在多种 MLLM 架构和噪声设置下实现了优于现有方法的性能。

原作者: Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种让 AI 变得更聪明、更抗干扰的新训练方法。我们可以把这篇论文的核心思想想象成教一个学生在充满“错误答案”的题库里备考

🎓 核心故事:在“噪音”中学习的 AI

想象一下,你正在教一个超级 AI 学生(多模态大语言模型)做题目。

  • 理想情况:老师(数据)给出的答案全是正确的。
  • 现实情况:老师给出的答案里,混杂了很多错误的标签(噪音)。比如,老师指着图片说“这是猫”,其实那是只狗。

如果 AI 太听话,它会把所有错误答案都背下来,结果考试就挂了。如果 AI 太固执,它可能根本学不到新东西。

这篇论文提出的方法叫 “两阶段熵优化” (Two-Stage Entropy Optimization),我们可以把它比作**“先发散思维,后专注执行”**的备考策略。


🚀 两个阶段的“备考秘籍”

第一阶段:疯狂探索期 (Exploration)

比喻:像“头脑风暴”一样乱猜,不要怕错。

  • 发生了什么:在训练刚开始时,AI 面对一堆可能包含错误答案的数据。这时候,我们故意让 AI 保持“高熵”状态。
  • 通俗解释:“熵”可以理解为**“不确定性”或“多样性”**。在这个阶段,我们鼓励 AI 不要急着下定论,而是尝试各种各样的回答。
    • 就像学生在复习初期,面对一道难题,不要只盯着一个解法,而是尝试画图、列公式、查资料,甚至猜几个不同的答案。
  • 为什么要这样做?
    • 如果 AI 太早相信某个答案(哪怕那个答案是错的),它就会“死记硬背”错误知识。
    • 通过保持多样性,AI 能生成很多不同的回答。这样,当它发现某个“错误答案”在所有尝试中都不靠谱时,它就能识别出那是噪音,而不是真理。
    • 这也保证了 AI 有足够的“样本”去比较,从而选出真正好的答案。

第二阶段:专注利用期 (Exploitation)

比喻:像“冲刺复习”一样,锁定正确答案,不再犹豫。

  • 发生了什么:当 AI 已经见识过足够多的可能性,并且通过第一阶段的“乱猜”排除了大部分错误干扰后,训练进入第二阶段。这时候,我们强制让 AI 降低“熵”,变得非常自信。
  • 通俗解释:现在 AI 已经知道哪些路是死胡同了。我们让它收敛,专注于那个最可能正确的答案,不再犹豫不决。
    • 就像考试前最后几天,学生不再漫无目的地翻书,而是把之前验证过的正确解题思路反复练习,形成肌肉记忆。
  • 为什么要这样做?
    • 如果一直“乱猜”,AI 永远学不会精准回答问题。
    • 在这个阶段,AI 利用第一阶段筛选出的“好经验”,把知识固化下来,变得既准确又自信。

🛡️ 为什么这个方法很厉害?

以前的训练方法通常只有两种极端:

  1. 一直“乱猜” (只最大化熵):AI 永远在犹豫,学不到真本事,很难收敛。
  2. 一直“死记” (只最小化熵):AI 太早相信了错误的答案(因为数据里有噪音),结果越学越偏,最后考试全错。

这篇论文的“两阶段”方法,就像是一个聪明的教练:

“刚开始,你们尽管去试错,不要怕,多想想不同的可能性(阶段一);等你们看清了方向,再集中火力,把那个正确的答案练得滚瓜烂熟(阶段二)。”

📊 实际效果如何?

论文在多个任务上(比如让 AI 在电脑屏幕上找按钮、识别图片里的动物)做了测试:

  • 抗干扰能力强:即使训练数据里有 50% 甚至 100% 的错误标签,这个方法训练的 AI 依然能考出高分。
  • 通用性好:不管是用什么型号的 AI 模型,或者做什么类型的任务,这个方法都比传统的“死记硬背”或“盲目乱猜”要好。
  • 举一反三:在没见过的考试题目(新场景)上,这个方法训练的 AI 表现也更稳定。

💡 总结

这就好比教一个孩子在嘈杂的菜市场里学认蔬菜:

  • 旧方法:要么让孩子一直闭着眼睛猜(效率低),要么让孩子只听旁边一个乱喊的人(容易学错)。
  • 新方法:先让孩子睁大眼睛多看看、多问问(探索阶段,不怕听错),等把各种声音都听过了,再锁定那个最靠谱的声音,专心学习(利用阶段)。

最终,这个 AI 不仅学会了知识,还练就了一身在混乱中保持清醒的本领。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →