← 最新论文
🤖 AI

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

本文介绍了 CaRE,一种计算感知型评估协议,该协议通过标准化函数评估、指标和随机性,揭示了由于变量不受控,当前掩码扩散语言模型的排名往往具有不可比性,并证明了有信息重掩码(informed remasking)与随机去掩码(stochastic unmasking)在本质上是相互冲突的。

原作者: Yash Shah, Abhijit Chakraborty, Vivek Gupta

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yash Shah, Abhijit Chakraborty, Vivek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图评判谁是这个巨大且混乱的厨房里最优秀的厨师。在这个厨房里,厨师不是人类,而是被称为“AI模型”的巨型计算机大脑。长期以来,这些模型通过一个接一个地添加食材来烹饪,就像多米诺骨牌一个接一个倒下一样。但最近,一种新的烹饪风格突然走红:“掩码扩散”(Masked Diffusion)。这种风格不再是一个接一个地添加食材,而是让厨师同时观察整道菜,猜出缺失的部分,用一个“掩码”(遮挡物)盖住某些部分,然后反复尝试猜出缺失的部分,直到这道菜变得完美。这就像是在玩一场“猜猜看”的游戏,计算机不断地擦除并重写自己的猜测,直到故事逻辑通顺为止。

问题在于,这个厨房里的每个人都在使用不同的规则来决定谁获胜。有些评委计算厨师看了多少次菜肴(步数),有些通过味道来评判(指标),还有些则看厨师是进行疯狂的猜测还是谨慎的猜测(随机性/随机性程度)。因为规则非常混乱,一位评委可能会说厨师A是最棒的,而另一位评委可能会说厨师A是最差的,即便他们品尝的是完全相同的汤。这篇论文就像是一群科学家决定清理厨房,标准化规则,并找出当大家都在玩公平游戏时,谁才是真正的顶级大厨。


论文:CaRE —— 伟大的厨房大扫除

这项研究背后的研究人员 Yash Shah 和 Abhijit Chakraborty 意识到,随着“掩码扩散”模型变得越来越出色,我们测试它们的方式已经落后了。他们注意到,有七篇最近的论文正试图利用一种叫做“重掩码”(remasking)的技巧(这就像是厨师决定重新遮盖已经猜出的部分,看看是否能做得更好)来改进这些模型。但由于每篇论文使用的设置不同,导致其结果一团糟。一篇论文声称某种策略是冠军,而另一篇则声称它是失败者。

为了解决这个问题,他们构建了一个新的评估框架,称为 CaRE(计算感知重掩码评估,Compute-aware Remasking Evaluation)。你可以把 CaRE 想象成一个超级严格的裁判,它强迫每位厨师使用完全相同的能量、完全相同的品尝勺以及完全相同的随机程度。他们使用了一个庞大的文本库 OpenWebText,在包括 LLaDA-8B 和 Dream-7B 在内的 12 个不同的 AI 模型上进行了测试。

大惊喜:关键不在于策略,而在于“温度”

当 CaRE 裁判介入后,他们发现了一些令人震惊的事情。决定 AI 写作水平的最关键因素并不是厨师们正在使用的那些花哨的“重掩码”策略,而是名为温度(temperature,控制厨师猜测的随机或“狂野”程度)的一个设置。

论文发现,温度解释了 91% 的质量差异。这就像是在说,厨师使用的是一把精美的刀还是一把钝刀,远没有他们是否被允许在烹饪时品尝食物那么重要。如果你稍微调高一点“温度”(从 0.0 到 0.1),AI 的写作质量就会大幅提升,使得所有策略之间的差异看起来都微不足道。事实上,改变温度可以将质量得分提高 0.32 分,这比最好和最差策略之间的差距还要大。

隐藏的陷阱:当“聪明”的策略适得其反时

这是论文中发现的最有趣的转折。当 AI 被允许进行一定的随机操作(随机解掩码/stochastic unmasking)时,那种不断重新遮盖文本中最令人困惑部分的“聪明”策略(称为 high_entropy 重掩码)实际上让情况变得更糟了。

论文显示,当你将高随机性与这种“聪明”的重掩码策略结合时,质量得分比仅仅让 AI 在不进行任何重掩码的情况下烹饪(即“none”策略)下降了 0.296 分。这种情况发生在 256 步 且温度为 0.25 的情况下。研究人员非常确定这一发现,其统计概率为 p=0.020,这意味着这极不可能是个偶然现象。

为什么会发生这种情况?因为“聪明”的策略让 AI 的想法变动得太频繁了。这就像一个厨师不停地品尝汤,加点盐,然后又把盐拿出来,再加点胡椒,然后再把胡椒拿出来。汤永远无法定型。AI 不断地“搅动”词汇,这使得文字表面上看起来很有多样性,但实际上却让整体故事的连贯性变差了。研究表明,当 AI 被允许具有随机性时,那种一旦猜出就保持原样的“笨”策略反而表现得更好。

“虚假”的排行榜

论文还指出,之前的排行榜具有误导性,因为它们没有正确计算“计算量”(compute,即实际进行的计算工作)。一些策略声称使用了 256 步,但由于它们不断地重新遮盖单词,实际上迫使计算机做了 4 倍更多的功(高达 513 次前向传播),而不需要重掩码的策略则不需要这么多。

当 CaRE 裁判强制要求所有人进行同样的工作量时,排名发生了逆转。在之前的论文中看起来像是赢家的策略,在对比下突然变成了输家。例如,在一个名为 HumanEval 的编程测试中,一种名为 high_entropy 的策略看起来似乎击败了 “none” 策略,但这仅仅是因为它使用了 3.4 倍的计算机算力。当匹配算力使用量时,“none” 策略其实同样出色甚至更好。

核心启示

来自 CaRE 的主要教训是,我们不能仅仅通过一个数字或单一的策略来判定一个 AI 是否“更好”。这篇论文揭示了测试这些模型的方式是如何掩盖真相的。人们曾兴奋不已的那些“聪明”小技巧,往往只是测试设置产生的伪影。通过标准化规则——统计真实的计算量、控制随机性并使用多种方式衡量质量——研究人员发现,**随机性(stochasticity)**才是真正的核心变量,并且当 AI 被允许发挥创造力时,有时最简单的方法(不做额外动作)反而是最好的。

他们发布了一个新的“排行榜”和一套规则(七点协议),以便未来的 AI 厨师能够被公平地评判,确保当有人宣称某种新方法是突破时,那真的是一项突破,而不是仅仅因为厨房太乱而产生的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →