← 最新论文
🤖 machine learning

Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models

本文建立了一个理论信息论界限,证明视觉 - 语言 - 动作模型面临一种固有权衡,即能力与鲁棒性之和无法超过由任务熵和对抗信道容量决定的固定预算,从而表明某一维度的显著改进必然以牺牲另一维度为代价。

原作者: Jianwei Tai

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianwei Tai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人完成一项复杂任务,比如制作三明治或组装玩具。你希望这个机器人既有能力(在房间干净安静时完美完成任务),又具备鲁棒性(即使有人悄悄溜进来,稍微扰乱光线,或在桌上贴上一张微小且不可见的贴纸,它仍能完美地继续完成任务)。

长期以来,研究人员希望只需通过“更聪明”地训练,就能制造出既超级有能力又超级鲁棒的机器人。

本文指出:不,你无法免费同时拥有两者。 机器人在两方面同时表现出色的程度存在一个硬性数学极限。

以下是使用简单类比进行的分解说明:

1. “预算”类比

将机器人处理世界的能力视为一笔固定的“信息货币”预算

  • 能力是指机器人理解真实指令(即“神谕”)的程度。
  • 鲁棒性是指机器人忽略虚假混乱指令(即“攻击”)的程度。

本文证明,你的“能力”与“鲁棒性”之和不能超过特定的总预算。该预算由两件事决定:

  1. 任务的复杂程度(“任务熵”):如果任务是“拿起一个红色积木”,预算就很小;如果任务是“搭建纸牌屋”,预算就巨大。
  2. 攻击者能添加的噪声量(“信道容量”):如果攻击者只能添加一点点灰尘,预算就很小;如果他们能涂抹整个图像,预算就巨大。

关键点在于:你无法在不耗尽预算的情况下,同时将这笔预算花在“能力”和“鲁棒性”上。如果你将更多资金花在抵御攻击的鲁棒性上,你就必须减少在正常条件下表现能力的投入,反之亦然。

2. “没有免费午餐”的发现

作者研究了一种名为OpenVLA的流行机器人“大脑”。

  • 问题:当机器人看到干净图像时,其成功率高达 95%。但如果黑客添加一个微小且不可见的图案(“对抗性扰动”),机器人的成功率就会暴跌至 5% 以下。
  • 旧有的希望:也许如果我们换一种方式训练,它就能在干净图像上保持 95% 的优异表现,同时在受攻击图像上也保持 95% 的优异表现。
  • 现实:数学证明这是不可能的。存在一个“理论底线”。你无法仅通过训练就摆脱这种权衡;信息定律表明你必须做出选择。

3. 为何“预算”起初看起来那么大(随后又变小)

最初,作者使用整张图像(数百万像素)来计算预算。

  • 宽松的界限:他们发现预算约为5,000 单位。机器人仅为其实际工作使用了约 7.5 单位。这让人误以为还有大量空间可以同时提升两方面。这就像说:“你有 5,000 元的零花钱,但午餐只花了 7.50 元,所以你肯定还剩 4,992.50 元可以用来提升鲁棒性!”

但这具有误导性。
机器人并不会查看每一个像素。它在做出决定前,会查看图像的“摘要”(就像一张压缩照片)。

  • 紧密的界限:当作者专门针对机器人实际使用的图像部分来查看预算时,预算从 5,000 单位缩减到了31 单位
  • 令人震惊的是:现在,机器人仅为了保持“能力”,就已经花费了其总预算24%。这意味着在不损害“能力”的前提下,提升“鲁棒性”的空间非常有限(仅剩约 23 单位)。

4. “泄漏”问题

本文还引入了一种巧妙的“鲁棒性”测量方法,以防止作弊。
想象一个机器人,它不是忽略攻击,而是直接将攻击复制到其行动中。

  • 攻击:“向左移动。”
  • 机器人动作:“向左移动。”
  • 结果:机器人看起来“鲁棒”,因为它没有改变主意,但实际上它只是在盲目跟随黑客。

本文的数学计算排除了这种“作弊”行为。它确保真正的鲁棒性意味着机器人在忽略噪声,而不仅仅是复制它。

5. 这对未来的意义

作者并非建议我们放弃,而是为科学家们提供了一把新的标尺

他们建议科学家不要只说:“我们的新防御使机器人提升了 10%”,而应该说:

“我们的新防御消耗了该特定机器人架构剩余‘鲁棒性预算’的 60%。”

这有助于公平地比较不同的机器人。它告诉我们,对于当前的机器人,我们正撞上一堵墙。要想变得更好,我们不能仅仅微调训练;我们可能需要改变机器人的“大脑”(其架构),或者接受它在干净日子里的表现会略微不完美,以换取在混乱日子里更安全。

简而言之:你无法拥有一个既完美胜任工作又完全免疫欺骗的机器人。存在一个硬性数学极限,而对于今天的机器人来说,我们仅仅为了完成工作,就已经花费了该极限的一大部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →