← 最新论文
🤖 AI

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

本文引入了“交互缩放”(interaction scaling)作为测试时计算的第三个独立维度,它通过将反馈与评估都建立在现实世界的观察之上,超越了推理与采样的限制,从而使模型能够在传统方法趋于平台期的困难任务上实现持续改进。

原作者: Bojie Li, Noah Shi

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Bojie Li, Noah Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人艺术家,它会画图、写代码或者设计幻灯片。你想让它制作出一个“完美版本”的项目。通常,当机器人出错时,我们会尝试两种修复方法:

  1. 思考得更久: 我们告诉机器人:“深呼吸,在画图之前多花点时间思考一下。”
  2. 尝试更多次: 我们告诉机器人:“画出 100 个不同的版本,然后我们从中选出最好的一个。”

论文指出,这两种方法都遇到了一个玻璃天花板。为什么呢?因为机器人仅仅是在使用它自己的大脑(它的“冻结权重”)和原始的指令。这就像是要求一个人通过盯着自己的画看更久,或者在同一张纸上画 100 次,来发现自己画作中的错误一样。他们无法看到自己原本就不知道的东西。他们陷入了一个封闭的循环。

第三种方法:“现实世界”测试

论文引入了第三种方法,称为交互缩放(Interaction Scaling)。机器人不再只是思考或重试,而是真正去“做”这件事,然后从一个真实的仪器那里获得报告。

你可以这样理解:

  • 旧方法: 机器人画了一张幻灯片,看着它说:“嗯,也许文字太大了?”它只是根据自己的意见在瞎猜。
  • 新方法(具身交互): 机器人画了这张幻灯片,然后把它交给了一个卷尺机器人(仪器)。卷尺机器人没有主观意见,它只负责测量。它说:“嘿,这段文字大了 5 个像素,并且溢出了纸张边缘。”绘图机器人听到了这个真实的事实,针对这个具体的错误进行修复,然后再次尝试。

这就是神奇之处:卷尺带来了绘图机器人之前并不具备的新信息。它打破了玻璃天花板。

大陷阱:“盲人法官”

这是故事中最重要的一部分,也是一个有点像剧情反转的部分。论文指出,这种新方法只有在反馈和评分都具有“具身性”(即基于真实测量)时才会奏效。

想象一下你在尝试修复一份幻灯片:

  • 具身仪器: 一个测量电脑屏幕上实际布局的工具。它看到了文字重叠的问题。
  • “盲人”法官: 另一个观察幻灯片截图的 AI。

论文发现了一个既滑稽又严肃的问题:截图会撒谎。
当你为一张文字溢出边缘的幻灯片截取截图时,相机(截图)会把边缘切掉。那些出错的部分实际上被裁剪掉了!

  • 卷尺看到了混乱并说:“修好它!”
  • 截图法官看着被裁剪后的图像,觉得毫无问题,于是说:“完美!10/10 分!”

如果你使用“截图法官”来告诉机器人该修哪里,机器人实际上会让幻灯片变得更糟。它会试图修复图中看起来没问题的地方,却对真正的错误部分置之不理。论文显示,在 15 个棘手的学术图表中,截图法官将 14 出 15 个破损图像评为了“完美”,而测量工具却发现其中只有 3 个是真正干净的。

结果:实际发生了什么?

研究人员通过一个“提议者-评审者”(Proposer-Reviewer)的循环,在七种不同类型的任务(代码、幻灯片、网页等)上测试了这一点。以下是他们的发现:

  • 对于代码: 当他们让机器人运行代码并读取实际的错误信息(即“具身”反馈)时,他们在困难任务上达到了 100% 的通过率。旧方法(思考更久或从 100 次尝试中挑选最佳)即使拥有完美的“先知”来挑选最佳结果,也会卡在 66% 到 86% 左右。交互循环持续攀升,而其他方法则撞到了墙。
  • 对于视觉效果(幻灯片和图表): 当他们使用测量工具来寻找缺陷时,消除了 40% 到 74% 的布局错误。
    • 幻灯片上,测量工具修复了 73% 的缺陷。
    • 学术图表上,它修复了 74%
    • 网页上,它修复了 47%
    • 动画上,它修复了 40%
  • “盲人”法官的失败: 当他们使用“截图法官”来评审幻灯片时,缺陷数量反而上升了(平均每张幻灯片增加了约 2.44 个缺陷)。机器人被盲人法官搞糊涂了,把原本正常的东西弄坏了。

其他模型表现如何?

这不仅仅是关于某一个特定的机器人。他们测试了三个不同系列的 AI 模型家族(Sonnet 4, Qwen3-235B, 和 GPT-5)。在每一种情况下,“交互循环”配合真实测量都能修复错误,而“思考更久”的方法则遇到了极限。交互循环达到了 100% 的通过率且没有波动,这意味着无论机器人的初始状态如何,它都能完美运行。

“学生”的教训

论文还尝试通过展示“老师”机器人的成功修复过程,来训练一个更小、更便宜的机器人(一个 80 亿参数的模型)。

  • 这个小“学生”在仅尝试一次的情况下,能完成老师大约 51% 的工作。
  • 如果让他们尝试两次,它能完成老师 70% 的工作。
    这表明,虽然这种“循环的魔力”是可以被学习的,但循环本身(即真实的测量)仍然是获得最佳结果所必需的。

底线结论

论文总结道,仅仅“思考更久”或“尝试更多次”是不够的,因为机器人被困在了自己的脑海里。要变得更好,机器人需要走出自我,去构建一些东西,并让一个真实的测量工具准确地告诉它哪里出了错。

但有一个前提:你不能使用一个“盲目”的法官(比如截图阅读器)来衡量成功。如果法官看不见错误(因为被裁剪掉了或者太小了),机器人就永远无法学会修复它。论文证明了,具身性(即对反馈和评分都使用真实测量)才是让整个系统运作的秘诀。没有它,机器人只是在原地打转。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →