← 最新论文
🤖 machine learning

The Steering Budget: Examples beat Knobs

本文认为,生成模型的可控性从根本上受限于其训练数据中固有的“预算”,并证明了虽然传统的“旋钮”方法(如提示词或引导尺度)只能访问这一范围中的一小部分,但提供具体的示例可以让模型触及某一属性潜力的全谱系,包括那些无法用言语明确指定的特征。

原作者: Raj Kumar Rajendran

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Raj Kumar Rajendran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人艺术家,它可以根据你的要求画出任何东西,从金毛寻回犬到晶体结构。多年来,科学家们一直试图通过给它“旋钮”来控制它。你可以说,“让它更亮一点,”或者“让它看起来像照片,”或者“把引导拨盘转到最大。”这就像是试图通过扭动单个舵柄来驾驶一艘船。但有一个令人沮丧的限制:无论你多么用力地扭动旋钮,机器人最终都会停止移动。它撞上了一堵墙。你想让图像变得非常亮,但机器人只能做到“有点”亮,然后就拒绝再进一步。

这篇论文提出了一个简单但具有革命性的问题:为什么机器人会停止?是因为机器人坏了吗,还是因为它在开始画画之前就被赋予了一个隐藏的规则手册?作者发现,机器人并没有坏,它只是在一个由它所学习的数据设定的严格“预算”内工作。他们发现,与这个机器人交流有两种方式:“说”(Telling)“展示”(Showing)。“说”是使用旋钮和语言来缩小你想要的目标范围。“展示”是递给机器人一堆例子,并对它说:“做更多像这些一样的东西。”令人大吃一惊的是:“展示”可以到达“说”甚至无法梦到的地方,而且我们甚至可以在启动机器人之前,精确地计算出每种方法能走多远。

“说”的大墙 vs. “展示”的魔力

把机器人的知识想象成一个巨大的图书馆。每本书都是一种特定类型的东西,比如“海滩场景”、“雪山”或“晶体结构”。

  • “说”(旋钮): 当你使用旋钮时,你正站在图书馆的一个特定区域内,比如“海滩”区。你可以要求机器人让海滩阳光更灿烂,或者让沙滩更白。但你被困在了这一个区域里。你不能仅仅通过扭动一个拨盘就神奇地把海滩变成雪山。你受限于该“海滩”区域内已经存在的各种变化。
  • “展示”(示例): 当你展示示例时,你不再受限于某一个区域。你可以递给机器人一些混合的书籍:有些来自“海滩”区,有些来自“雪山”区,还有一些来自“沙漠”区。你说:“制作更多看起来像这种混合风格的东西。”突然间,机器人不再只是微调某一个东西,它正在探索整个图书馆。它可以将海滩的明亮感与雪山的质感结合起来,这是单个旋钮永远无法做到的。

这篇论文称之为**“预算”(Budget)**。在机器人进行训练之前,它所学习的数据就已经设定了一个硬性限制。

  1. “类内”预算(“说”的触达范围): 这是你在单个类别内部可以摆动(wigло)的空间。如果你想让海滩更亮,预算就是基于机器人见过的照片,海滩可以变得多亮。
  2. “类间”预算(“展示”的触达范围): 这是你在不同类别之间跳跃的空间。这是海滩的平均亮度与煤矿的平均亮度之间的差异。这个差距通常巨大——比单个类别内部的摆动空间要大得多。

作者发现,对于我们想要控制的大多数事物,“类间”预算才是关键。它是不同类型事物之间的巨大鸿沟。旋钮(“说”)只能触及单个类别内的微小摆动空间。而示例(“展示”)可以触及类别之间的巨大鸿沟。

“旋钮”的迷思与“示例”的现实

你可能会想:“如果我把旋钮转得更用力一点,难道不会奏效吗?”论文说:不。

他们用两个截然不同的机器人测试了这一点:一个画图的机器人(像数字艺术家)和一个设计晶体结构的机器人(像材料科学家)。

  • 在晶体实验室中: 他们尝试制造具有更宽“带隙”(一种特定的能量属性)的晶体。“旋钮”(一个简单的标签,标注为“高带隙”)几乎没能推动进度。但当他们向机器人展示具有高带隙特征的晶体示例时,机器人的输出结果比旋钮能达到的效果跳跃了数十甚至数百倍
  • 在图像实验室中: 他们尝试让图像看起来更“像动物”。一个强大的、经过学习的旋钮可以稍微推动进度,但前提是它必须在不破坏“类别”规则的情况下,误打误撞地让图像看起来像完全不同的动物。而“展示”方法(通过挑选最好的动物类别进行混合)比最好的旋钮多移动了3倍的距离。

论文明确排除了“更好的旋钮”能解决问题的想法。他们认为,限制并非机器人设计的缺陷,而是数据的基本规律。如果数据在不同类别之间没有巨大的差距,那么旋钮可能运行良好(比如让图像稍微变亮一点)。但如果目标需要跨越不同的类型,旋钮在结构上就是无法做到的。

为什么这很重要:“我明白那种感觉”的问题

这是最酷的部分。有时,专家知道自己想要什么,但无法解释清楚。

想象一位电影剪辑师,他看了上百个镜头,最后选出了最好的十个。他无法说明为什么这十个是完美的。他只是“知道”。如果你要求他向机器人描述那种“感觉”,他可能会说“让它更有情感”,但机器人只会做一个通用的忧郁表情。

  • “说”在这里失效了: 你无法为一个你无法描述的感觉提供一个词汇。
  • “展示”在这里获胜: 你只需把那十个你喜欢的片段交给机器人。你不需要解释“为什么”。机器人观察这些片段的混合模式,然后说:“啊,我明白其中的规律了。我会制作更多像这样的东西。”

论文表明,“展示”可以触及这些“无法命名”的目标,因为它不需要用语言来定义目标。它只需要展示模式。它甚至可以同时混合两个相反的事物——比如“干净的车辆”和“干净的食物”——而单个旋钮通常无法做到这一点,往往只会给你一个两者之间模糊、混乱的平均值。

结论:先测量,后选择

这篇论文并不仅仅是在说“示例更好”。它给了你一个配方,让你知道何时该使用它们。

在开始生成之前,你可以对你的数据进行快速的“审计”。你可以计算“预算”,看看你想要的改变有多少来自于类别内部(摆动空间),有多少来自于类别之间(巨大的跳跃)。

  • 如果“类间”预算很小: 旋钮就足够了。你不需要展示示例。
  • 如果“类间”预算巨大:必须展示示例。旋钮永远无法带你到达那里。

作者在图像和晶体上进行了测试,数学逻辑完全成立。他们甚至展示了,如果你试图“微调”一个机器人使其在某件事上达到完美(比如让一切看起来都很有“美感”),你往往会失去所有的多样性,最终得到一个枯燥、重复的机器人。这是因为微调是针对单张图像进行的,这会缩小多样性。而“展示”通过混合不同的类别,是保持这种多样性的唯一方法。

简而言之,这篇论文教导我们,要驾驶生成式人工智能,我们不应仅仅是扭动旋钮。我们需要先观察数据的地图。如果目的地很远,我们需要的不是一个更好的方向盘,而是向机器人展示地图,并让它选择最佳路径。而且有时,那条最佳路径是我们无法命名、只能展示的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →