← 最新论文
🤖 AI

Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

本文介绍了 Kontinuous Kontext,这是一种基于指令的图像编辑模型,它通过训练一个轻量级投影器将标量强度值和文本指令映射到模型的调制空间,从而实现对编辑强度的平滑、连续控制,使用户能够在无需针对特定属性进行训练的情况下,在多种操作中实现从细微调整到完全实现的编辑效果。

原作者: Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你手里拿着一根魔杖,只要对着图片说话,就能改变图片的样子。你说:“让这只狗看起来像只猫,”然后“噗”的一声,狗的脸就变成了猫的面孔。这就是基于指令的图像编辑的世界,一个建立在**生成式人工智能(Generative AI)**之上的超能力。这些“计算机大脑”通过对数十亿张照片和说明文字的学习,学会了从零开始绘制新图,或者根据你的话语微调现有的图像。长期以来,这些“巫师”只能做一件事:严格执行你的命令。如果你要求一件“蓝色的夹克”,它们会给你一件百分之百蓝色的夹克。如果你要求“下雪”,整个场景就会变成一场暴风雪。但如果你只想要“一点点”雪呢?或者想要一件“大部分是红色但带有一丝蓝色”的夹克呢?直到现在,这根魔杖还是有点笨拙的;它是一个“开/关”式的开关,而不是一个可以调节亮度的旋钮。

这就是 Kontinuous Kontext 故事的开始。研究人员想要将那个笨拙的“开/关”开关变成一个平滑的、可调节的调光器。他们提出了一个简单的问题:我们能否教会 AI 不仅理解要“改变什么”,还要理解要“改变多少”?他们不只是想让 AI 去猜测合适的程度,而是希望用户能够拖动一个滑块,并看着图像逐渐发生变化,就像调节音乐的音量或调整屏幕亮度一样。这篇论文介绍了一种赋予 AI 这种细粒度控制力的新方法,让我们能够通过一次平滑的动作,将编辑程度从“毫无变化”调节到“完全转变”。


问题所在:全或无的“魔杖”

想象你是一位拿着神奇食谱书的大厨。如果你要求“辣汤”,书里给出的汤会烫得让你舌头都烧起来。如果你要求“清淡的汤”,它给出的汤尝起来就像白开水一样。你无法要求“只要一点点辣味”。目前的图像编辑 AI 正是如此。你给它一个文本指令,比如“把夹克变成皮毛”,它要么不做任何改变,要么直接进行彻底的、毛茸茸的转变。不存在中间地带。

以往试图解决这个问题的方法,就像是为每一种食材都去建造一个新的厨房。一些科学家尝试专门训练用于改变发色的模型,另一些用于改变天气,还有一些用于改变物体形状。这就像是为每一道菜都请了一位不同的厨师。虽然有效,但速度慢、成本高,而且你无法轻易地将它们混合使用。你需要的是一位全能的厨师,能够处理任何请求,并让你控制每一次变化的强度。

解决方案:“AI 的音量旋钮”

开发 Kontinuous Kontext(一个结合了“连续/Continuous”与“上下文/Kontext”的俏皮名称)的团队构建了一个系统,它就像是图像编辑的通用音量旋钮。AI 现在不再仅仅听从“把它变蓝”的指令,它还会听从指令加上一个数字,告诉它“有多蓝”。

把 AI 想象成一位正在演奏乐曲的音乐家。文本指令就是乐谱,告诉音乐家要演奏什么。而新的“滑块”就是音量旋钮。过去,音乐家只能选择全音量播放或完全静音。现在,有了 Kontinuous Kontext,你可以将旋钮从零转到十。在零的时候,音乐是静止的(图像保持不变)。在五的时候,音乐是轻柔温和的(细微的编辑)。在十的时候,它是一场摇滚演唱会(完全的转变)。神奇之处在于,从零到十的过渡是完美平滑的,没有任何突跳或故障。

他们是如何教会 AI “滑动”的

你可能会好奇:“他们从哪里获得数据来教 AI 这种技能呢?”毕竟,现实中的人通常不会拍一张照片,稍微编辑一下,再多编辑一点,最后进行大幅度编辑,并且保存过程中的每一个步骤。那种数据在现实世界中并不存在。

因此,研究人员成为了“数据魔术师”。他们创建了一个合成数据集——一个虚构但真实的示例库。以下是他们的做法:

  1. 设置: 他们选取了 11 万张随机照片。
  2. 指令: 他们使用一个智能 AI 助手为每张照片编写了一条独特的指令,例如“把这辆车变成宇宙飞船”。
  3. 完整编辑: 他们使用了一个强大的现有 AI(称为 Flux Kontext)来进行完整的编辑,将汽车变成宇宙飞船。
  4. 桥梁: 这是最难的部分。他们需要向 AI 展示汽车在 10%、20%、50% 和 90% “宇宙飞船化”程度下的样子。他们使用了一种特殊的“变形(morphing)”工具来创建这些中间图像,就像视频在两个场景之间淡入淡出一样。
  5. 清理: 变形工具并不完美。有时它会产生奇怪的伪影,比如一个有着半个轮子的汽车,或者看起来像一团模糊物体的宇宙飞船。研究人员构建了一个严格的过滤器,剔除掉所有“坏”的例子,即那些过渡不平滑或图像看起来破碎的例子。最终,他们得到了 64,000 个高质量的“编辑轨迹”(从起点到终点的平滑路径)。

核心秘诀:“翻译器”投影仪

其核心发明是一个被称为**投影仪(projector)*的小型、轻量化网络。把主 AI 模型想象成一个庞大、复杂的管弦乐队。文本指令告诉乐队要演奏什么*。而这个新的投影仪就是一个位于滑块与管弦乐队之间的微型翻译器。

当用户将滑块拉到“0.5”(一半)时,翻译器并不仅仅是对着乐队大喊“一半!”。相反,它会向乐队的指挥(调制空间/modulation space)低声传递一个非常具体且经过校准的指令。它会说:“好了,针对这条关于蓝色夹克的特定指令,请应用精确的这种程度的蓝色。”

研究发现,如果他们只是尝试将数字输入到文本词汇中(比如加入一个“一半”的标记),音乐会变得跳跃且怪异。但通过将数字输入到调制空间——即 AI 控制图像“氛围”的一个隐藏层——他们可以让变化变得平滑且精准。这就像是意识到,如果你想改变音量,你不应该对着歌手大喊,而应该直接调节放大器的增益旋钮。

研究发现(以及局限性)

结果令人印象深刻。当他们测试该系统与其他方法对比时,Kontinuous Kontext 在平滑度方面是明显的赢家。

  • 竞争对手: 其他方法就像一台坏掉的电梯。它们会从一楼跳到十楼,但有时会完全跳过五楼,或者门会在错误的楼层打开。有些方法试图将两张图像融合在一起,但这往往会在中间步骤产生奇怪、模糊的怪物。
  • 胜出者: Kontinuous Kontext 的移动就像一部平滑的电梯。随着滑块从 0 移向 1,图像会逐渐且逻辑清晰地发生变化。夹克不会突然变蓝,而是慢慢增加蓝色。雪景不会凭空出现,而是雪花慢慢飘落,地面慢慢变白。

论文还表明,这种方法适用于一切,而不只是某一种东西。无论你是要改变裙子的颜色、材质(让岩石看起来像黄金)、汽车的形状,还是整个场景的天气,同一个滑块都适用。这意义重大,因为这意味着你不需要为每种类型的编辑都准备一个不同的模型。一个通用的模型就可以处理所有事情。

然而,作者也诚实地指出了局限性。该系统擅长于“连续性”编辑,比如改变颜色或材质。但如果你要求一个非常具体且硬性的几何变换——比如将一辆车完美地旋转 90 度——系统有时会遇到困难,因为其构建的基础 AI(Flux Kontext)本身在处理这类问题时也有困难。此外,如果你尝试将滑块推过最大值(比如要求“120% 的蓝色”),系统不知道该如何处理,它要么停在 100%,要么会变得混乱。它是一个调光器,而不是时光机。

为什么这很重要

这篇论文表明,我们正在跨越“是或否”的 AI 时代。我们正在进入“多少”的时代。通过为用户提供一个滑块,Kontinuous Kontext 弥合了人类复杂、富有创造性的细微需求与计算机代码僵硬、二元性质之间的鸿沟。它将图像编辑从一种“碰运气”的游戏(即你希望 AI 能猜中正确的改变程度)转变为一种精确的工具,你可以根据自己的品味来微调结果。

研究人员不仅制造了一个更好的工具,他们还证明了控制强度的“旋钮”其实已经隐藏在这些 AI 模型之中,等待被发现。他们只需要打造一把正确的钥匙来解锁它。现在,你不再是要求 AI “使其完美”,而是终于可以告诉它,“使其接近完美”,然后看着它顺滑地到位。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →