Token-to-Token Alignment of Text Embeddings for Semantic Blending
本文引入了一种从标记到标记(Token-to-Token)的对齐框架,该框架通过重构文本提示并对其嵌入进行对齐,以揭示一个潜在的连续语义空间,从而在无需修改生成模型的情况下,通过简单的线性插值实现平滑的图像融合与连续编辑。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有两份不同的蛋糕食谱。
- 食谱 A 写道:“在碗中混合面粉、鸡蛋和糖,然后烘焙。”
- 食谱 B 写道:“首先,将鸡蛋打入碗中,然后加入糖和面粉,最后烘焙。”
尽管这两份食谱描述的是完全相同的蛋糕,但步骤的顺序不同,词语的排列序列也不同。
现在,想象你是一个机器人厨师,你只能将这些食谱理解为一长串单词(token)列表。如果你试图通过仅仅逐个交换列表中间的单词,从而缓慢地将食谱 A 变成食谱 B,机器人会感到困惑。它可能会在“混合”之前尝试“烘焙”,或者以一种奇怪的顺序将“鸡蛋”与“面粉”混合。其结果并不是从一个蛋糕到另一个蛋糕的平滑过渡;而是一个混乱、破碎的废品。
这正是论文 《用于语义融合的 Token 到 Token 文本嵌入对齐》(Token-to-Token Alignment of Text Embeddings for Semantic Blending) 为 AI 图像生成器解决的问题。
问题所在:“迷失在翻译中”效应
现代 AI 图像生成器(例如那些将文本转化为图片的 AI)通过读取单词列表(token)来工作。AI 有一个“字典”(嵌入空间),其中每个单词都有一个特定的位置。
问题在于这个字典是混乱的。
- 如果你说“一个抱着猫的人”,AI 会将“人”和“猫”放在特定的位置。
- 如果你说“一个被男人抱着猫”,由于句子结构发生了变化,AI 会将“猫”和“人”放在不同的位置。
如果你尝试将 AI 的设置从第一个句子滑动到第二个句子,AI 并不知道第一个句子中的“人”对应于第二个句子中的“人”。它只看到单词在位置上发生变动。结果呢?图像会出现闪烁、变形或完全失去意义。这就像是通过先播放歌曲 A 的第一个音符,再播放歌曲 B 的第二个音符,接着播放歌曲 A 的第三个音符来混合两首歌——听起来不是音乐,而是噪音。
解决方案:“翻译官”与“媒人”
作者提出了一个被称为 Token 到 Token 对齐 的两步过程来解决这个问题。你可以将其想象为一个翻译官和一个媒人正在协同工作。
第一步:翻译官(结构对齐)
首先,系统使用一个智能 AI(大语言模型,LLM)将你的两个原始句子改写成一种标准化格式。
- 原始 A: “一个抱着姜黄色猫的人。”
- 原始 B: “一只姜黄色的猫正被一个人抱着。”
“翻译官”将它们都改写成一个严格的模板,就像带有标签框的表格:
- 框 1(主体): 人 / 猫
- 框 2(动作): 抱着 / 被抱着
- 框 3(客体): 猫 / 人
- 框 4(颜色): 姜黄色 / 姜黄色
现在,两个句子的结构在逻辑上是完全一致的。“人”始终在框 1,“猫”始终在框 3。这解决了词序问题。
第二步:媒人(嵌入对齐)
即使有了相同的结构,AI 的内部“字典”可能仍然会对第一个句子中的“人”和第二个句子中的“人”进行略微不同的处理,仅仅是因为周围单词的不同。
“媒人”会查看两个句子中每个单词的内部代码(嵌入)。它计算每个单词之间的相似度,并在它们之间画出一条直接的连线。
- 它会说:“好吧,第一个句子中的‘人’匹配第二个句子中的‘人’,即使它们略有差异。”
- 它创建了一张完美的地图,使得句子 A 中的每个概念在句子 B 中都有一个特定的搭档。
奇迹之处:平滑融合
一旦“翻译官”和“媒人”完成了他们的工作,AI 终于可以实现它原本该做的事情了:融合。
因为第一个句子中的每个单词现在都有了一个完美的搭档,AI 可以简单地将设置从一个滑动到另一个。
- 与其产生混乱的闪烁,图像会从“一个抱着猫的人”平滑地转变为“一个被男人抱着猫”。
- “人”保持为人,“猫”保持为猫,而“姜黄色”的颜色也保持一致。
论文展示了这在三个主要方面有效:
- 连续合成: 将“沙发上的猫”逐步变为“沙发上的狮子”,且过程中沙发不会消失,房间也不会改变。
- 连续编辑: 将一张白色折纸鹤的照片慢慢变成一只绿色巨龙的照片,精确控制每一步的变化程度。
- 融合: 将一张牛仔的照片和一张骑士的照片结合,创造出一种流畅的电影般过渡,其中衣服和动物自然地变形,而不是出现闪烁故障。
核心总结
作者认为,AI 本身已经知道如何进行这些平滑转换;它只是找不到路径,因为“地图”(文本提示词)是用不同的语言绘制的。
他们不需要重建 AI,也不需要教它新技巧。他们只需要组织好指令,让 AI 能够看到两个想法之间的联系。通过完美地对齐单词及其含义,他们将混乱、破碎的过渡变成了一段平滑、逻辑清晰的旅程。
简而言之:不要更换引擎,只需修复地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。