← 最新论文
💻 computer science

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

本文提出了 MMCORE,这是一个利用预训练视觉语言模型通过可学习查询令牌生成语义视觉嵌入,并以此作为条件信号驱动扩散模型的统一框架,从而在显著降低计算成本的同时实现了高质量的多模态图像生成与编辑。

原作者: Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 MMCORE 的新技术,它就像是一个**“超级艺术总监 + 顶级画师”的梦幻组合**,专门用来让电脑更聪明地理解你的想法,并画出高质量、符合逻辑的图片。

为了让你更容易理解,我们可以把现在的 AI 画图世界想象成两个不同的部门:

  1. 理解部门(大语言模型/VLM): 它们像博学的教授,非常擅长读懂文字、理解复杂的逻辑(比如“把大象放在冰箱里”),但它们不太会画画,画出来的东西往往很抽象或者很丑。
  2. 绘画部门(扩散模型): 它们像技艺精湛的画师,能画出非常逼真、漂亮的图片,但它们有时候有点“死脑筋”,听不懂复杂的指令,容易画错(比如让你画“一只猫在树上”,它可能画成猫在树根下,或者把猫画成狗)。

以前的方法,要么是把这两个部门强行绑在一起(导致训练成本极高,像让教授和画师同时上课,效率很低),要么就是让画师只靠简单的文字提示画画(导致画师听不懂教授的复杂指令)。

MMCORE 做了什么?它设计了一套全新的“协作流程”:

1. 核心创意:给画师配一个“翻译官”

MMCORE 没有把教授和画师强行绑死,而是让它们分工合作

  • 第一步:教授做“摘要”(语义嵌入)
    当用户输入一段复杂的文字(比如“一个穿着红裙子的女孩在雨中跳舞,背景是赛博朋克城市”),MMCORE 先让那个“博学的教授”(预训练的视觉语言模型)来读这段话。
    但是,教授不直接指挥画师,而是先写一份**“核心摘要”(这就是论文里说的“可学习的查询令牌”)。这份摘要不是文字,而是一组“视觉密码”**。

    • 比喻: 就像教授把复杂的剧本浓缩成了几个关键的“情绪关键词”和“画面构图指令”,比如“红裙、动感、霓虹灯、雨滴”。
  • 第二步:双重保险(双路径条件)
    这篇论文最聪明的地方在于,它不让画师只看“摘要”。它采用了**“双路径”**策略:

    • 路径 A(摘要): 教授给的“视觉密码”,告诉画师**“画什么”**(核心语义,比如猫、树、位置关系)。
    • 路径 B(原文): 把用户的原始文字也直接给画师,告诉画师**“怎么画细节”**(比如具体的形容词、风格)。
    • 比喻: 就像导演给摄影师(画师)两张纸条:一张是“剧情大纲”(摘要),另一张是“详细的分镜脚本”(原文)。这样摄影师既不会跑题,又能保留细节。
  • 第三步:画师动笔(扩散模型)
    画师(扩散模型)拿到这两份资料后,就开始画画。因为它既懂“剧情”又懂“细节”,所以画出来的图既符合逻辑,又非常漂亮。

2. 为什么要这样做?(解决了什么痛点)

  • 省钱省力: 以前的方法需要把两个巨大的模型从头到尾重新训练一遍,就像要把教授和画师重新培养成一个人,成本极高。MMCORE 只需要微调一下“翻译官”(教授的部分),然后让画师适应一下新的指令格式,成本降低了约 70%
  • 更聪明: 以前的 AI 画“猫在树上”可能只是把猫和树拼在一起。MMCORE 因为利用了教授的“推理能力”,它能理解空间关系。比如你让它画“男人的眼睛和女人的嘴巴齐平”,它能精准地画出来,而不是随便拼凑。
  • 多图处理: 它还能处理“参考图”。如果你给它看 10 张不同的图,让它把图 1 的角、图 2 的身体、图 3 的翅膀拼成一个新怪兽,它也能做得很好。

3. 效果怎么样?

论文里做了很多测试,结果显示:

  • 听指挥: 在复杂的指令下(比如空间推理、多物体关系),MMCORE 比现在的顶尖模型(如 Seedream 4.0, GPT-Image-1 等)表现更好。
  • 画得准: 无论是单图生成,还是多张图编辑(比如把图 A 的衣服穿到图 B 的人身上),它都能保持高一致性,不会画崩。
  • 人类评价: 让人类来打分,MMCORE 在“像不像”、“听不听话”、“美不美”这几个指标上都拿到了第一名。

4. 还有什么不足?(未来的方向)

虽然 MMCORE 很厉害,但作者也诚实地说:

  • “理解”和“创作”的平衡: 让模型既能画画又能理解,有时候会让它在纯理解任务(比如做数学题、OCR 识别)上稍微变弱一点点。
  • 未来的梦想: 现在的“视觉密码”还是辅助文字存在的。作者希望未来能发明一种**“万能令牌”**,既能像 VAE 一样完美还原像素,又能像 ViT 一样理解语义,彻底打通理解和创作的界限,让 AI 真正成为一个“全能艺术家”。

总结一句话

MMCORE 就像给 AI 画师配了一个懂逻辑的“超级导演”,通过“摘要 + 原文”的双重指令,让 AI 既能听懂复杂的剧情,又能画出电影级的画面,而且训练成本还更低。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →