← 最新论文
🤖 machine learning

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

本文引入了自纠错耦合马尔可夫跳跃过程(SC-CMJP)和无需训练的 CO2Jump\texttt{CO}_\texttt{2}\texttt{Jump} 采样器,通过在每一步中动态耦合模态的自纠错机制,实现图像理解与生成的并行处理,在发布三个新的大规模数据集的同时,在多模态推理和编辑任务上达到了最先进的性能。

原作者: Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在白板前观察一位大师级教师。他们不仅仅是在说话和绘画,而是同时进行这两者。当他们勾勒出一条曲线时,他们的言语随之描述它;当他们解释一个概念时,他们的手也会调整绘图以与之匹配。如果他们在素描中犯了错,他们会立即擦掉并重画,同时修正他们的句子。这正是人类创造力运作的方式:理解与创造是一个单一且交织的循环,而非两个独立的步骤。

长期以来,人工智能一直试图模仿这一点,但通常做得非常笨拙。大多数人工智能系统就像一条严格的流水线:首先写出一个完整的故事或计划,然后才尝试根据该计划画出一幅图。如果计划中有错误,图片也会继承这个错误,而且人工智能无法回头去修正计划,因为计划已经“完成”了。这篇题为《并发图像理解与生成》(Concurrent Image Understanding and Generation)的论文,深入探讨了人工智能的一个特定领域——掩码扩散模型(Masked Diffusion Models)。可以将这些模型想象成一场“猜图游戏”,人工智能从一张空白、充满噪声的画布开始,逐个标记地逐渐揭示图像。这篇论文提出了一个宏大的问题:如果人工智能能同时编写描述并绘制图像,让两者实时相互纠正,就像那位在白板前的老师一样,情况会如何?

研究人员引入了一个名为自纠正耦合马尔可夫跳跃过程(Self-Correcting Coupled Markov Jump Processes, SC-CMJP)的新框架。要理解这一点,请想象两个朋友正在一起解一个谜题。在旧的人工智能方法中,朋友 A(文本)会喊出一个猜测,而朋友 B(图像)会尝试根据它进行绘画,但直到最后,他们都听不到对方最新的想法。如果朋友 A 在中途意识到自己犯了错,他无法告诉朋友 B 停止绘制那部分内容。

这篇论文提出了一种新的交流方式。他们称之为 CO2Jump。它运作起来就像一场动态的舞蹈,两个朋友在不断地向对方低语。如果文本分支开始致力于一个与图像分支所见不符的描述,系统就有一个特殊的“撤销”按钮。它可以立即“重新掩码”(擦除)一个已确定的标记并重试。这就是“自纠正”的部分。“耦合”部分意味着他们不仅仅是轮流行动,还会权衡彼此的置信度。如果文本对某个细节非常确定,它就会引导图像;如果图像非常确定,它就会引导文本。他们在每一步都在进行协商。

团队在三个截然不同的挑战中测试了该方法。首先,他们尝试了图像编辑,即人工智能需要根据文本提示(如“在这条路径上增加一名徒步旅行者”)对照片进行修改。他们还测试了迷宫求解数织(Nonograms)(即根据数字线索填充网格的逻辑谜题),其中文本答案(路径或填充的单元格)与视觉网格必须完美匹配。为了实现这一点,他们创建了三个大规模的新数据集:JEdit-1M(100 万个编辑对)、JMaze-200K(20 万个迷宫)和 JNono-200K(20 万个数织)。

结果表明,这种“边说边画”的方法比旧的“先写后画”方法效果更好。在实验中,CO2Jump 采样器不仅生成了更好的图像,还生成了更好的图像文本描述。最令人兴奋的发现是,人工智能解决问题的步骤越多,它的表现就越好。与其他在达到一定程度后就会撞墙或产生混乱的方法不同,这个耦合系统似乎在思考得越久时变得越聪明,文本和图像在每一步都在互相帮助以完善答案。论文表明,通过允许人工智能“重新掩码”自己的错误并实时倾听另一半的声音,它能够以一种此前所缺失的协调水平来解决复杂的视觉谜题并编辑照片。这是迈向人工智能不再仅仅是执行指令,而是实现统一、自纠正循环式理解与创造的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →