Dependency-Aware Discrete Diffusion for Scene Graph Generation
本文提出了一种依赖感知、分层约束的离散扩散模型,该模型通过解耦结构与语义,从自然语言生成结构化场景图,从而相较于现有的文本到图像及图生成基线方法,提升了下游图像生成任务中的组合保真度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图向一位艺术家描述一个复杂的场景,以便他将其画出来。如果你只说“画一个人和一块冲浪板”,艺术家可能会画出这个人站在板子旁边、拿着板子,甚至是在板上冲浪。这种描述是模糊的。
现在,想象一下,你给艺术家的不是句子,而是一份蓝图。这份蓝图就是“场景图”。它就像一张流程图,其中:
- **节点(点)**代表物体(人、冲浪板)。
- **边(线)**将它们连接起来。
- 线上的标签确切地告诉你正在发生什么(例如,“骑行”、“拿着”、“站在旁边”)。
问题在于,计算机擅长阅读文本,但很难自动将这些模糊的文本转化为完美、结构化的蓝图。现有的工具往往将蓝图的每个部分视为独立的,就像在猜测一辆车的颜色时,根本不在乎这辆车是否真的存在。这导致了混乱且不合逻辑的绘图。
引入 DiScGraph:一种“感知依赖”的蓝图构建器
本文介绍了一种名为DiScGraph的新 AI 模型,它就像一位精通蓝图构建原理的大师建筑师。以下是它的工作原理,通过简单的类比来说明:
1. “建房”类比(核心问题)
想象你在建造一座房子。
- 旧方法(通用图模型): 建造者试图同时打地基、砌墙和安装窗户,将它们视为相互独立的任务。由于没有检查依赖关系,他们可能会在没有墙的地方安装窗户。
- DiScGraph 方法: 这位建造者遵循严格、逻辑的顺序:
- 首先,决定存在哪些房间(物体:“有一个厨房和一个卧室”)。
- 接下来,决定哪些房间是连接的(边:“厨房连接到卧室”)。
- 最后,决定这些连接中发生什么(关系:“厨房通向卧室”)。
DiScGraph 认识到,如果没有先建立“连接”(边),就不可能存在“关系”(如“骑行”)。它强制 AI 先构建结构,再填充细节。
2. “噪声与去噪”游戏(它是如何学习的)
该模型使用一种称为离散扩散的技术。这就像玩反向的“传话”游戏:
- 前向过程(添加噪声): AI 拿着一份完美的蓝图开始将其打乱。它随机删除单词、移除连接,或将“骑行”改为“拿着”。关键在于,它是智能地这样做的:如果它删除了人与冲浪板之间的连接,它也会自动删除“骑行”这个词。它知道如果没有链接,这个动作就毫无意义。
- 反向过程(清理): AI 学习反向玩这个游戏。它从一份被打乱、混乱的蓝图开始,尝试重建完美的蓝图。因为它学习了“建房”顺序(物体 连接 动作)的规则,它确切地知道如何修复混乱。
3. “奖励系统”(倾听用户)
有时,你希望蓝图匹配特定的句子,比如“一个人在波浪上冲浪"。
- AI 生成一份蓝图。
- 然后它检查:“这份蓝图匹配这句话吗?”它使用一个工具(CLIP),充当翻译,将蓝图的含义与文本进行比较。
- 如果蓝图匹配良好,它会获得“高分”(奖励)。如果它说“人拿着冲浪板”而你要求的是“冲浪”,它会得到低分。
- AI 利用这个分数来调整其生成过程,实际上是在说:“好吧,再试一次,但要确保动作与‘冲浪’这个词相匹配。”这无需从头重新训练整个模型。
他们发现了什么?
研究人员在标准数据集(如 Visual Genome 和 COCO)上测试了 DiScGraph,并将其与其他方法进行了比较。
- 更好的蓝图: 与之前的模型相比,它创建了更合乎逻辑、更准确的场景图,特别是对于罕见或复杂的关系(例如“一只狗追着一只猫”与仅仅是“一只狗和一只猫”)。
- 更好的画作: 当他们使用这些新蓝图来生成图像(使用 SDXL 等工具)时,生成的图片在遵循指令方面要好得多。如果提示语很复杂且包含许多物体,生成的图像就不会混淆或搞错谁在做什么。
总结:
DiScGraph 是一种让计算机将混乱的文本转化为结构化、逻辑化蓝图的新方法。通过强制计算机理解结构先于意义(在定义关系之前需要先有连接),它为图像生成创造了更好的计划,从而生成真正符合用户要求的图片。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。