← 最新论文
🤖 AI

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

本文介绍了 OpenGPT-4o-Image,这是一个包含 80,000 个指令-图像对、涵盖 11 个领域和 51 个子任务的大规模数据集,它通过系统化的自动化数据构建,显著提升了统一多模态模型在图像生成与编辑方面的性能。

原作者: Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,人们正日益雄心勃勃地试图构建出不仅仅只能识别所见之物的系统。多年来,计算机在描述照片或回答有关图像的问题方面已经变得非常出色。现在,研究人员正致力于创造一种新型智能,它不仅能理解一张图片,还能根据简单的句子从无到有地创造或修改图片。这种被称为图像生成与编辑的能力,依赖于海量的示例。正如儿童通过学习无数画作并接受反馈来学习绘画一样,这些计算机模型通过处理将文本描述与其代表的图像配对的海量数据来进行学习。学习材料的质量至关重要;如果示例过于简单或重复,模型的局限性就会一直存在。为了真正掌握现实世界中复杂、混乱且多样化的请求,这些系统需要一个与其试图模拟的世界同样丰富且结构化的课程。

一个研究团队介入其中,通过一个名为 OpenGPT-4o-Image 的新型大规模数据集为该课程提供了支持。他们意识到,虽然现有的数据集涵盖了诸如改变物体颜色或复制绘画风格等基础任务,但在面对更困难的挑战时往往显得力不从心。现实生活充满了需要同时执行多个步骤的请求,例如要求提供特定的科学图表,或者要求在背景变化的同时移动角色并添加新文本。为了解决这个问题,该团队构建了一个包含 80,000 对高质量指令与图像的数据集。他们并非随机收集这些示例,而是建立了一个系统性的框架,将广阔的图像创作世界分解为 11 个主要领域和 51 个特定子任务。这种结构确保了计算机学习的不只是绘画,还包括对空间的推理、遵循复杂的逻辑链,以及处理像化学插图或多步编辑命令之类的专业主题。

研究人员将他们的工作分为两个主要类别:从无到有地创建图像以及修改现有图像。在创作方面,他们专注于五项核心能力。首先,他们教模型模仿多样化的艺术风格,从古老的水墨画到现代的赛博朋克美学。其次,他们用需要同时兼顾多个想法的复杂指令来挑战模型,例如在场景中放置特定数量的物体并具有精确的空间关系。第三,他们解决了在图像中直接书写文本的难题,确保单词拼写正确并自然地融入场景之中。第四,他们测试了模型理解几何与逻辑的能力,要求它计数物体或判断哪个物体比另一个更大。最后,他们将模型的触角扩展到了专业领域,生成科学与工程领域的图像,例如行星磁层或机械齿轮的图表,在这些领域,视觉清晰度对于教育和研究至关重要。

在编辑方面,团队设计了一个类似的层级结构,以涵盖人们想要改变图片的多样化方式。他们包含了用户可能想要添加、删除或更换特定物体,同时保持其余场景完好无损的任务。他们还创建了一些场景,要求模型必须编辑嵌入在图像中的文本,在不扭曲周围图片的情况下更改标牌或标签。或许最值得注意的是,他们引入了复杂的编辑任务,要求模型同时遵循多条指令,例如在一次操作中同时改变背景、添加新角色并改变光照。他们甚至加入了多轮交互,即用户给出一个初步指令,查看结果,然后给出进一步完善图像的后续命令,从而模拟人类与艺术家之间的自然对话。

为了构建这个庞大的库,研究人员开发了一个充当不知疲倦助手的高度自动化流水线。他们使用强大的语言模型生成文本指令,然后使用高端图像生成器创建相应的图片。这一过程经过精心控制,以确保数据的多样性和难度水平的平衡,从简单的请求过渡到高度复杂的挑战。其结果是一个涵盖了从捕捉著名画家风格的热闹街景到蜗轮组技术图纸的所有内容的数据集。通过将这些结构化数据喂给领先的计算机模型,研究人员测试了模型是否能从中学习。结果非常明确:在这些模型经过该新数据集训练后,表现显著优于以往。在衡量模型遵循指令编辑图像能力的测试中,性能提升了高达 18%。在涉及从文本创建图像的任务中,提升幅度约为 13%。

这些进步表明,数据的组织方式与数据的量同样重要。研究表明,当模型接触到广泛的结构化挑战时,它们处理现实生活中微妙且苛刻请求的能力会变得更强。它们会变得更擅长理解“巨大的毛茸茸的鸟”应该看起来与“小鸟”不同,或者“科学图表”需要与“幻想插图”不同的精确度。虽然研究人员指出,他们的工作依赖于用于生成数据的工具的能力,但证据指向了一条清晰的前进路径。通过将复杂的图像创作任务系统地分解为易于管理且定义明确的部分,他们为人工智能实现超越简单的模仿,向着更稳健、可靠且多功能的视觉理解迈进奠定了基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →