Benchmarking Frontier Text-to-Image Models on Image-Description Prompts
本文通过 48 个高度复杂的提示词对四种前沿文本生成图像模型(Gemini 3 Pro Image、FLUX.2、Ideogram 3.0 和 Hunyuan 3.0)进行了基准测试,结果显示 Gemini 3 Pro Image 以 84.8/100 的得分领先,同时也强调了当前系统主要在物体计数、几何准确性和文本清晰度方面存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代计算技术的静谧轰鸣中,一种新型艺术家已经出现,他们不以画笔或黏土为媒介,而是以文字为笔。这些是文生图系统,即通过聆听人类的描述并尝试绘制出与之匹配的图像的计算机程序。多年来,这些系统一直在简单的请求上接受测试,例如“一只坐在垫子上的猫”,它们在此类任务中表现出了惊人的优雅。但现实世界很少如此简单。当用户要求一些具体且复杂的场景时——例如一个恰好有四把红椅子的场景、一个字迹清晰写着“OPEN”的标牌,以及一个符合物理定律的水洼倒影——这些程序往往会出错。它们可能会画出三把椅子而不是四把,把标牌上的字母弄乱,或者让倒影悬浮在空中。理解这些系统为何失败,以及哪些系统失败得最少,对于任何希望将它们用于严肃工作(从设计广告到创作分镜脚本)的人来说都至关重要。一个能够处理简单任务的系统与一个能够应对现实中混乱、细节化需求的系统之间的差距,正是衡量智能真谛之处。
一组研究人员试图通过对四种最先进的图像生成系统进行严格测试,来衡量这一差距。他们并没有要求计算机绘制简单的图片;相反,他们向其输入了来自大型真实世界图像说明集中最具挑战性的四十八个描述。选择这些提示词是因为它们要求极高的精确度:精确的物体计数、特定的空间布局以及嵌入场景中的可辨识文本。受测系统包括 Hunyuan 3.0、Gemini 3 Pro Image、Black Forest Labs FLUX.2 和 Ideogram 3.0。为了确保判断公平且无偏见,研究人员采用了巧妙的两步法。首先,一个人工智能模型充当“撰写者”,为每个特定提示词创建一个关于完美图像应具备特征的详细清单,同时观察实际生成的图像以记录明显的缺陷。随后,另一个完全不同的人工智能模型充当“评委”,利用该清单对图像进行评分。这种分离确保了决定观察重点的模型与决定图像是否合格的模型并非同一个,从而消除了系统自我评分时可能产生的偏差。
结果揭示了能力上的明显分水岭。Gemini 3 Pro Image 和 FLUX.2 脱颖而出成为领先者,得分分别为 84.8 分和 82.3 分(总分 100 分)。紧随其后的是一个显著的差距,Ideogram 3.0 得分为 65.7 分,而 Hunyuan 3.0 为 63.3 分。顶尖选手与落后者之间的差异不仅仅是微小的错误,而是处理复杂性方式上的根本区别。领先的系统通常能把握大局,但偶尔会出现物体计数错误或细微的几何畸变,例如轮子奇怪地与框架融合。相比之下,落后的系统则在基础问题上挣扎。它们经常完全遗漏请求的元素,例如漏掉场景中的特定物体,或者将文本弄得模糊不清,使单词变成无法阅读的涂鸦而非清晰的字母。例如,当被要求绘制一个形状像汽车且带有特定地址的信箱时,得分最高的系统准确捕捉到了每一个细节,而得分最低的系统甚至没能让信箱看起来像辆车,漏掉了地址,并且只画了两个轮胎而不是四个。
这项研究强调,尽管这些系统正在进步,但它们仍然缺乏对离散、符号化规则的原生理解。它们擅长捕捉场景的整体氛围、色彩和构图,但在处理计数或正确拼写单词所需的精确逻辑方面却表现挣扎。研究人员发现,对所有系统而言,最具挑战性的任务是精确的顺序标记(例如将起跑器编号为五到八)以及对特定人数或物体数量的计数。即使是表现最好的系统 Gemini 3 Pro Image,在这些任务上也丢了分,尽管它出错的频率远低于其他系统。落后的系统,尤其是 Ideogram 3.0,表现出一种遗漏整个请求元素的模式,这表明它们有时在面对复杂指令时选择了放弃,而不是试图把细节做错。这种区别对用户而言至关重要:如果项目需要一个包含许多不同物体的场景,领先的系统要可靠得多;但如果目标是在图像中生成文本,即使是最好的系统也无法保证每次都能做到正确。
最终,这项研究证明了遵循复杂指令的能力是图像生成领域的新前沿。顶尖选手与其余选手之间的差距不在于风格或艺术造诣,而在于逻辑的一致性。两款领先的系统证明了它们可以处理构图需求中的重任,而其他系统则仍易于出现破坏现实幻觉的基础性错误。随着这些工具从实验性奇物向生产力工具转型,选择使用哪个系统将很大程度上取决于具体的任务。对于简单的、注重氛围的图像,差异可能微乎其微;但对于要求精确度的请求,领先者提供的可靠程度是其他系统目前尚无法企及的。未来的发展路径在于改进这些系统,使其更好地理解计数、文本和空间规则,从而将它们从只会猜测细节的艺术家,转变为能够确定执行细节的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。