TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
本文介绍了 TIIF-Bench,这是一个包含 5,000 个多样化提示词的综合基准测试,并提出了一种全新的全局归一化编辑距离(Global Normalized Edit Distance)指标,旨在利用自动化的视觉-语言模型评估器,系统地评估文本生成图像模型在细粒度指令遵循方面的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位正在给机器人艺术家下达非常具体指令的导演。你说:“画一只戴着红帽子的猫,坐在蓝色椅子上,看向左边。”如果机器人画了一只戴着绿帽子的猫,坐在红色的椅子上并看向右边,那么它就没能完成你的指令。长期以来,我们一直试图弄清楚这些机器人艺术家(被称为文本生成图像或 T2I 模型)究竟有多听话。但我们使用的测试方法就像一把坏掉的尺子:它们太短了,测量的东西不对,而且经常打错分。
TIIF-Bench 应运而生,这是一个由研究人员构建的全新的、超精确的“尺子”,旨在观察这些 AI 艺术家是否真的能遵循我们的指令细节。
问题所在:旧的尺子是坏的
把旧的测试方法想象成一场“猜图游戏”,评委只看大轮廓。
- “一刀切”的缺陷: 旧的测试通常只给 AI 一个版本的提示词。它们忽略了一个事实:有些 AI 就像情绪化的人——如果你给它一个短句,它能画出完美的图片;但如果你多加几个描述性的词(即使意思一样),它就会彻底搞砸。旧的测试无法捕捉到这一点,因为它们没有系统地测试模型如何处理不同的提示词长度。
- “冗余”的缺陷: 许多旧的测试库就像是一个循环播放同一首歌 1000 次且音量略有变化的播放列表。论文指出,许多现有的基准测试存在大量的语义冗余——这意味着提示词非常相似,以至于它们并没有在测试 AI 是否理解“新”概念。事实上,其中一些旧的基准测试中,语义唯一的提示词竟然少于 60%!
- “懒惰评委”的缺陷: 旧的评委就像是一个只扫一眼学生作文就给出成绩的老师。它们使用简单的工具(如 CLIP),这种工具就像一个“词袋”,只计算匹配了多少单词,却忽略了顺序或逻辑。如果你要求“一只鸟在男孩身上”对比“一个男孩在鸟身上”,这些旧的评委往往无法区分两者的区别!
新的解决方案:TIIF-Bench
研究人员构建了一个包含 5,000 个问题的庞大测试集——TIIF-Bench(文本生成图像指令遵循基准)。它就像一个巨大的障碍赛跑场,旨在绊倒任何注意力不集中的 AI。
1. “短 vs 长”的挑战
这个测试中的每一条指令都有两种形式:短版本和长版本(华丽版)。
- 短版本: “鸟的数量比鱼多。”
- 长版本: “那些鸟儿,羽毛捕捉着黎明时分温柔的光线,其数量远远超过了那些在泛着涟漪的水面下静静滑行的水生同伴——鱼……”
论文指出,如果一个 AI 无法在保持相同含义的同时处理这种长篇大论、辞藻华丽的版本,那么它就称不上真正“遵循指令”。研究发现,顶尖模型能保持一致性,但较弱的模型会被多余的词汇搞糊涂。
2. “三个难度等级”
测试像电子游戏一样分为三个等级:
- 基础遵循: 简单的组合,比如“一只红色的狗”。
- 进阶遵循: 混合元素,比如“一只红色的狗跑在蓝色猫的旁边”,甚至要求 AI 在图像中绘制文字(比如在蛋糕上写“CAKE”)。
- 设计师等级: 这些是“终极 Boss 战”。它们是来自人类设计师的复杂、现实世界的请求,例如“一个金发男子正向另一名男子颁发奖章,且他们的衣服上有特定的文字”。这里有 100 个高质量、经人工策划的提示词。
3. 新的“聪明评委”(TIIF 评估器)
它不再是那个懒惰的老师,而是一个使用视觉语言模型(VLM)作为“侦探”的超级聪明 AI 评委。
- 清单制: 评委不会只说“做得好”或“做得差”,而是将提示词分解为一系列 是/否 的问题清单。对于“鸟/鱼”的提示词,它会问:“有鸟吗?”“有鱼吗?”“鸟是否比鱼多?”
- 推理过程: 这个评委不只是瞎猜;它会在给出答案之前写下自己的推理过程(思维链)。论文发现,这种方法比仅仅问 AI“这张图好不好”要可靠得多。
- “幻觉”陷阱: 论文明确反对直接将整个提示词粘贴到评委的问题中。研究发现,如果把完整的提示词展示给评委,它会变得很懒,仅仅因为提示词里提到了某些东西,它就会产生“幻觉”(想象出并不存在的东西)。新方法通过询问具体的、孤立的问题来避免这一点。
4. 特殊技能:文本与风格
- 文本渲染: 画出文字对 AI 来说很难。论文引入了一个名为 GNED(全局归一化编辑距离)的新指标,用来衡量 AI 拼写单词的能力。这就像是一个自带拼写检查功能的工具,还会统计缺了或多了哪些字母。他们发现,虽然有些模型正在进步,但许多模型在写清晰的单词方面仍然很吃力。
- 风格控制: 测试包含了参考图像(比如一张“赛博朋克城市”的照片),以观察 AI 是否能复制“氛围”和“风格”,而不只是物体本身。
研究结果:谁是赢家,谁是输家
在通过数十个模型运行了 5,000 个提示词后,数据表明:
- 重量级选手: 闭源模型(即那些你无法下载的模型,如 Nano-Banana 和 GPT-Image-1)目前是擂台上的王者。它们得分最高,尤其是在困难的“设计师等级”提示词上。它们似乎比其他任何模型都更能理解复杂的指令和长句子。
- 开源英雄: 在任何人都可以下载的模型中,Qwen-Image 和 FLUX.2 是最强的。它们正在快速追赶那些大型商业模型。
- “统一型”惊喜: 有些模型尝试在一个大脑中完成所有工作(同时理解文本和绘制图像,称为统一模型)。论文指出,这些模型在遵循指令方面表现得惊人地好,即便它们的图片有时看起来不如其他模型那样具有“照片级真实感”。例如,Janus-Pro(一种自回归模型)在“差异化”和“否定”等逻辑任务上击败了 PixArt-Sigma(一种扩散模型)。
- 长度敏感度: 论文测量了模型得分与提示词长度的关系。得分高的模型通常具有鲁棒性。如果增加提示词长度,它们的得分依然很高。而较弱的模型则会在增加词汇量时表现崩塌。这表明,深度理解语言的能力与画出好图的能力是挂钩的。
他们还不了解什么
论文坦诚地说明了其局限性。
- 词汇差距: 测试主要使用常见物体(猫、狗、椅子)。作者指出,我们目前还不知道这些模型如何处理晦涩或罕见的词汇。
- 语言障碍: 所有提示词都是英文。论文指出,我们尚不确定这些结果是否适用于其他语言。
- 风格细微差别: 他们没有测试正式语言与口语化语言的变化如何影响结果。
核心结论
这篇论文并不是声称已经“解决”了 AI 艺术问题。相反,它指出我们旧的测试方法是失效的。通过使用包含 5,000 个提示词、具备短/长版本、特定清单以及基于推理的评委的 TIIF-Bench,我们得到了更清晰的图景。它表明,当今最好的模型是那些能够在处理复杂、冗长的指令时依然保持冷静的模型,而“擅长绘画”与“擅长倾听”之间的鸿沟,正随着最新一代 AI 的出现而被逐渐填平。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。