TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
本論文は、自動化された視覚言語モデル評価器を用いて、テキストから画像生成モデルの微細な指示追従能力を体系的に評価するための、5,000個の多様なプロンプトと新しいGlobal Normalized Edit Distance指標を備えた包括的なベンチマークであるTIIF-Benchを紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボットのアーティストに非常に具体的な台本を与えているディレクターだと想像してください。あなたはこう言います。「赤い帽子をかぶった猫が、青い椅子に座って左を見ている絵を描いて」。もしロボットが、緑の帽子をかぶって右を見ている猫を描いたとしたら、それはあなたの指示に従えなかったことになります。長い間、私たちはこれらのロボット・アーティスト(テキストから画像生成を行うT2Iモデルと呼ばれます)が、どれほど正確に私たちの指示を聞いているのかを解明しようとしてきました。しかし、これまで使用されてきたテストは、壊れた定規のようなものでした。あまりに短すぎ、測るべきものが間違っており、スコアさえも誤ることが多いのです。
そこで登場したのが、研究者たちが作り上げた、AIアーティストが指示の細部を本当に実行できているかを検証するための、極めて精密な定規であるTIIF-Benchです。
問題点:古い定規は壊れていた
古いテスト手法を考えるなら、それは審判が全体像しか見ていない「絵当てゲーム」のようなものです。
- 「一律対応」の欠陥: 古いテストは通常、AIに対して単一バージョンのプロンプトしか与えませんでした。これは、AIには「気分屋」な側面があることを見落としています。短い文章を与えれば完璧な絵を描くのに、意味は同じでも説明的な言葉をいくつか付け加えるだけで、完全に台無しにしてしまうAIがあるのです。古いテストは、プロンプトの長さによる変化を体系的にテストしていなかったため、この問題を見逃していました。
- 「冗長性」の欠陥: 多くの古いテストバンクは、同じ曲を音量を変えて1,000回再生しているプレイリストのようなものでした。論文によれば、既存のベンチマークの多くには膨大な量の意味的な冗長性があります。つまり、プロンプトがあまりに似通っており、AIが「新しい概念」を理解しているかをテストできていないのです。実際、これらの古いベンチマークの中には、意味的にユニークなプロンプトが60%未満であるものさえありました。
- 「怠慢な審判」の欠陥: 古い審判は、生徒のエッセイを最初の1文だけ見て採点する教師のようなものでした。彼らはCLIPのような単純なツールを使用しており、それは単語の順序や論理を無視して、一致する単序を数えるだけの「バッグ・オブ・ワーズ(単語の袋)」として機能していました。もし「男の上の蜂」と「蜂の上の男」を求めたとしても、これらの古い審判は両者の違いを判別できないことがよくありました。
新しい解決策:TIIF-Bench
研究者たちは、指示に従わないAIを挫折させるために設計された、巨大な障害物コースのような5,000問のテスト、T2I-Bench(Text-to-Image Instruction Following Benchmark)を構築しました。
1. 「短い vs 長い」チャレンジ
このテストのすべての指示には、「短い」バージョンと「長く、凝った」バージョンの2種類があります。
- 短い版: 「鳥は魚よりも数が多い。」
- 長い版: 「夜明けの穏やかな光を受けて羽を輝かせる鳥たちは、水面のさざ波の下を静かに滑る水中の仲間である魚よりも、圧倒的に数が多い……」
論文は、もしAIが同じ意味を保ちながら、この長く装飾的なバージョンを扱えないのであれば、それは真の意味で「指示に従っている」とは言えないと示唆しています。彼らは、トップクラスのモデルは一貫性を保てる一方で、能力の低いモデルは余計な言葉によって混乱してしまうことを発見しました。
2. 「3つの難易度レベル」
テストは、ビデオゲームのように3つのレベルで構成されています。
- 基礎的な追従(Basic Following): 「赤い犬」のような単純な組み合わせ。
- 高度な追従(Advanced Following): 「青い猫の隣を走る赤い犬」のような要素の混合や、画像内にテキストを描くよう指示すること(例:ケーキの上に「CAKE」と書く)。
- デザイナーレベル(Designer Level): これらは「ボス戦」です。これらは、「金髪の男性が別の男性にメダルを授与しており、彼らのシャツには特定のテキストが書かれている」といった、人間のデザイナーによる複雑で現実的なリクエストです。ここには、高品質で人間が精査した100個のプロンプトが存在します。
3. 新しい「スマートな審判」(TIIF Evaluator)
怠慢な教師の代わりに、論文では探偵のように振る舞う超スマートなAI審判(視覚言語モデル)を使用しています。
- チェックリスト: 単に「良い」や「悪い」と言うのではなく、審判はプロンプトをYes/No形式のチェックリストに分解します。鳥と魚のプロンプトの場合、「鳥はいるか?」「魚はいるか?」「鳥は魚より数が多いか?」と問いかけます。
- 推論プロセス: この審判は単に推測するのではなく、答えを出す前にその理由(Chain-of-Thought)を書き出します。論文では、この手法が単にAIに「この画像は良いですか?」と尋ねるよりもはるかに信頼性が高いことが示されています。
- 「幻覚(ハルシネーション)」の罠: 論文では、プロンプト全体をそのまま審判の質問に貼り付けることに対して明確に反対しています。審判にフルプロンプトを見せてしまうと、プロンプトに書いてあるからといって、存在しないものを「想像(幻覚)」してしまうという現象が見つかったためです。新しい手法では、特定の、孤立した質問を行うことでこれを回避しています。
4. 特殊スキル:テキストとスタイル
- テキスト描画: 言葉を描くことはAIにとって困難です。論文では、AIがどれだけ正確に単語を綴れるかを測定するために、GNED(Global Normalized Edit Distance)と呼ばれる新しい指標を導入しました。これは、足りない文字や余分な文字をカウントするスペルチェッカーのようなものです。彼らは、一部のモデルは改善しているものの、多くのモデルがいまだに明確な単語を書くことに苦労していることを明らかにしました。
- スタイル制御: テストには、AIがオブジェクトだけでなく、その「雰囲気」や「スタイル」(例:「サイバーパンクな都市」の写真)をコピーできるかを確認するための参照画像が含まれています。
何が見つかったのか:勝者と敗者
何十ものモデルに対して5,000のプロンプトを実行した結果、データは以下を示唆しています。
- 重量級モデル(The Heavyweights): ダウンロードできないクローズドソースのモデル(Nano-BananaやGPT-Image-1など)が、現在トップに君臨しています。これらは、特に難しい「デザイナーレベル」のプロンプトにおいて最高のスコアを記録しました。これらは、複雑な指示や長い文章を理解することに長けているようです。
- オープンソースのヒーロー: 誰でもダウンロードできるモデルの中では、Qwen-ImageとFLUX.2が最も強力です。これらは、大規模な商用モデルに急速に追いついています。
- 「統合型」の驚き: 一部のモデルは、テキスト理解と画像生成の両方を一つの脳で行おうとします(Unified Models)。論文は、これらが指示に従うことにおいて驚くほど優れていることを示唆しています。たとえ、画像の「フォトリアリズム(写実性)」が他のモデルより少し劣る場合でも、例えばJanus-Pro(自己回帰モデル)は、「差異化」や「否定」といった論理的タスクにおいてPixArt-Sigma(拡散モデル)を上回りました。
- 長さへの感受性: 論文は、高いスコアを持つモデルは通常、プロンプトの長さに対して**堅牢(ロバスト)**であることを測定しました。プロンプトを長くしても、スコアは高いまま維持されます。しかし、弱いモデルは、言葉を増やすとスコアが急落します。これは、深い言語理解が優れた画像生成と結びついていることを示唆しています。
まだ分かっていないこと
論文は、自らの限界についても正直に述べています。
- 語彙のギャップ: テストは主に一般的な物体(猫、犬、椅子)を使用しています。著者らは、これらのモデルが非常に珍しい、あるいは難解な単語をどのように扱うかについては、まだ分かっていないと指摘しています。
- 言語の壁: すべてのプロンプトは英語です。論文は、これらの結果が他の言語にも当てはまるかどうかは不明であると述べています。
- スタイルのニュアンス: フォーマルな表現と会話的な表現の違いが、結果にどのような影響を与えるかについてはテストしていません。
結論
この論文は、AIアートを「解決した」と主張しているわけではありません。むしろ、従来のテスト方法が壊れていることを示唆しています。5,000のプロンプト、短版と長版の使い分け、具体的なチェックリスト、そして推論ベースの審判を用いることで、TIIF-Benchはより鮮明な全体像を提供しています。それは、今日の最高のモデルとは、複雑で長ったらしい指示に対しても冷静さを失わずに処理できるモデルであり、「絵を描く能力」と「話を聞く能力」の間の溝が、最新世代のAIによってようやく埋められつつあるということを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。