← 最新の論文
💻 computer science

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

本論文は、マルチモーダル大規模言語モデルがウェブページのスクリーンショットをコードに変換する際、異常を特定する推論能力を備えている場合であっても、視覚的に摂動を与えられた要素を繰り返されるUIパターンで上書きしてしまうという、強力なパターン補完バイアスを示すベンチマークを導入するものである。

原著者: Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに写真を見せて、それを元に絵を描くよう教えている場面を想像してみてください。あなたはロボットにカメラと、「この写真を見て、見たままを正確に描きなさい」という指示を与えます。コンピュータサイエンスの世界では、これは「マルチモーダル」学習と呼ばれます。コンピュータが「目」(画像を見るため)と「脳」(テキストやコードを理解するため)の両方を使うことを指します。最近、これらのロボットはウェブサイトのスクリーンショットを見て、それを再構築するために必要なコンピュータコード(HTMLやCSS)を書くことが非常に得意になりました。それはまるで、家の写真を見せて、その家を建てるための設計図を即座に書かせるようなものです。しかし、ここには厄介な問題があります。ロボットはパターンの推測を得意としています。もし、赤いボールが並んでいる列を見せられ、その後に青いボールが一つ混ざっていた場合、彼らは「赤」が期待されるパターンであるため、最後も赤だと予想してしまうかもしれません。この論文は、恐ろしい問いを投げかけています。ロボットがウェブサイトを見るとき、彼らは本当にピクセルを見ているのでしょうか、それとも、そこにあるべきだと彼らが「思っている」ものに基づいて推測しているだけなのでしょうか?

研究者のKhai-Nguyen Nguyen、Oscar Chaparro、Antonio Mastropaoloは、この検証を行うために、最高峰のAIロボットたちを使って「間違い探し」のゲームをすることにしました。彼らは「Pattern2Code」という特別なテストを構築しました。トランプの束のように、同じカードが積み重なったウェブページを想像してください。研究者はそのうちの一枚を取り出し、こっそりと幅を少し広げたり、テキストのフォントサイズを変更したりしました。そして、この少し「壊れた」デッキのスクリーンショットを5つの異なるAIモデルに見せ、その「変な」カードの幅やフォントサイズを記述するコードを書くよう求めました。ここでの罠は、提示されたコード上では、他のすべてのカードが同じサイズであるように設定されており、強力なパターンを作り出していたことです。

結果は、手品の手口を知っていながら、あえてそれを行う手品師を見ているかのようでした。AIモデルは、パターンを無視することに対して驚くほど無力でした。「変な」カードが大きな明らかな変化(例えば、カードが20%広くなっているなど)であった場合、最も優れたAIでも正解できたのは約69%でした。しかし、変化が非常に小さく微妙な場合(例えば、フォントサイズがほんの少し大きくなった場合)、モデルは画像を見ることに対してほぼ完全に諦めてしまいました。代わりに、彼らは画像の内容とは一致しない「すべて100%である」というコードを書き、パターンに従ってしまったのです。実際、微妙なテキストの変化については、モデルは80%以上の確率で間違えており、視覚的な証拠に従うのではなく、盲目的にパターンに従っていました。

この研究は、画像がクリアに見えにくくなると、この「パターン盲目(pattern blindness)」が悪化することを発見しました。もし研究者が画像の上に視覚的な「ノイズ」(ランダムなグレーのブロックなど)を加えると、モデルはさらに混乱し、パターンに固執しました。また、変なカードが通常のカードに囲まれて列の中央にある場合は、AIが見つけやすいことも分かりました。しかし、端にある場合は、AIが見逃す可能性が高くなります。興味深いことに、AIモデルが自身の「思考プロセス」の中で、変なカードを見つけ、正しいサイズを計算したとしても、彼らはしばしば自分自身の計算を無視し、パターンに合わせるために答えを変更していました。それはまるで、ロボットが青いボールを見て「これは青だ」と考えたものの、「待てよ、他のやつらはみんな赤だから、私も赤と言っておこう」と言っているかのようです。

研究者たちは、これらのAIツールはウェブサイトの全体的な形状を捉えることには驚異的ですが、人間によるダブルチェックなしに、細かな精密なディテールを正確に把握することを信頼することはできないと結論付けています。詳細がより微妙になればなるなるほど、AIは存在しないパターンを「幻視(ハルシネーション)」する可能性が高くなります。このことは、現時点では、AIが生成したコードを、ロボットが無視したがる小さなミスを捉えるための、注意深い人間の目が必要な「下書き」として扱うべきであることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →