Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking
本論文は、プロンプトのラッパーにおける些細なフォーマットの違いが、モデル依存的に大幅なスコアの変動やコンプライアンスの失敗を引き起こすことを示すために、フォーマット感度指数(FSI)および解析可能性感度指数(PSI)を導入し、この分散を考慮せずにベンチマークの正確性を評価することは統計的に脆弱であると論じている。
原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、あるオーディション番組の審査員になったと想像してください。ただし、あなたは歌手の声を聞くのではなく、歌詞だけを読むことが許されています。さらに、ある歌手には普通の紙に歌詞を書くよう指示され、別の歌手には豪華で硬いJSONボックスの中に書くことを強制され、また別の歌手には「BEGIN/END」という特定のサンドイッチで言葉を包むように命じられたとします。
歌詞の書き方が変わったからといって、歌手の才能が変わることはないはずですよね?紙の種類が変わっても、歌の内容は変わらないはずです。しかし、AdobeのDeep Pankajbhai Mehtaによるこの研究によれば、AIモデルではまさにそのことが起こります。「紙」(プロンプトのラッパー)の影響があまりにも大きいため、リーダーボード(順位表)が完全にひっくり返り、天才が初心者に見え、初心者が天才に見えてしまうことさえあるのです。
フォーマットによる大激変
研究者たちは大規模な実験を行い、4つの異なるAIモデル(70億から720億の「脳細胞」を持つもの)を用いて、7つの異なる質問回答タスクから14万個の回答を生成しました。彼らは5つの異なる「ラッパー」スタイルをテストしました:
- プレーン(Plain): 回答のみ。
- JSON: 厳格なコンピュータコード形式。
- 構造化(Structured): キーと値のペア。
- デリミタ付き構造化(Structured with Delimiters):
<BEGIN ANSWER>のような特殊なタグが付いたキーと値のペア。 - デリバレート(Deliberate): 回答の前に思考プロセス(スクラッチパッド)を置く形式。
結果として、モデルはこれらのフォーマット規則に対して非常に敏感であることが分かりました。あるモデル、Phi-4は、ラッパーを変えるだけで精度が0.763も跳ね上がるという、極めてドラマチックな動きを見せました。対照的に、巨大なQwen-2.5-72Bは、変動幅がわずか0.024という、落ち着いたロックスターのような安定感を見せました。
「これ、読めるの?」問題
なぜスコアが変わったのでしょうか?論文は、AIが突然賢くなったり愚かになったりしたわけではないと示唆しています。それは主にコンプライアンス(遵守)の問題でした。
これは、コインしか受け付けない自動販売機のようなものです。もしあなたが(たとえそれが有効な1ドル札であっても)1ドル札を投入しようとしたら、機械はそれを拒否します。この研究では、AIが厳格なJSONルールに従おうとした際、誤ってマークダウンのコードフェンス(``` のような記号)を付けてしまった場合、機械(回答抽出器)がそれを読み取ることができませんでした。その回答は「解析不能(unparseable)」と判定され、不正解としてカウントされました。
データは強い相関を示しています。AIが「解析可能(parseable)」でなくなったとき、その精度はしばしばゼロ近くまで急落しました。厳格なJSONラッパーを使用した場合のPhi-4モデルは、生成された回答の85.3%がマークダウンのコードフェンスで始まっており、その結果、解析可能性はわずか2.8%、精度は**0.7%となりました。研究者たちは、「解析可能性」が成功の強力な予測因子であることを発見し、モデルやタスクによる差異を考慮した後でも、スコアの残りの差の約82%**を説明できることを明らかにしました。
これが将来に意味すること
この論文は、AIの単一の精度数値を報告することは、華氏か摂氏かを言わずに気温だけを報告するようなものであり、誤解を招くと主張しています。ラッパーの選択によってスコアが0.76も変わるのであれば、その単一の数値は「統計的に脆弱」です。
著者らは、AIをテストする際、一つのラッパーを選んであとは祈る、というようなやり方をしてはいけないと提案しています。代わりに、以下のことを行うべきです:
- スコアの範囲を報告すること(「感度指数」のように)。
- 回答が実際に解析可能であるかを確認すること。
- 実世界のアプリケーションで厳格なフォーマットを使用する場合は、プロンプトによってではなく、デコーダー(テキストを生成する部分)によってAIがルールに従うよう強制されているか注意すること。
結論
この研究は、AIが壊れていると言っているのではなく、私たちの「物差し」がグラグラしていると言っているのです。「フォーマット感度指数(FSI)」と「解析可能性感度指数(PSI)」は、モデルのスコアがラッパーにどれほど依存しているかを測定するための新しいツールです。研究結果は、一部のモデルにとって、ラッパーの選択はモデル自身の知能よりも重要であることを示唆しています。これを修正しない限り、リーダーボード上の「最高の」AIとは、単にテストを作成した人が作った特定のフォーマットスタイルを、たまたま好んでいただけのAIになってしまうかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。