Structured Output Collapses Answer Diversity Across 44 Language Models
本研究は、スキーマによる強制が行われない場合であっても、JSONのような構造化された出力形式を要求することが、44種類の言語モデルにおいて回答の多様性を著しく減少させ、支配的な応答へのモデルの収束を促進することを示しており、デコーディングの制約ではなく、プロンプトのレジスターそのものがモデルの挙動の測定可能な均質化を駆動していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
AIの秘密の生活:礼儀正しさとコードが出会うとき
想像してみてください。あなたは、これまでに書かれたほぼすべての文章を読み終えた、巨大で超スマートな図書館と話しています。この図書館は人工知能(AI)であり、チャットをしたり、ジョークを言ったり、物語を書いたりする能力で有名です。しかし、ここに一つ落とし穴があります。人間は、とりとめもなく流れるような文章で会話することを好みますが、コンピュータはそのようには話しません。コンピュータは、「JSON」や「XML」といった「構造化データ」と呼ばれる、厳格で整理された箱のような言葉で話します。それは、自由な形式でソネットを書く詩人と、レジで商品をスキャンする店員の違いのようなものです。店員の場合、すべてのアイテムは特定の枠に収まっていなければなりません。
長い間、科学者たちは、AIが詩人のようにチャットしているときにどのような振る舞いをするかを研究してきました。彼らは「木の名前を挙げて」といった質問をし、AIが何と答えるかを見てきました。通常、44種類の異なるAIにこの質問をすると、それぞれ異なる木を選んだり、あるいは偶然同じものを選んだりします。本論文は、シンプルかつトリッキーな問いを投げかけます。「AIに詩人のようにチャットすることをやめさせ、レジ係のように答えさせることを強制したらどうなるか?」AIは考えを変えるのでしょうか?AIはもっと退屈になるのでしょうか?それとも変わらないのでしょうか?これが重要なのは、あなたのスマートフォンで話しているAIと、バックグラウンドで実際にソフトウェアを動かしているAIが大きく異なる可能性があり、その違いが世界にどのような影響を与えるかを知る必要があるからです。
AIの性格の大転換
この研究において、研究者たちは「ワンワード・センサス(一単語の国勢調査)」と呼ばれる有名なテストを行いました。44種類の異なるAIモデルに対し、「木の名前を挙げて」や「単語を選んで」といった31の質問を投げかけるゲームショーを想像してください。元のゲームでは、AIは普通の英語で回答していました。研究者たちは、ルールがなくても、AIはある種の回答(木に対しては「オーク」など)に同意する傾向があるものの、依然として個性や多様性を持っていることを発見しました。
次に、研究者たちはルールを変更しました。質問を変えたわけでも、答えを強制するための特別なコンピュータ技術を使ったわけでもありません。プロンプトの最後に、たった一つの小さな指示を追加しただけです。「JSON形式でのみ回答してください(Reply with JSON only.)」。
JSONは、{"word": "oak"} のように、ラベルが付いた小さな箱のような形式でデータを記述する方法です。これは、ソフトウェアが他のソフトウェアと通信するために使用する言語です。研究者たちは、単にこの形式で話すよう「頼む」だけで、AIが答える内容が変わってしまうのかどうかを調べたかったのです。
大きな発見:「フォーマット税」
結果は驚くしいものでした。AIがJSONで回答することを強制されると、彼らは非常に似通ったものになりました。回答の多様性は急激に減少しました。
- 変更前: 普通のチャットでは、最も一般的な回答(最頻値)が選ばれる割合は約**41%**でした。
- 変更後: JSONでは、同じ回答が選ばれる割合が**64%**に跳ね上がりました。
- 多様性: AIが繰り出したユニークな単語の数は、52種類からわずか36種類へと減少しました。
研究者たちはこれを「漸進的なフォーマット税(progressive format tax)」と呼んでいます。それは、個性的であることに対する税金のようなものです。普通のチャットでは最も創造的でユニークだったAIが、JSONで話すよう求められると、その個性の多くを失いました。ある特定のAIは、その独自性(探索性)を1.31ビット失いました。これは、自分の答えを箱に入れるというだけで、個性の半分が消えてしまうようなものです。
それはバグではなく「レジスター」である
AIが混乱したのか、あるいはコンピュータが同じ答えを選ばせたのかと思うかもしれません。しかし、研究はそれを否定しました。
- 「冷却」のトリックではない: 人々がAIのランダム性を抑えたいとき、「温度(temperature)」という設定値を下げることがあります。研究者が確認したところ、「温度」は変化していませんでした。AIは思考におけるランダムさを失ったわけではなく、ただ「異なるランダムなもの」を選ぶようになっただけでした。
- デコーディングのエラーではない: また、コンピュータが他の単語をブロックすることで答えを強制しているのかもテストしました。コンピュータが何もブロックしていない状態でも、単にJSONを求めるだけでAIが考えを変えることがわかりました。この変化は、コンピュータの「口(デコーダー)」ではなく、AIの「脳(レジスターへの反応)」の中で起きているのです。
これは、パーティーでの振る舞いと、就職面接での振る舞いが異なる人物を想像してみてください。パーティー(普通のチャット)では、突飛な話をしたり、変わった言葉を使ったりするかもしれません。しかし、就職面接(JSON)では、突然非常にプロフェッショナルになり、安全で標準的な答えを選ぶようになります。AIが壊れているのではなく、単に「コードスイッチング(場面に応じた言語の切り替え)」をしているのです。
「再インデックス」ではなく「シャープナー(研ぎ澄まし)」
研究は、AIが「新しい」答えを選び始めたのではないことを明らかにしました。AIは、もともと好んでいた答えをより強く選ぶようになっただけなのです。
- 31カテゴリ中28カテゴリにおいて、普通のチャットで最も人気があった回答は、JSONにおいても最も人気のある回答でした。
- 答えが変わった数少ないケース(例えば、ボードゲームの質問で「チェス」から「モノポリー」に変わるなど)は、元の好みが弱かったために起こりました。JSON形式は、選択肢を根本的に変えるのではなく、AIの好みの選択をさらに強める「シャープナー(研ぎ澄ますもの)」として機能したのです。
「個性」はフォーマットの中に存在する
最も興味深い発見の一つは、AIの「個性」はフォーマットに依存するということです。
- 一部のAIには、愛する「デフォルトの回答」があります。例えば、あるAIは普通のチャットではチーズに対して「ゴーダ」と言うことを好みました。しかし、JSONを求められると、「ゴーダ」と言うのをやめて、大衆受けする回答に戻りました。
- 逆に、JSON専用の新しいデフォルトを形成するAIもいました。あるAIは、青色に対してチャットでは「セルリアン」と答えることは**0%でしたが、JSONでは100%**の確率でそう答えました。
- これは、AIには単一のパーソナリティがあるのではなく、「チャット用のパーソナリティ」と「JSON用のパーソナリティ」があることを意味します。これらは全く別物になり得ます。
なぜこのようなことが起きるのか?
研究者たちは、何がこの変化を引き起こしているのかを調べるために、異なるフォーマットをテストしました。
- JSONとXML: ツールやソフトウェアで使用されるこれらのフォーマットでは、AIの回答は収束し、似通ったものになりました。
- YAMLとCSV: これらもデータ形式ですが、AIの回答はそれほど変化しませんでした。
- ブラケット(角括弧): 回答を角括弧
[answer]で囲むよう指示した場合、AIの多様性はむしろ高まりました。
このことは、変化が単なる「構造」によるものではないことを示唆しています。問題は、AIがツールとして使用する特定のフォーマットにあります。AIはソフトウェアツールと対話するためにJSONを使うよう訓練されているため、JSONを求めることは、彼らをより保守的で画一的な「ツールモード」へと誘発するのです。
これがあなたにとって何を意味するか
論文は実用的な警告で締めくくられています。私たちは通常、AIが普通の英語でチャットしている様子を見て、そのモデルを判断します。チャットウィンドウの中で最も興味深く、多様な答えを出すAIこそが「最高のAI」だと考えてしまいます。しかし、この研究は、その同じAIが実際にソフトウェアとして使われるとき(これはほとんどの場合JSONを必要とします)、そのAIがはるかに退屈で画一的になることを示しています。
もしあなたが、映画を勧めたり、木を選んだり、アイデアを出し合ったりするアプリを作っているなら、チャットウィンドウで見ているAIは、実際にアプリを動かしているAIよりもずっと創造的である可能性があります。「JSON版」のAIは、測定可能なほど多様性が失われているのです。AIと話している自分と、AIが実際に仕事をしている自分との間のギャップは、稀に起こる事故ではなく、フォーマットに伴う固定コストなのです。
要するに、AIが本当に何を考えているかを知りたいなら、ただチャットするのではなく、フォームへの記入を求めてみてください。そのAIがいかに退屈になってしまうかに、きっと驚かされるはずです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。