← 最新の論文
💻 computer science

When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences

本論文は、大規模言語モデルが競合する仕様間の葛藤をどのように解決するかを体系的に測定するための対称性に基づいた実験的枠組みを導入し、多様な領域において、純粋な自然言語や入出力例よりも、形式言語および自然化された形式言語が優先されるという一貫した優先順位階層を明らかにしている。

原著者: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、博識な友人に、難しいパズルについて助けを求めている場面を想像してみてください。しかし、ここには一つ仕掛けがあります。その友人は、同じパズルに関する2つの異なる説明書を与えられているのです。片方は「赤いノブを左に回せ」と言い、もう片方は「赤いノブを右に回せ」と主張しています。人工知能(AI)の世界において、この「友人」とは、大規模言語モデル(LLM)のことです。これらはインターネット上のほぼすべてのテキストを学習した巨大なコンピュータプログラムです。それらは物語を書いたり、数学の問題を解いたり、コードを書いたりすることに長けていますが、受け取った情報が乱雑だったり矛盾していたりすると、しばしば混乱してしまいます。

この論文は、AI科学の特定の領域、すなわち**コンフリクト解消(衝突解決)**について掘り下げています。それはシンプルかつ深遠な問いを投げかけます。AIが2つの矛盾する指示を受け取ったとき、果たしてどちらに従うのか? AIは厳格な数学的公式を好むのか? 自然な英語による平易な文章を好むのか? 例示のリストを好むのか? それとも形式的なコードスニペットを好むのか? AIを、プログラミングコードの作成、医療診断、法的判断といった重要なタスクに使用し始めるにあたり、AIが「硬いルール」に従っているのか、それとも単に言葉の響きに基づいて推測しているのかを知ることは極めて重要です。AIがどちらの指示を優先するのかが分からなければ、その回答を信頼することはできません。

指示の頂上決戦

ユニバーシティ・カレッジ・ロンドンの研究者たちは、この問題を科学実験のように扱うことにしました。単にAIにランデร้องな質問をするのではなく、AIに2つの特定の、矛盾するルールを選択させるように強制できる制御されたアリーナを構築しました。彼らはこれを「対称性ベースのフレームワーク」と呼びました。これは、ルールの内容自体を変えるのではなく、ルールがどのように書かれているかだけを変えるように、ゲームを完璧に設定したことを意味する、少し凝った言い方です。

そのために、彼らは550種類の異なるコンフリクト・シナリオを含む大規模な「数学バトル・アリーナ」を作成しました。各シナリオにおいて、AIは数学の問題(数列の計算やグラフ上の経路探索など)を解かなければなりませんが、その解法について2つの異なる方法で説明を与えられました。彼らは4つの異なる「言語」の指示をテストしました:

  1. 純粋な自然言語: 単なる通常の英語の文章(例:「数字を足し合わせてください。」)。
  2. 形式言語: 厳格な数学記号と方程式(例:f(x)=x+1f(x) = x + 1)。
  3. 自然化された形式言語: 数学記号を使用しているが、英語の文章に包まれた混合形式(例:「関数は f(x)=x+1f(x) = x + 1 として定義されます。」)。
  4. 入出力例: 入力と結果を示す例のリスト(例:「2が入ると3が出てくる。5が入ると6が出てくる。」)。

AIは、特定のテスト問題を解くために、これらの記述のうちの1つを選ぶ必要がありました。研究者たちは、AIがどの記述を十分に「信頼」して従うのかを見守りました。

結果:信頼の階層構造

結果は驚くほど一貫していました。AIは単にランダムに選んでいたわけではありません。そこには明確な「お気に入り」がありました。結局のところ、AIは構造を愛し、曖昧さを嫌うのです。

研究者たちは、明確な「優先順位」を発見しました:

  1. トップティア(最上位): 形式的および自然化された形式的言語が明確な勝者でした。AIが平易な英語や例示と対峙したとき、これらに従う割合は**87%から93%**に達しました。AIにとって、きれいな数学的公式が見えると、それを「法」として扱うようです。
  2. ミドルティア(中位): 純粋な自然言語が2番目でした。これは例示よりは信頼できますが、数学よりは信頼性が低いものでした。AIは、例示と競合した場合、これらの指示を**78%**の割合で遵守しました。
  3. ボトムティア(下位): 入出力例が最も信頼されませんでした。AIが例示のリストと明確なルールの間で選択を迫られたとき、AIはほとんどの場合、例示を無視しました。

このように考えてみてください。もしあなたがロボットに、「私が昼食を食べた時間のリストです:12:00、12:15、12:30」と言ったら、ロボットはあなたが12:45に食べるのではないかと推測するかもしれません。しかし、もしあなたが「私は毎日午後12:00に昼食を食べます」と言えば、ロボットは12:00を厳守するでしょう。AIは、推測しなければならないパターンよりも、明示的なルールを好むのです。

数学だけではない:実世界でのテスト

チームは数学の枠にとどまりませんでした。彼らは、この「信頼の階層構造」が、より複雑な実世界の状況でも通用するかどうかを確認したいと考えました。彼らは以下の3つの領域でAIをテストしました。

  • ブール代数(論理ゲート): コンパクトな数学的公式と、巨大な「真理値表」(あらゆる可能な結果を網羅した膨大なリスト)を対決させました。真理値表は網羅的で間違いようのないものでしたが、AIは依然としてコンパクトな公式を**88%**の割合で好みました。AIは「総当たり」のリストよりも「スマートな」ショートカットを好むようです。
  • コード生成: コンピュータプログラムが何をすべきかという記述文と、自動テスト(プログラムが正しく動作するかを確認するコード)の間のコンフリクトをAIに与えました。ここでは、結果はAIの「脳の力」に依存しました。規模の小さい、能力の低いモデルは記述文に従う傾向がありましたが、最も強力なモデルは自動テストを強く好み、**97%**の割合でそれに従いました。これは、AIが賢くなるにつれて、人間による記述よりもコードテストという「硬い証拠」を信頼することを学習していることを示唆しています。
  • 臨床ルール(医学的助言): 薬の投与量に関する実際の医学的ルールを用いてAIをテストしました。興味深いことに、AIはフォーマット(英語か例示か)をそれほど気にせず、内容を重視していました。この領域において、AIは形式に関わらず、より「寛容な」ルールよりも、一貫して**「厳格な」**ルール(「これをしてはいけない」と述べているもの)を選択しました。これは、高リスクの分野において、AIに安全性を優先するバイアスが組み込まれていることを示唆しています。

これが私たちにとって意味すること

本論文は、AIは単なるランダムな推測者ではなく、どの指示に従うかを決定するための体系的な方法を持っていると結論付けています。AIは一般的に、例示のような「暗示的なパターン」よりも、明示的で構造化されたルール(数学的公式など)を好みます。

しかし、研究者たちは、これが完璧で不変の法則ではないことも発見しました。AIの好みは、モデルの賢さや実行するタスクの種類によって変化する可能性があります。例えば、医学的テストでは、AIはフォーマットを無視して、単に「より安全な」答えを探しました。

この研究は、AIがどのように考えるかを測定するための新しいツールを私たちに与えてくれます。AIには「お気に入り」の指示タイプがあることを理解することで、より優れたシステムを設計できます。もし私たちがAIに特定のルールに従わせたいのであれば、例示のリストから推測させることを期待するのではなく、明確で形式的な記述として書くべきでしょう。これは、AIが賢くなっているとはいえ、指示が矛盾しているときには、私たちが明確に言葉を伝える必要があることを思い出させてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →