Where Norms and References Collide: Evaluating LLMs on Normative Reasoning
本論文は、規範に基づく照応解析において大規模言語モデルを評価するための人間による検証済みテストベッドであるSNICを紹介し、最先端のモデルであっても、状況に応じた身体性を伴う相互作用に不可欠な、暗黙的な社会的規範を一貫して特定し適用することに苦慮していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、友人と一緒に忙しいキッチンにいるところを想像してください。あなたは「マグカップを回してくれる?」と尋ねます。カウンターの上には3つのマグカップがあります。1つはピカピカに清潔で、残りの2つにはコーヒーの跡がこびりついています。
もしあなたが人間なら、友人が清潔なマグカップを渡してくれることを即座に理解します。相手に「清潔な方を」と言わせる必要はありません。なぜなら、あなたたちは「他人の汚れたコップから飲み物を飲まない」という、暗黙のルールを共有しているからです。この目に見えないルールこそが、**社会的規範(ソーシャル・ノーム)**です。
「Where Norms and References Collide(規範と指示対象が衝突する場所)」と題されたこの論文は、シンプルながらもトリッキーな問いを投げかけています。現代のAI(特に大規模言語モデル、LLM)は、明示的に指示されなくても、どのマグカップを指しているのかを理解できるのだろうか? という問いです。
以下に、日常的な例えを用いた彼らの研究結果の解説をまとめました。
問題点:AIの「盲点」
LLMを、図書館にあるほぼすべての本を読んだ非常に優秀な学生だと考えてみてください。彼らはトリビアに答えたり、論理パズルを解いたりすることには長けています。しかし、その学生は実際にキッチンや図書館、レストランで「生活した」ことはありません。「マグカップ」が何であるかは知っていますが、そのような場所で人々がどのように振る舞うかという、微妙で書き記されていないルールまでは学んでいないのです。
研究者たちは、この欠けているスキルを**規範に基づく指示対象解決(NBRR: Norm-Based Reference Resolution)**と呼んでいます。これは、乱雑な場面を見て、「社会的な文法(行動のルール)」を理解し、誰かが指し示しているものが何かを推測する能力のことです。
実験: 「規範の罠」の構築
これをテストするために、チームはSNIC(Situated Norms in Context:文脈における状況的規範)というデータセットを作成しました。
- 設定: 片付け、配膳、整理整頓といった日常的なタスクを含む、9,000もの短い物語(ヴィネット)を作成しました。
- 罠: すべての物語において、一見すると曖昧に見える質問を投げかけました。例えば、「皿を取って」という指示です。
- シナリオA: 部屋を掃除している最中。AIは汚れた皿を取るべきです。
- シナリオB: 部屋で配膳をしている最中。AIは清潔な皿を取るべきです。
- 人間によるテスト: AIを信頼する前に、210人の実在の人間がこれらのパズルを解きました。人間はほぼ一致して「規範的な」答え(例:「掃除をしているのだから、汚れた方を取る」)を選び、ルールが明確であることを証明しました。
結果:地図のないAIは迷走する
研究者たちは、いくつかのトップクラスのAIモデル(GPT-4、Llama、Phiなど)を、これら9,000の物語でテストしました。その結果は、まるで一度も訪れたことのない街をナビゲートしようとするGPSを見ているかのようでした。
- 「推測ゲーム」の失敗: AIに物語だけを与えて正しいオブジェクトを選ばせると、苦戦しました。平均して正解率は半分以下でした。AIは「掃除タスク」と「配膳タスク」の違いを理解できていないことが多く、その背後にある「規範」を理解できていませんでした。
- 「形式言語」の行き止まり: 研究者たちは、曖昧さを排除するために、数学的に精密な記述(Prologというコード言語を使用)をAIに与えてみました。驚くべきことに、これはあまり効果がありませんでした。それは、ドライバーに完璧な地図を与えながら、「それでも君は交通ルールを知らない」と言っているようなものです。AIは事実は知っていましたが、それでも「道路のルール」を知らなかったのです。
- 「カンニングペーパー」の成功: 研究者が、AIに対してルールを明示的に与えた場合(例:「ルール:掃除タスクにおいては、汚れたアイテムを取ること」)、AIのパフォーマンスは急上昇しました。突然、正解を導き出せるようになったのです。
大きな教訓
この論文は、現在のAIモデルは**「優れた百科事典だが、質の悪い隣人」**であると結論付けています。
- 彼らはマグカップが「何であるか」を知っています。
- 彼らは掃除が「どのようなものか」を知っています。
- しかし、明示的にルールを教えられない限り、社会的な文脈の中で人々がマグカップを「どのように使うか」を本質的に理解しているわけではありません。
著者らは、これは「盲点」であると主張しています。AIモデルはテキストで学習しますが、社会的規範はしばしば暗黙的(決して書き記されない)であり、かつ物理的に接地したもの(現実世界の物体や行動に結びついたもの)です。これらのルールは本の中に明確に記述されていないことが多いため、AIは見落としてしまうのです。
なぜこれが重要なのか(論文による説明)
論文は、もしロボットやAIアシスタントを実際の家庭やオフィスで働かせたいのであれば、彼らがこれらの目に見えない社会的ルールを学ぶ必要があると示唆しています。現状では、彼らがあなたに汚れたマグカップを渡してしまうのは、彼らが「愚か」だからではなく、「私たちはそのようなことはしない」という暗黙の社会的契約を学習していないからです。
要約すると: この論文は、AIが日常生活の「書き記されていないルール」を理解しているかどうかを確かめるためのテストを作成しました。その結果、AIは非常に賢い一方で、ルールをあらかじめ説明されない限り、私たちが暗黙のルールに頼って何を意味しているのかを推測することに関しては、現在非常に不得意であることが分かりました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。