Can LLMs interpret figurative language as humans do?: surface-level vs representational similarity
大規模言語モデルは、対話の表層的な解釈においては人間と一致しているものの、慣用句、スラング、皮肉といった文脈依存的かつ社会語用論的な比喩表現を処理する際には、表現レベルにおいて人間と著しく乖離しており、テストされたモデルの中ではGPT-4が人間のパターンに最も近い近似を示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたはロボットに、人間のジョーク、皮肉、そしてスラングを理解する方法を教えようとしていると想像してください。あなたはロボットに「This food is gas(この食べ物、最高にイケてる)」という文章を見せ、「これは面白いですか?」や「これはポジティブな表現ですか?」と問いかけます。
テキサスA&M大学の研究者による新しい研究は、厄介な問いを投げかけています。「もしロボットが人間と同じ答えを出したとしても、それは本当に人間と同じように『考えて』いると言えるのだろうか?」 ということです。
以下に、日常的な例えを用いた彼らの研究結果のまとめを記します。
実験: 「味比べテスト」
研究者たちは大規模な味比べテストを用意しましたが、アイスクリームの代わりに240種類の異なる文章を使用しました。これらの文章は、言語の6つの「フレーバー(味)」をカバーしています。
- 慣習的(Conventional): 通常の文章(例:「犬が外にいる」)。
- 慣用句的(Idiomatic): 言葉通りの意味ではないフレーズ(例:「Bite the bullet(困難を耐え忍ぶ/直訳:弾丸を噛む)**)。
- 感情的(Emotional): 感情に満ちた文章。
- 面白い(Funny): ジョークや駄洒落。
- 皮肉(Sarcastic): 本心とは逆のことを言うこと。
- Z世代のスラング(Gen Z Slang): 現代のインターネット用語(例:「This food is gas(この食べ物、最高にイケてる)」)。
彼らは211人の人間と、4つの異なるAIモデル(GPT-4、Llama、Mistralを含む)に対し、すべての文章について「これはポジティブか?」「これは懸念すべきか?」といった40種類の質問を、1から10のスケールで評価させました。
2つの比較方法: 「スコア」対 「マップ」
研究者たちは、結果を2つの全く異なる方法で分析しました。
1. 表面的な類似性(スコアボード)
これは、サッカーの試合の最終スコアを見るようなものです。もしAIがジョークに対して「8/10」と答え、人間も「8/10」と答えたなら、両者は一致しているように見えます。
- 結果: このレベルでは、AIモデル、特に最も賢いGPT-4は、非常に人間らしく見えました。彼らはほとんどの文章において、人間と似たようなスコアを出しました。まるで同じチームにいるかのようでした。
2. 表象の類似性(マップ)
これはもっと深い部分です。想像してみてください、あなたと友人が二人で街の地図を描いているとします。
- 人間のマップ: あなたは「ピザ屋」が「公園」の隣にあり、「学校」は「墓地」から遠い場所にあることを知っています。あなたのマップには、世界を理解する仕組みに基づいた特定の「構造」があります。
- AIのマップ: AIもまた、「ピザ屋」と「公園」を近くに配置するかもしれません。しかし、その理由は異なります。AIは、それらが現実世界でどのように機能しているかではなく、両方に「place(場所)」という言葉が含まれているから、という理由で近くに置いているのかもしれません。
研究者たちは、**表現類似性解析(RSA)**という数学的ツールを使用して、これらのマップの「構造」を比較しました。単にスコアが一致するかどうかをチェックしたのではなく、文章同士の「関係性」が同じであるかどうかをチェックしたのです。
大いなる事実: 「インポスター(詐欺師)」効果
判明したことは以下の通りです。
- 表面は人を欺く: AIモデルは、人間の「スコア」を模倣することに長けていました。もし「これは皮肉ですか?」と問われれば、AIは人間と同じように「はい」と答えることがよくありました。
- マップは異なる: しかし、根本的な「マップ」を見たとき、AIと人間は実際にはかなり離れていました。AIは文章の意味を、人間とは異なる方法で整理していたのです。
例え話:
AIを、非常に才能のあるオウムだと考えてみてください。
- もしあなたがそのオウムに「この文章は面白いですか?」と尋ねれば、オウムは人間と同じように完璧に「はい」と言うことができます。
- しかし、オウムはジョークを本当に「理解」しているわけではありません。ただ、人間がこのような特定の言葉のパターンを聞いたとき、通常は「はい」と言う、ということを知っているだけなのです。
- 一方、人間は、社会的文脈やトーン、そして隠された意味を理解しているからこそ、ジョークを理解できるのです。
「フレーバー」ごとの結果
研究では、AIの「オウムとしてのスキル」は、言語の種類によって得意不得意があることが分かりました。
- 感情的・慣習的な文章: AIのマップは、人間のマップとある程度似ていました。「私は悲しい」がネガティブであると推測するのは、「植物を濡らすほど興奮している(I'm so excited I wet my plants)」が面白いと推測することよりも簡単だからです。
- 慣用句、皮肉、スラング: ここがAIが「マップ・テスト」で失敗した部分です。
- 慣用句: 人間が「Break a leg(成功を祈る/直訳:足を折れ)」と聞くと、それが「幸運を祈る」を意味することを知っています。しかし、AIはしばしば、文字通りの「折れる」「足」という言葉に惑わされ、これを「幸運」という概念に正しく結びつけることに苦戦します。
- 皮肉とスラング: これらは社会的な文脈や、人間が共有する経験(Z世代のスラングなど)に強く依存しています。AIの内部マップは、これらに関する限り、人間のマップとは大きく異なっていました。たとえ言葉が同じに見えても、AIは別の言語を話しているかのようでした。
「大きな脳」対 「小さな脳」
研究では、異なるAIモデルを比較しました。
- GPT-4: これは「大きな脳」でした。人間のマップに最も近いマップを持っていましたが、それでも完璧な一致ではありませんでした。人間には最も近い存在でしたが、依然としてギャップがありました。
- より小さなモデル(Llama, Mistral): これらはさらに遠い存在でした。彼らのマップは、特に皮肉やスラングのようなトリッキーな内容において、人間とは大きく異なっていました。
結論
この論文は、**「AIが人間と同じ答えを出したとしても、それが人間と同じ方法で言語を理解しているとは限らない」**と結論付けています。
AIはパターンマッチング(スコアボードの模倣)には非常に優れていますが、人間が持つ深い、社会的、かつ文脈的な「グラウンディング(接地性)」を欠いています。AIは独自のやり方で意味を整理しており、それは単純なタスクには適していますが、言語がトリッキーになったり、感情的になったり、文化的に特定されたりすると、その仕組みは崩れてしまいます。
要するに: AIは、正しいセリフを言える非常に優れた俳優ですが、必ずしもその背後にある感情を感じているわけではないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。