Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task
本論文は、大規模言語モデルが人間と比較して、対人関係の構造的かつ内包的な解釈においては優れている一方で、指示的かつ外延的なタスクにおいては性能が劣ることを示しており、これは、人間のような言語理解を達成する上での決定的な限界として、指示的な接地(グラウンディング)の欠如があることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたには、アンバー、ブライアン、クリスティーナ、デイナという6人の人々からなる、巨大で複雑な家系図があります。彼らは全員、「友人」、「敵」、「親」、「子」といった関係性でつながっています。
さて、誰かがこの家系図について、次のようなトリッキーな質問を投げかけたとしましょう。
「アンバーの親の友人は誰ですか?」
この論文は、この問いに答える能力において、人間と**AI言語モデル(LLM)**のどちらが優れているかを競う、真っ向勝負の対決です。しかし、ここにはひねりがあります。研究者たちは、参加者に全く異なる2つの方法でこの問題を解くよう指示したのです。
2つの解き方
「それは誰?」ゲーム(外延的タスク / Extensional Task)
- ゴール: 単にその人の名前を答えること。
- 答え: 「フェリシア」
- 何をテストしているのか: 地図をナビゲートして、特定の目的地を見つけられるか? これは、地図を見て、訪れるべき都市を指さすようなものです。
「どうやってそこへ行くのか?」ゲーム(内包的タスク / Intensional Task)
- ゴール: 名前を答えるのではなく、その人を見つけるための「レシピ」や「公式」を書き出すこと。
- 答え:
friend(parent(Amber)) - 何をテストしているのか: 文章の構造を理解し、手順を書き出せるか? これは、実際に車を運転するのではなく、運転の行き方を書いた道案内を作成するようなものです。
大きな驚き:人間とAIは正反対である
研究者たちは、人間とAIは全く異なる分野に長けていることを発見しました。それは、まるで**「人間のナビゲーター」と「超高速の翻訳家」**を比較しているかのようです。
人間はナビゲーター:
「それは誰?」と聞かれたとき、人間は非常に優秀でした(正解率83%)。彼らは家系図を見て、つながりを辿り、正しい人物を指し示すことができました。
しかし、「レシピ」を書くよう求められたとき(friend(parent(Amber)))、人間は苦戦しました(正解率71%)。これは、優れたドライバーであるはずなのに、いざ書き方の教科書を作ろうとすると、その具体的なルールを忘れてしまうようなものです。AIは超翻訳家:
「レシピ」を書くとき、AIは驚異的な能力を発揮しました(正解率95%)。AIはこれを言語パズルとして扱いました。「アンバーの親の友人」という言葉を見て、単にそれらを数式へと並べ替えたのです。これは、フランス語を英語に変換することには完璧だが、一度もフランスに行ったことがない翻訳家のようです。
しかし、「それは誰?」と聞かれたとき、AIは混乱しました(正解率80%)。AIは、家系図を実際に「使って」特定の人物を見つけ出すことに苦労しました。レシピ(公式)は知っているものの、それを実行して目的地にたどり着くことができなかったのです。
なぜこのようなことが起こるのか?
論文は、その理由をシンプルに示唆しています。それは、**「どこでスキルを学んだか」**です。
- 人間は、現実世界との相互作用を通じて言語を学びます。私たちは「友人」や「親」がどのようなものかを知っています。なぜなら、実際に会ったことがあるからです。私たちは現実に「接地(グラウンディング)」しています。ですから、特定の人物(「誰」)を見つけることは自然なことです。
- AIは、テキストのみから学びます。AIはアンバーという名の人物に会ったことはありません。ただ、友人や親に関する何百万もの文章を目にしただけです。AIは言葉のパターンを見つけ、並べ替えるエキスパートですが、ナビゲートするための「現実世界の地図」を持っていません。それは、あらゆる料理本を読んだことはあるが、実際に料理を作ったり味を見たりしたことがないシェフのようなものです。
「抽象化」というひねり
研究者たちはさらに難しいバージョンとして、名前(例:「アンバー」)をランダムな文字(例:「h」)に、関係性(例:「friend」)をランダムな文字(例:「x」)に置き換えたものも試しました。
- 人間にとって、これは非常に困難でした。ランダムな文字を使ってレシピを導き出すのは、極めて難しい作業でした。
- AIは、レシピの部分については依然として良好でしたが、人物を見つける作業については非常に成績が悪くなりました。
まとめ
この論文は、AIが記号を操作し公式を書くこと(内包的タスク)には非常に優れている一方で、それらの記号を使って現実世界の答えを見つけ出すこと(外延的タスク)においては、まだ人間には及ばないという結論を下しています。
著者らは、AIが人間のように言語を真に理解するためには、単に本を読むだけでなく、人間と同じように現実世界に「接地」する必要があると主張しています。それまでは、AIはアイデアの素晴らしい翻訳家ではあっても、現実をナビゲートする完璧な航海術を持つ者にはなり得ないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。