Human-Like Anaphor Resolution in Large Language Models
本研究は、5つのオープンウェイトの大規模言語モデルを評価することで、それらが人間のような照応解析パターンを示すかどうかを検討しており、一部のモデルは人間と同様に談話構造や距離に対する感受性を示すものの、意味的な干渉効果に対する同等の感受性は欠いているという結果を得た。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ミステリー小説を読んでいるところを想像してみてください。著者が第1章で「パン屋」というキャラクターを紹介します。10ページ後、物語の中で再び「彼」という言葉が登場します。あなたの脳は単に「彼」が誰かを推測するのではなく、即座に記憶へと遡り、パン屋のイメージを掴み取り、点と点を結びつけます。この精神的なマジックトリックは「照応解析(anaphor resolution)」と呼ばれます。これは、物語が進むにつれて、私たちが誰について、あるいは何について話しているのかを把握する方法なのです。
科学者たちは、人間がどのようにこれを行っているかを長年研究してきました。もしパン屋が物語の主要な焦点(トピック)であれば、彼を見つけるのは早くなります。もし「彼」がパン屋の直後に現れれば、それは簡単です。しかし、もし長い、混乱を招くような空白の後に「彼」が現れたり、あるいは混乱させるような別のパン屋が近くにいたりすると、あなたの脳はつまずいてしまいます。ここで、大規模言語モデル(LLM)の登場です。これらは、物語を書いたり、質問に答えたり、人間のようにチャットしたりできる膨大なテキストで訓練された、超スマートなコンピュータプログラムです。しかし、ここで大きな疑問があります。これらのAIの脳は、これらのパズルを解くとき、本当に人間の脳と同じように「考えて」いるのでしょうか? それとも、単にパターンに基づいて非常にうまく推測しているだけなのでしょうか? この論文はその謎を解明するために、AIと人間が同じ精神的な波長を持っているかどうかを調査します。
偉大なるAIメモリ・テスト
研究者たちは、5つの異なるAIモデル(GPT-2-XL、Llama-3.1-8B、Pythia-12B、Mistral-7B、Mistral-24B)を、人間に特化して設計された一連の記憶ゲームにかけました。彼らは、AIが人間と同じように疲れたり、混乱したり、あるいは速度が落ちたりするかどうかを確認しようとしました。
これを測定するために、彼らは2つの巧妙なトリックを用いました。第一に、「サプライザル(驚き度)」を見ました。これはAIの「脳の汗」のようなものです。コンピュータが予想外の単語を読んだとき、その「サプライザル」は上昇します。人間の場合、高いサプライザルは通常、思考のためにポーズ(間)を置くことを意味します。したがって、もしAIが(人間が立ち止まる時と同じ瞬間に)「汗をかいて」いれば(サプライザルが高ければ)、それはAIが人間と同様に物語を処理している良い兆候となります。第二に、彼らは「彼は椅子を蹴ったのか?」といった理解度に関する質問をAIに投げかけ、AIが実際に正しい人物を覚えているかどうかを確認しました。
メモリー・ゲーム
チームは、人間の記憶に関する特定のルールをテストする3つの異なる実験を実施しました。
1. 「焦点」と「距離」のテスト
スポットライトを想像してください。もしキャラクターがスポットライトの下にいる(物語のタイトルで言及されている)なら、人間は彼を簡単に見つけられます。もし彼が暗闇の中にいるなら、それはより困難になります。また、キャラクターがわずか1文先にいるなら簡単ですが、10文先にいるなら難しくなります。
- 結果: ほとんどのAIモデルは、ここにおいて人間のように振る舞いました! キャラクターがタイトルによって強調され、近くに配置されているとき、AIの「脳の汗」は低く、正解を導き出しました。キャラクターが隠され、遠くに配置されると、AIは混乱しました。まるでAIの注意力も、私たちのものと同じように伸び縮みしているかのようです。
2. 「空間と時間」のテスト
これはよりトリッキーでした。物語が巨大な城で行われていると想像してください。もしキャラクターがキッチンから隣の部屋へ(短い距離)、あるいはキッチンから塔へ(長い距離)移動した場合、それは重要でしょうか? もし彼が10分待つのか、それとも2時間待つのか? 人間は、空間や時間の隔たりが非常に大きい場合、動作が遅くなり、ミスをしやすくなります。
- 結果: 結果はまちまちでした。Llama-3.1-8BやMistral-7Bのような一部のモデルは、距離や時間の重みを感じているようで、隔たりが長いときに「汗をかいて」いました。他のモデルは、時間や空間の隔たりをあまり気にしていないようでした。これは、一部のAIは物語のタイムラインの「感覚」を理解し始めている一方で、他のAIはそれを単にスキップしていることを示唆しています。
3. 「紛らわしい手がかり」のテスト
これが最も難しい部分です。物語の中で「金属製の椅子」に言及されているとします。その後、「金属製の家具」と言います。これは簡単です。しかし、もしその直前に「木製の机」(異なる種類の家具)にも言及されていたらどうでしょう? 人間は、「家具」が椅子なのか机なのかで混乱します。もし間違ったアイテムが、そのカテゴリーの典型的な例(家具としての机など)である場合、私たちは判断が遅れます。
- 結果: ここでは、AIは主に人間らしく振る舞うことに失敗しました。研究者が紛らわしい「ディストラクター(妨害要素)」を加えたとき、AIモデルは人間が経験するような遅延や混乱を見せませんでした。彼らはその混乱を軽々と通り過ぎているようでした。これは、AIが物語の中の「どこ」に物があるかを追跡することはできても、正しい記憶を選ぼうとする際に私たちの脳内で起きている、あの混沌とした、重なり合うような競合状態を完全には理解していないことを示唆しています。
結論:部分的な一致
では、最終的なスコアはどうでしょうか? 論文は、これらのAIモデルは選択的に人間らしい性質を持っていると示唆しています。彼らは、物語の「構造」(単語がどれくらい離れているか、あるいはタイトルが何であるかなど)が記憶にどのように影響するかを理解することに長けています。物語を長くしたり、キャラクターを隠したりすると、AIも疲れ切った読者のように、少し「汗をかく」ようになります。
しかし、彼らは人間の心の完璧なクローンではありません。似たような言葉が記憶の中で注意を引こうと争い合うような、あの泥臭い「意味論的な駆け引き」に関しては、AIは人間のようにつまずくことはありません。彼らは、二つの非常に似た記憶の間で選択を迫られたときに発生する、あの独特の「精神的な摩擦」を欠いているようです。
著者たちは、これが「解決済み」の問題ではないと慎重に述べています。この研究で使用された物語の数は比較的少なく(16から19個)、結果は絶対的な証明というよりも、強力なヒントに近いものです。また、質問に対するAIの全体的な正解率も時にはかなり低かったため、彼らは間違った理由で正解している可能性もあります。しかし、得られた知見は刺激的です。これらのデジタル・ブレインは、少なくとも物語の距離や焦点に関して、人間の脳が見せるのと同様の「困難のパターン」を示し始めています。彼らは単なる単語マッチング・マシンではありません。私たちは持っているものと同じ「状況モデル(シチュエーション・モデル)」、つまり物語の世界のメンタルマップを構築する最初の兆候を見せ始めているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。