← 最新の論文
💬 NLP

Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs

本論文は、単語の重複、事前学習された知識、および固有名詞を制御することにより、LLaMA 2とFlan-T5が真の推移的推論を行っているのか、それとも表層的な手がかりに依存しているのかを調査しており、両モデルとも語彙の重複を利用している一方で、Flan-T5は知識ベースの操作に対してより高い耐性を示すことから、論理的理解の形成におけるファインチューニングの潜在的な役割を示唆している。

原著者: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

公開日 2026-09-10
📖 1 分で読めます☕ さくっと読める

原著者: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の分野において、「大規模言語モデル」として知られる特定の種類のコンピュータプログラムが世界中の注目を集めています。インターネット上の膨大なテキストを用いて学習したこれらのシステムは、物語を書いたり、言語を翻訳したり、複雑な質問に答えたりすることができます。これらの機械を研究している科学者にとっての中心的な問いは、それらが真に論理を理解しているのか、それとも単に以前に見たパターンの模倣をしているだけなのかということです。これをテストするために、研究者たちは「推移的推論(transitive reasoning)」と呼ばれる基本的なスキルに着目します。日常的な言葉で言えば、これは2つの別々の情報を結びつけて新しい結論に到達する能力のことです。例えば、ある人が「猫は動物の一種である」ことと、「すべての動物は食べ物を必要とする」ことを知っていれば、猫が食べ物を必要とするという具体的な事実を直接教えられなくても、論理的に導き出すことができます。このプロセスには、単なる記憶以上のもの、つまり事実を織り合わせる能力が求められます。近年の研究を突き動かしている疑問は、これら強力なコンピュータプログラムが実際にこの「精神的な織り合わせ」を行っているのか、それとも、馴染みのある単語を見つけ出して答えを推測するという近道をとっているだけなのか、ということです。

ヘリオット・ワット大学とエディンバラ大学の研究チームは、まさにこの問題を調査するために立ち上がりました。彼らは、2つの異なるタイプの言語モデル、すなわちLLaMA 2と呼ばれるものとFlan-T5と呼ばれるものに焦点を当て、それらが2つの事実を結びつけることを必要とする質問をどのように処理するかを調べました。科学者たちは、この種の思考力をテストするために設計された、既存の2つの質問コレクションを使用しました。QASCとして知られる一つのコレクションは、正しい答えを見つけるために2つの記述を組み合わせる必要がある科学に関する多肢選択式の質問を提示しています。もう一つのBamboogleと呼ばれるコレクションは、標準的な検索エンジンでは間違えてしまうほどトリッキーな質問を含んでおり、モデルに独自の処理に頼らせるようになっています。研究者たちは、モデルが実際にステップを踏んで推論しているのか、それとも質問と回答の両方に現れる日付や名前のような特定の単価に執着しているだけなのかを知りたいと考えました。

真実を見出すために、チームは情報を体系的に変更するという一連の巧妙な実験を設計しました。まず、事実とそれらを結びつける明確な例を与えた場合に、モデルが問題を解決できるかどうかを確認することから始めました。両方のモデルはこの条件下では良好なパフォーマンスを示しましたが、研究者たちはこれが簡単すぎるのではないかと疑いました。次に、彼らは事実を結びつける例を取り除き、モデルが自力でそれを解明するようにしました。結果は示唆に富むものでした。推論タスクに似たタスクで特別に訓練されていたFlan-T5モデルは、例がなくても非常に優れたパフォーマンスを維持しました。しかし、LLaMA 2モデルは、そのガイダンスなしでは著しく苦戦したため、推論のパターンを見る前にそれに強く依存していることが示唆されました。

研究者たちは、モデルが言葉の意味を本当に理解しているかどうかを確認するために、より劇的なアプローチを取りました。彼らは事実内の単語の順序を入れ替え、明快な文章を支離滅裂で意味をなさない文字列へと変えてしまいました。もしモデルが文章の意味について真に推論しているのであれば、この混乱によって答えを見つけることは不可能になるはずです。驚いたことに、モデルのパフォーマンスはほとんど低下しませんでした。文章が文法的に意味をなさない場合でも、彼らは依然として正しい答えを選ぶことができたのです。これは、モデルが文章を首尾一貫した思考として読んでいるのではなく、代わりに回答の選択肢と一致する特定のキーワードをスキャンしている可能性が高いことを示唆していました。研究者がそれらの合致するキーワードを完全に取り除くと、モデルの正確性は急落し、彼らがしばしば論理を導き出すのではなく、単に言葉を一致させているだけであることが裏付けられました。

モデルが学習データから答えを単に暗記している可能性を排除するため、チームはモデルがこれまで見たことのない質問を含むBamboogleデータセットを用いました。ここで、彼らは最後の厳格なテストを導入しました。彼らは、答えによく現れる特定のエンティティである人名、地名、日付を取り上げ、それらを無意味な言葉に置き換えました。また、事実内の単語の順序も入れ替えました。これらの支離滅裂なバージョンに直面したとき、LLaMA 2モデルはほぼ完全に失敗しました。馴染みのある名前や日付によるガイドなしでは、答えを見つけることができなかったのです。一方、Flan-T5モデルは異なる種類の回復力を示しました。パフォーマンスは低下したものの、他のモデルよりも有意に高い水準を維持していました。これは、Flan-T5は推論タスクに基づいて明示的に訓練されていたため、馴染みのある手がかりが剥ぎ取られたとしても、論理的な連鎖に従うためのより強固な能力を構築していたことを示唆しています。

本研究は、大規模言語モデルは推論しているように見えることはあるものの、その成功は多くの場合、どのように訓練されたか、およびテキスト内で利用可能な手がかりに依存していると結論付けています。推論タスクに合わせて特別に微調整されていないモデルにとって、複雑な質問に答える能力は、真の論理的演繹よりも、馴染みのある単語やパターンを認識することに大きく依存しているようです。たとえステップ・バイ・ステップで考えているように見えても、単に正しいキーワードを見つけているだけかもしれません。しかし、本研究は、事実を結びつける方法を教えるために設計されたデータセットを用いて注意深く訓練されたモデルであれば、より真の推論能力を発達させることができることを示唆しています。この能力により、馴染みのある名前や日付といった通常のショートカットが取り除かれた場合でも、質問に対処することが可能になります。これらの知見は、推論テストにおける高いスコアが必ずしも機械が論理を理解していることを証明するわけではなく、時には単に適切な言葉を見つけるのが非常に上手いだけであるということを思い出させるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →