Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
この研究は、双方向型のBERTモデルが、自己回帰型のGPTモデルを阻害する「逆転の呪い(Reversal Curse)」に対しては耐性を持つ一方で、両方のアーキテクチャが複雑な多重集合の演繹的推論において苦戦することを明らかにしており、モデルの選択は生物医学的知識グラフの構築といったタスクの特定の論理的要求に合わせて調整されるべきであることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ブレーニー・ボッツと鏡の迷路
あなたがロボットに世界を理解させる方法を教えていると想像してください。あなたは猫の写真を見せて、「これは猫です」と言います。その後、あなたは「猫」という言葉を見せて、「この言葉に合う絵は何ですか?」と尋ねます。人間の脳は、この切り替えを難なくこなします。私たちは、「猫」が「絵」と等しいなら、「絵」は「猫」であることを知っています。しかし、長い間、大規模言語モデル(LLM)として知られる最も高度なコンピュータの脳たちは、この単純な反転に苦戦してきました。彼らは、答えのリストを暗記したものの、逆向きに質問されると問題が解けなくなる学生のようでした。この特定の不具合は「逆転の呪い(Reversal Curse)」と呼ばれています。
なぜこれが重要なのかを理解するために、これらのAIモデルを2種類の異なる読者だと考えてみてください。一方のタイプは、デコーダー(有名なGPTシリーズなど)で、前の単語に基づいて次の単語を予測しながら、物語を左から右へと読みます。これは物語を書いたり文章を完成させたりすることには長けていますが、全体像を見るために先読みすることはできません。もう一方のタイプは、エンコーダー(BERTなど)で、文章を一度にすべて読み、すべての単語を他のすべての単語との関係において同時に捉えます。それは、すべての単語のコンテキストを同時に示す拡大鏡を使って文章を読むようなものです。科学者たちは疑問に思ってきました。もしこれらのロボットに、グループを使った基本的な数学(例えば、友達のリストを組み合わせたり、共通の友達を見つけたりすること)を教えたら、彼らは実際に論理的に「考える」ことができるのでしょうか、それとも単に以前見たパターンの基づいて推測しているだけなのでしょうか? この問いは非常に重要です。なぜなら、もし私たちがこれらのロボットを使って複雑な知識マップ(医学や科学のためのものなど)を構築したいのであれば、彼らが単に繰り返すのではなく、推論できる必要があるからです。
論文の物語:誰が立場を逆転できるのか?
この研究において、研究者のDa Wu、Jingye Yang、そしてKai Wangは、これら異なるロボットの脳をテストすることに決めました。彼らは、「逆転の呪い」が永続的なバグなのか、それとも特定のモデルの構造による一時的な癖なのか、そしてこれらのモデルがアイテムの集合を含むより複雑な論理パズルを実際に扱えるのかどうかを確かめたかったのです。
ミラーテスト:逆転の呪い
まず、彼らは「逆転の呪い」に取り組みました。想像してみてください、あなたがロボットに「ジミー・カーターは第39代大統領である」と教えます。もしロボットに「第39代大統領は誰ですか?」と尋ねたら、標準的なロボット(GPT-3のような)はしばしばフリーズしてしまいます。それは一方方向の事実は知っていますが、その事実を反転させて逆の質問に答えることができません。研究者たちは、デコーダーモデル(GPTやLlamaなど)が本当にこの呪いに苦しんでいることを発見しました。彼らは「BはAである」から「AはBである」を導き出すことに苦労するのです。
しかし、エンコーダーモデル(BERT)は異なる状況でした。BERTは両方向から同時に読むため、混乱しませんでした。研究者がBERTに逆の質問をしたとき、BERTは99%の確率で正しく答えました。結局のところ、もしロボットに、ある関係が双方向で成り立つことを理解させたいのであれば、過去だけを見るのではなく、全体像を見ることができる脳が必要なのです。
論理パズル:グループの混合とマッチング
次に、チームはより難しい課題、つまり集合演算へと進みました。彼らはロボットに「和集合(Union)」(2つの友達のリストを1つの大きなリストに組み合わせること)と「積集合(Intersection)」(両方のリストに登場する友達を見つけること)を行うよう教えました。
- 初級レベル(2つの集合): ロボットがわずか2つの名前のグループ(「スーパーヒーロー」と「恐竜」など)を組み合わせたり比較したりするように求められたとき、デコーダーモデル(Llama 2および3)とエンコーダーモデル(BERT)の両方が素晴らしい成果を上げました。彼らはほぼ毎回正解を得ました。彼らは論理をマスターしたように見えました。
- 上級レベル(3つの集合): 次に、研究者はパズルを難しくしました。彼らはロボットに、3つのグループを一度に混ぜ合わせたり、「グループAとグループBに共通する友達を見つけ、その後にグループCを加える」といった操作の組み合わせを行わせました。
ここで、手品が失敗しました。ロボットは2つのグループの単純なタスクには優れていましたが、3つのグループが関わるとひどく躓きました。
- BERTの問題: BERTモデルは「ズル」をしているようでした。彼は実際に数学を行っているのではなく、単に認識している単語を探しているだけでした。もし文章に見たことのない新しい名前が含まれていれば、即座に「いいえ、それは間違いです」と答えます。しかし、間違った答えが彼が知っている名前を使っていた場合、混乱して「はい、それは正しいです」と答えてしまうのです。彼は語彙を暗記していたのであり、論理を理解していたのではありませんでした。
- Llamaの問題: Llamaモデル(デコーダー系)も苦戦しました。3つのグループの共通の友達を見つけるよう求められると、彼らはパズルの特定のルールを無視して、単に知っている全員の名前を列挙することがよくありました。彼らは正しい積集合を計算するのではなく、トレーニング中に見た名前のリストを呼び出しているようでした。
GPT-4というワイルドカード
研究者たちは、最新のクローズドソースモデルであるGPT-4もテストしました。このロボットは他のモデルよりもはるかに優秀でした。彼はほとんどの3セットの論理パズルを正しく扱うことができ、問題を解決するために問題を小さなステップに分解することがよくありました。しかし、たとえGPT-4であっても、グループの数が増えすぎると(7つや8つのセットなど)、間違いを犯し始めました。これは、現在最も賢いモデルであっても、複雑で多段階の推論に関しては限界があることを示唆しています。
大きな教訓
この論文からの主な教訓は、すべてのAIの脳が同じように作られているわけではなく、あらゆる仕事に適した完璧なロボットも存在しないということです。もし関係性を逆転させる(事実を反転させる)理解が必要なら、双方向モデルであるBERTが明確な勝者となります。しかし、もし物語を書いたり、文章の次の単語を予測したりする必要があるなら、単方向モデルであるGPTが依然として王者です。
最も重要なことは、この研究が、これらのモデルはパターンを見つけ出し、人間の言語を模倣することには驚異的ですが、必ずしも人間と同じ方法で「考えて」いるわけではないことを示唆している点です。論理が複雑になりすぎると、彼らはルールを理解するのではなく、単語を暗記することに頼ってしまう傾向があります。したがって、もしあなたが医学的な知識グラフを作成したり、難しい数学の証明を解いたりするシステムを構築しようとしているのであれば、ロボットが自力で解決してくれると信じるのではなく、どのように質問をするか、そしてどのような種類のロボットに作業をさせるかを非常に慎重に選ばなければなりません。ロボットは賢くなっていますが、真の論理的推論については、まだ学ぶべきことがたくさんあります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。