The Query Cannot See the Question: A Short Convolution's Reach Decides Which Part of a Query Conditions Retrieval, and What Falls Outside Becomes a Confident Wrong Answer
本論文は、線形アテンションおよび状態空間モデルにおける短い因果的深度方向畳み込みが、クエリのどの部分が検索を条件付けできるかに対して、硬く劣化不可能な制限を課しており、それが重要な情報がこの狭いウィンドウの外側に位置する場合に、モデルが自信を持って誤った回答を生成させる原因となり、この失敗は浅い層では持続するものの、より深いアーキテクチャやより大きなカーネルによって軽減され得ることを示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
情報を記憶する現代の人工知能システムは、膨大な事実のアーカイブを保管している司書のように機能することがよくあります。質問を受けると、システムはまずそのアーカイブの中から正しいページを見つけ出し、それから答えを読み取らなければなりません。しかし、そこにはもう一つの、より困難な課題があります。それは、答えが単に存在しない場合に、それを察知することです。もし情報が見つからないのであれば、賢いシステムは、自信満々だが誤った答えを捏造するのではなく、「分かりません」と認めるべきです。この「知らない」ということと「これを知っている」ということを区別する能力こそが、信頼できる記憶と、作り話をする者(コンファブラター)を分かつものです。長年、研究者たちは、モデルが正しい事実を検索できなかった場合、それは情報が複雑すぎたか、あるいはモデルのトレーニングが不十分だったためだと考えてきました。しかし、新しい研究は、その問題がもっと単純で機械的なものであることが多いことを示唆しています。つまり、質問の中で重要な部分が、探索を行っているシステムのパーツにとって、物理的に「目に見えない」状態にあるのです。
マキシミリアーノ・スペランツァという独立研究者によって行われたこの研究は、質問を形成するために短く局所的なウィンドウ(窓)を使用する、特定の種類の人工知能アーキテクチャを調査しています。これらのシステムにおいて、メモリを検索するために使用される「クエリ(照会)」は、現在の単語と、その直前にある数個の単語のみを見ることで構築されます。このウィンドウの標準的な設定は非常に小さいため、わずか3単語前までしか見ることができません。研究によれば、この限定された視野は、単に言語を滑らかにするための些細な詳細ではなく、決定的な障壁となっています。もし質問内の重要な情報がこの極めて小さなウィンドウの外側にあった場合、システムはそれを無視したり、あるいは弱いものとして扱ったりするだけでなく、検索メカニズムにとって事実上「存在しない」ものとなります。その後、システムは、自身が見ることのできる質問の断片のみを用いて、完璧な自信を持って回答を進めますが、これはしばしば、正しく聞こえる誤った答えへとつながります。
これを証明するために、研究者は、事実が永続的なアーカイブに保存された合成言語を用いて訓練された小規模な言語モデルを構築しました。モデルには、「[エンティティ]の[関係]は何ですか?」といった質問が投げかけられました。ここで、エンティティは検索ポイントから1単語離れており、関係は3単語離れていました。標準的な設定では、ウィンドウは2単語前までしか到達できませんでした。これは、関係が常にウィンドウの外側にあることを意味していました。結果は明白でした。関係がウィンドウの端を越えた瞬間、システムの関係に対する感度は絶対零度まで低下しました。関係を変更しても、検索結果は微動だにしませんでした。モデルは欠落した単語を無視していたのではなく、文字通り、その単語に対して「盲目」だったのです。その結果、特定のエンティティに対して一度も述べられたことのない関係について尋ねられたとき、モデルは「分かりません」とは言いませんでした。代わりに、近くにあった別の無関係な事実を自信たっぷりに取り出し、自信に満ちた誤答のような「幻覚(ハルシネーション)」を作り出したのです。
研究では、単にウィンドウを広げることで、この盲目が解消されるかどうかについても検証されました。ウィンドウのサイズを両側にわずか1単語ずつ広げるだけで――これはモデルのパラメータをほんのわずかに増やすだけの変更ですが――、システムが「知らない」と認める能力は飛躍的に向上しました。モデルが以前に幻覚を起こしていた困難なケースにおいて、より広いウィンドウを用いることで、システムはほぼ毎回、正しく回答を控えることができ、精度は、約60パーセントからほぼ100パーセントへと跳ね上がりました。これは、失敗の原因が知能やトレーニングの不足によるものではなく、単純な幾何学的な制限、すなわち、検索ツールが情報を捉えるには短すぎたことによるものであることを証明しました。
研究者たちは自分たちの小さなモデルにとどまらず、この現象がより大規模で現実世界のシステムにも存在するのかを確認しました。彼らは1億3000万のパラメータを持つ公開済みの学習済みモデルを調査し、同じ機械的な断絶を発見しました。この大規模なモデルでは、システムの内部状態は単語の全シーケンスを「見る」ことができますが、その状態を読み取るために使用される特定のクエリ・メカニズムは、依然として短いウィンドウによって制限されていました。単語がウィンドウのずっと外側で変更されたとき、他の部分のシステムは変化を認識しているにもかかわらず、クエリの出力は正確にゼロのままでした。これにより、「盲目」が特定の学習の結果による癖ではなく、アーキテクチャの構造的な特徴であることが確認されました。
しかし、物語には初期の発見を複雑にする第二の層があります。深いモデルには、情報の伝達が行われる後続のレイヤーが多数存在します。研究によれば、これらの深いモデルにおいて、「目に見えない」単語からの信号は、永久にブロックされるわけではありません。それはレイヤーを通過するにつれて弱められますが、依然としてそこに存在しています。信号はるかに低い強度で到達しますが、それでも存在しているのです。研究者が同じタスクで深いモデルをファインチューニングしたところ、モデルは、当初ウィンドウの外側にあった情報を最終的に利用することを学習できることが分かりました。ただし、それにはるかに長い時間を要しました。短いウィンドウは情報を利用不可能にするわけではありませんが、学習するためのコストを高くするというものです。追加のレイヤーによる助けがない浅いモデルでは、ウィンドウは性能の硬い天井を設定します。深いモデルにおいては、それは時間をかけて支払わなければならない「通行料」となるのです。
最後に、この構成が稀なエッジケースなのか、それとも現実世界でよく起こることなのかを調査しました。研究者たちは、検索エンジンのクエリやトリビアのデータベースを含む様々なソースから、数万件の現実世界の質問を分析しました。その結果、90パーセントから100パーセントの間で、現実の質問の重要な部分は、標準的な短いウィンドウの届く範囲よりも離れていることが判明しました。この問題は例外的なケースではなく、日常的なケースなのです。人間の言語の幾何学的な性質として、質問の最も重要な部分同士が、標準的な短いウィンドウの検索メカニズムが一度にすべてを見ることができないほど離れて配置されているのです。
論文は、局所的なウィンドウを使用してメモリを検索するあらゆるシステムにおいて、この問題を診断するための、シンプルでコストのかからない方法を提示して締めくくっています。新しいモデルを訓練したり、複雑なテストを実行したりする必要はありません。単に質問を取り、文のずっと前にある単語を、同じ種類の別の単語に置き換え、システムの検索が変化するかどうかを確認するだけです。もし検索が動かないのであれば、その単語はシステムにとって「目に見えない」ものであり、システムが示すいかなる自信も、根拠のないものです。この研究は、これらのシステムが十分な深さと時間を与えられれば、自らのアーキテクチャ的な盲目を克服することを学習できるとしても、初期の失敗は機械的な必然であることを明らかにしています。システムは部分的な視点に基づいて完全な自信を持って回答しますが、アーキテクチャが変更されるか、モデルに十分なレイヤーを与えて「通行料」を支払わせるまでは、その自信はしばしば的外れなものとなるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。