Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review
本レビューは、事前学習済みTransformerにおける主語と動詞の一致、否定、および構成的汎化に関する表現論的、行動論的、およびメカニズム的観点からのエビデンスを統合することで、収束と断片化の明確なパターンを明らかにし、最終的には現在の限界を明確化し将来のクロスレベルの研究を導くためのアクセシビリティ・アンド・ユース診断を提案するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語は、単純なアイデアを組み合わせて無限に新しい思考を生み出すことを可能にする、ルールの体系です。数十年にわたり、科学者たちは、現在流暢なテキストを書き、複雑な質問に答える巨大なコンピュータプログラムが、本当にこれらのルールを学んだのか、それとも単に以前に見たパターンの模倣をしているだけなのかという疑問を抱いてきました。これらのプログラムは「事前学習済み言語モデル」として知られ、膨大な量の人間による文章を用いて訓練されています。それらは完璧に自然に聞こえる文章を生成できるため、多くの人々は、それらが人間と同じように文法や意味を理解していると仮定しがちです。しかし、正しい言葉を生成することと、なぜそれらの言葉が共に存在するのかを知っていることは同じではありません。プログラムは、基礎となる論理を実際に把握することなく、偶然、あるいはショートカットに頼って正しい文章を作ってしまうことがあります。この謎を解明するために、研究者たちはこれらのモデルの内部を覗き見るための3つの異なる方法を開発しました。それは、内部メモリにどのような情報が蓄えられているかを確認すること、出力される内容から実際に何を生み出しているかをテストすること、そして意思決定を引き起こす特定の経路を追跡することです。
研究者のイゼ・ワン(Yizhe Wang)とジェンフア・リン(Zhenhua Ling)による新しいレビューは、これら3つの方法を統合し、それらが同じ物語を語っているかどうかを検証しています。著者らは、モデルがどのように機能するかを理解するために不可欠な、言語の3つの特定の領域に焦点を当てました。それは、動詞が主語とどのように一致するか、単語の「not(〜ではない)」がどのように文章の意味を変えるか、そしてモデルがいかにして馴染みのある部分を組み合わせて新しい複雑なアイデアを作り出すか、という点です。これら3つの手法を用いた数百の研究を集約し比較した結果、研究者たちは、答えはどの言語的側面について問うかによって完全に異なると結論付けました。時には、3つの手法からの証拠が完璧に一致することもあります。しかしまたある時には、手法が食い違う物語を語り、モデルが実際に知っていることの欠落を明らかにすることもあります。
研究者が見出した最も明確な成功例は、主語と動詞の一致(単数主語には単数形の動詞が必要であり、「the cat runs」のように、複数主語には複数形の動詞が必要であるというルール)に関するものです。この領域では、モデルを見るための3つの異なる方法が一致しています。研究者がモデルの内部状態を調べたとき、名詞が単数か複数かを示す明確な信号を見つけることができました。モデルの出力をテストしたとき、それはほぼ常に正しい動詞の形を選択しました。最も重要なのは、研究者がその内部信号を変化させる介入を行った際、モデルの振る舞いが予測可能な形で変化し、誤った動詞を選ばざるを得なくなったことです。この収束は、単純な文法規則において、これらのモデルが真にその関係性を学習し、それを用いて意思決定を行っていることを示唆しています。
否定、つまりモデルが「not」という単語をどのように扱うかを見ると、状況はMuch more complicated(より複雑)になります。ここでは、3つのレンズは一致しません。内部チェックによれば、モデルは「not」の存在を検出し、それが文章のどこに適用されるかを大まかに理解できています。しかし、モデルに否定を含む文章に基づいたテキストの生成や質問への回答を求めると、正しい意味を適用できないことがよくあります。彼らは「not」という単語は見ているものの、まるで文章が肯定文であるかのように振る舞うことがあります。研究者たちは、モデルはマーカー(目印)を識別できても、それを文の真実性を反転させるために確実に用いているわけではないことを発見しました。それは、モデルが標識は見ているものの、その指示に従っていないかのようです。この不一致は、モデルが情報は持っているものの、完全な意味を理解するためにそれらを一貫して使用できていないことを意味します。
言語の異なる部分を組み合わせて新しい意味を作り出すという、3番目の領域は、最も混乱が見られます。これは、既知の単語とルールを取り込み、モデルが一度も見たことのない状況に適用する能力のことです。ここでの証拠は断片的です。一部の研究では、研究者がヒントを与えたり、タスクを小さなステップに分解したりする場合、モデルは単純な組み合わせを扱えることが示されています。他の研究では、モデルが自力で複雑な推論の連鎖を解こうとすると、しばしば失敗することが示されています。問題は、異なる研究が同じものを調べていないことです。ある研究はモデルがパターンを認識できるかをテストしており、別の研究はモデルがゼロから新しいアイデアを構築できるかをテストしています。研究者たちは、これらすべての研究を通じてこの能力を測定する単一の一貫した方法を見つけられなかったため、モデルがアイデアを組み合わせる一般的なスキルを真に備えているのか、それとも単に特定の限定的なトリックに長けているだけなのかを結論付けることができませんでした。
レビューの著者らは、これらの異なる結果が生じる理由は、言語の特徴によって孤立させやすさや使いやすさが異なるためであると示唆しています。主語と動詞の一致については、その特徴は単純で孤立しているため、モデルはそれを見つけ出し、使用することができます。否定については、モデルはマーカーを見つけることはできますが、文章全体の意味を変えるためにそれを使用することに苦労します。複雑な組み合わせについては、その特徴があまりにも広範囲に分散しており、定義が困難であるため、モデルはそれを明確に孤立させることさえできません。研究者たちは、これらのモデルが一般的な意味で言語を知っていると仮定することはできないと結論付けています。代わりに、彼らの知識はタスクに特化したものです。彼らは動詞を一致させることのような得意分野を持っていますが、否定の理解のような他の事柄については一貫性を欠き、古い部分から新しいアイデアを作り出すという最も複雑なタスクについては、まだ証明されていません。この発見は、私たちがこれらのシステムをどのように評価すべきかを変えるものです。単に正しい答えを得られるかどうかを見るだけでなく、そこに到達するために正しい論理を用いているかどうかも確認しなければならないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。