← 最新の論文
💬 NLP

Shared Circuits for Shared Grammar: Tracing Subject-Verb Agreement Across Languages

5つのモデルファミリーにわたる29の言語を分析することにより、本研究は、多言語大規模言語モデルが主語と動詞の一致のために部分的に共有された計算回路を利用しており、その言語間の重複の度合いは、形態論的な屈折を明示的に表現する言語において高まることを示している。

原著者: Isabella Gidi, Antonio Almudévar, Core Francisco Park, Naomi Saphra, Ricard Marxer

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Isabella Gidi, Antonio Almudévar, Core Francisco Park, Naomi Saphra, Ricard Marxer

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

多くの言語を読み書きできる現代のコンピュータは驚くほど熟練しており、一つの「脳」で十数もの言語を翻訳したり質問に答えたりすることができます。しかし、その流暢さにもかかわらず、科学者たちはこれらのシステムが内部でどのように機能しているのかを完全には理解していません。中心的な謎は、多言語対応のコンピュータが、あらゆる言語の文法を扱うために一つの普遍的なルールセットを使用しているのか、それとも言語ごとに個別の、独自のエンジンを構築しているのかという点です。この問いが重要なのは、もし機械が異なる言語に対して同じ内部機構を使用しているのであれば、ある言語の研究から得られた知見が他のすべての言語を理解する助けになる可能性があるからです。しかし、もし機械が別々のエンジンを構築しているのであれば、英語について学んだことが、スペイン語や中国語をどのように処理しているかについては何も教えてくれないことになります。この研究が取り組む具体的なパズルは、主語と動詞の一致(主語が行う動作に合わせて動詞の形を変えるという文法規則。例えば、主語が「he」のときに「walk」を「walks」に変えること)を、これらのモデルがいかに処理するかという点です。

これを解決するために、研究者たちは5つの異なるオープンソース言語モデルのファミリーが、29の言語にわたってこの文法規則をどのように処理しているかを調査しました。彼らは、コンピュータの思考プロセスにおける特定の瞬間、すなわち、動詞の最後の文字や単語を予測する直前のわずかな瞬間に焦点を当てました。正しい文章の内部信号を、わずかに改変された誤った文章へと入れ替える手法を用いることで、チームはコンピュータのネットワークのどの部分が文法を正しく理解することに責任を持っているのかを正確に特定することができました。彼らは、スペイン語のように動詞が大きく変化する言語、中国語のように動詞が全く変化しない言語、そして英語のように特定のケースにおいてのみ変化する言語を用いて、この方法をテストしました。

調査の結果、これらのモデルは、すべての言語に対して完全に別々のエンジンを使用しているわけでも、すべての言語に対して単一の同一のエンジンを使用しているわけでもないことが明らかになりました。その代わりに、彼らはタスクが要求する場合にのみ、共有された一連の内部経路を再利用しているようです。研究者が、主語に合わせて動詞が目に見えて変化しなければならない言語を見たとき、ほぼすべての言語において、コンピュータのネットワークの同じ特定の部分が活性化していることを見出しました。これらの共有された経路は、コンピュータが二つの動詞の形態の間の正確な差異を復元する必要があるとき、例えば「I walk」と「he walks」を区別するときに最も一貫していました。これらの瞬間において、モデルは文法的な計算を行うための共通の共有回路に依存しているようでした。

しかし、この共有は一様ではありません。研究者が、動詞が全く変化しない言語を見たとき、内部の経路は非常に異なっていました。コンピュータは、これらの言語に対しては共有された仕組みを使用していないようでした。さらに示唆に富んでいたのは、英語の挙動です。英語は三人称単数の場合のみ動詞が変化するため、コンピュータの内部配線は、ほとんどの場合において、激しく活用する言語とは異なるものに見えました。しかし、コンピュータがまさにその「he walks」の形を生成しなければならなくなった瞬間、その内部活動は、動詞が絶えず変化する言語で見られるパターンとほぼ同じに見えるようにシフトしました。これは、コンピュータが言語自体に基づいて共有エンジンを使用するかどうかを決定するのではなく、その瞬間に実行している特定の文法操作に基づいて決定していることを示唆しています。

この研究では、ネットワークのこれらの共有された部分が実際にどのように振る舞うかも調査されました。彼らは、異なる言語における一致に責任を持つ特定のコンポーネントが、文の同じ部分に注意を払っていることを見出しました。モデルが動詞の形態を決定しようとしているとき、これらの共有されたコンポーネントは、それがスペイン語であれ、フランス語であれ、あるいは英語の特定のケースであれ、主語の代名詞と動詞そのものに注意を向けます。これは、重なりが単なる場所の一致ではなく、共有された部分が、主語に関する情報を動詞へとルーティングするという同じ仕事を実際に果たしていることを示しています。

最終的な知見は、多言語対応のコンピュータが単にすべての言語に対して個別のルールを暗記しているわけでも、すべてのことに対して単一の硬直したシステムを使用しているわけでもないことを示唆しています。彼らは、言語が同じ文法操作を可視的に実行することを要求する場合には、共有された内部構造を再利用する、柔軟なアーキテクチャを持っているようです。これらの構造がどの程度共有されるかは、言語のアイデンティティよりも、その言語がコンピュータに文法的な差異を明示的に計算し表示することを強いるかどうかによって決まります。これは、人工知能がどのようにして人間の文法の複雑で多様なルールを扱うようになるのかについて、より明確な全体像を提供しており、AIが新しい道具をゼロから構築するのではなく、機能的なツールを再利用することによって理解を構築していることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →