Do Language Models Consistently Encode the Current Year?
本論文は、言語モデルが現在の年を不整合にエンコードしていることを明らかにしており、修正に抵抗する事実的回想メカニズムを通じて事前学習に基づく「連合的」概念を維持する一方で、事後学習による「宣言的」概念はプロンプティングによって容易に更新されるという、両方の時間的概念を同時に修正することを妨げる根本的な乖離を生じさせている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語を読み書きする現代のコンピュータは、驚くほど巧みに人間の会話を模倣できるようになった。ニュースを要約し、物語を書き、歴史に関する質問に答えることができる。しかし、これらの機械には修正が困難な盲点がある。それは、彼らが「今」がいつであるかを真に理解していないということだ。過去の事実を列挙することはできても、彼らの内なる「現在」という感覚は、学習中に与えられたデータの混乱した残響であることが多く、今この瞬間に対する生きた意識ではない。この混乱は重要な意味を持つ。もし機械が現在の年を10年前だと信じ込んでいれば、最近の出来事に関する質問への回答を拒否したり、さらに悪いことに、まだ起こっていない未来について自信満々に事実を捏造したりする可能性がある。研究者たちは長い間、デジタルな精神がどのように時間の概念を保持しているのかを探求してきた。モデルが日付を知っていれば、その内部で時を刻む単一の統一された時計が存在しているはずだと想定して。
新しい研究はこの仮定に異を唱え、言語モデルが単一で一貫した時計を持っていないことを明らかにしている。代わりに、彼らは現在について、二つの別個で相反する考えを持っている。一つは、モデルがインターネットを読みながら学習した文法そのものに織り込まれた、深く構造的なものである。もう一つは、モデルが指示に従う方法を教えられた際に学んだ、浅く表面的な事実である。研究者たちは、これら二つの考えが日付については一致することが多いものの、それらが全く異なる内部メカニースに基づいていることを発見した。この分裂が厄介な問題を生み出す。すなわち、科学者がモデルの知識を現在の年に反映させるために更新しようとしても、浅い事実は容易に修正できるが、深い文法的な時間の感覚は動こうとしないのである。
この隠された二重性を明らかにするために、研究者たちはモデルに「今が何年だと思っているか」を尋ねる二つの異なる方法を設計した。第一の手法は、「連想タスク」と呼ばれるもので、日付を直接尋ねるのではない。代わりに、「1960年には……」といった文章の断片を提示し、次にどの言葉が来るかを予測させる。もしモデルが「was(であった)」のような過去形の動詞を予測すれば、それはモデルが1960年を過去であると考えていることを示唆する。もし「is(である)」や「will(だろう)」のような現在形や未来形の動詞を予測すれば、その年がまだ進行中であるか、あるいはこれから来るものであることを示唆する。この手法は、モデルの直感的な文法の把握、つまり初期学習中に数十億の文章を読み込む中で吸収したスキルに働きかけるものである。第二の手法は「宣言タスク」であり、より直接的である。単に「現在は西暦何年ですか?」と尋ねるか、あるいはその年を起点として物語を書くよう促す。これは、人間からの指示に従う方法を学習する段階で磨かれる、事実を述べる能力をテストするものである。
チームがこれらの手法を幅広いモデルに対してテストしたとき、明確なパターンが現れた。両方の手法とも、モデルの学習データが終了した時期に近い回答を出すことが驚くほど多かった。深い文法的なテストにおいて、モデルは一貫して、学習の打ち切りから約10ヶ月ほどしか離れていない年を推測した。これは、モデルの内なる時間の感覚が、学習データの中で最後に見た日付に固く結びついていることを示唆している。しかし、これら二つの手法は単に異なる方法で同じものを測っているのではなく、二つの異なるものを測っていた。研究者たちは、深い文法的な時間の感覚が、モデルが世界の事実を思い出すのと同様に、特定の組織化された経路に依存していることを発見した。対照的に、単に年を口に出して述べる能力は、単一の一貫した経路には依存していない。それは、質問のされ方に応じてモデルの様々な部分によって引き起こされる、柔軟で表面的な振る舞いなのである。
情報の保持方法の違いは、モデルを修正しようとする試みに重大な影響を及ぼす。研究者たちは、会話の中でヒントを与える、新しいデータで再学習させる、そして内部の重みを外科的に操作するという、三つの一般的な手法を用いてモデルの時間の感覚を更新しようと試みた。モデルが述べる浅い「宣言的な年」を更新しようとした場合、これらの手法は完璧に機能した。システムプロンプトで現在は2025年であると伝えるだけで、あるいは2025年の新しいデータを見せるだけで、モデルは即座に正しい年を高い精度で述べ始めた。それはまるで、ファイルキャビネットのラベルを貼り替えているかのようであった。
しかし、同じ手法を深い「連想的な年」に適用すると、完全に失敗した。たとえモデルに明確に2025年であると伝えても、その内なる文法は過去に留まったままであった。「2025年には……」という文章を完成させるよう求められると、モデルは依然として、まるで2025年が歴史的な出来事であるかのように、過去形の動詞を予測した。新しいデータによる再学習も、元の学習打ち切り時期に非常に近い年に対してのみ、わずかに効果があった。唯一、深い時間の感覚を動かすことができたのは、モデルの内部接続に対する複雑な外科的編集であった。しかし、ここに最後のひねりがあった。研究者がこの外科的手法を用いて深い文法的な年を修正したとき、モデルが年を口に出して述べる能力は変化していなかったのである。二つの時計を同期させることはできなかった。
この研究は、現在の年がこれらの機械の中では単一の概念ではないという結論を下している。深い文法的な時間の理解は、モデルが初期学習中に学んだ言語構造の根本的な部分であり、変化に対して非常に強い抵抗力を持っている。それは、モデルが年と動詞をどのように結びつけるかというパターンの中に織り込まれており、標準的な更新では消し去ることのできないほど深く根付いているのである。浅い宣言的な理解は、後に人間と話す方法を教えられた際に学んだ別個の層であり、容易に上書き可能である。これは、単にモデルに日付を伝えたり、新しいテキストで再学習させたりするだけでは、真に一貫した現在感覚を与えるには不十分であることを意味している。機械は正しい年を言うことができるが、世界は自分よりも古いのだと依然として考えている。この乖離は、これらのモデルを現実の世界に追いつかせるための刷新が、これまで考えられていたよりもはるかに困難であることを示唆している。なぜなら、一つの真実を修正しても、もう一つの真実が頑固に残ってしまうからである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。