Should We Still Pretrain Encoders with Masked Language Modeling?
広範な制御実験を通じて、本論文は、マスク言語モデル(MLM)が一般的に優れたテキスト表現をもたらす一方で、まず因果言語モデル(CLM)を適用しその後に MLM を適用する二相性事前学習戦略が、既存の事前学習済み CLM モデルを活用する場合、特に固定された計算予算の下で最適な性能を達成することを示している。
原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに人間の言語を理解させる方法を教えることを想像してみてください。長年、標準的な方法は「空欄補充」ゲームでした。いくつかの単語を隠し(マスク)、その前後の単語に基づいて、ロボットに隠れた単語を推測させるのです。これは**Masked Language Modeling(MLM)**と呼ばれます。両方向からの手がかりがあるクロスワードパズルのようなものです。
最近、新しいアプローチが人気を集めています。それは、テキストメッセージの自動補完のように、文の次の単語を一つずつ予測させる方法です。これは**Causal Language Modeling(CLM)**と呼ばれます。物語を読んで、先を見ずに次に何が起こるか推測するようなものです。
この論文が問う大きな問題は、「ロボットにまだ古い『空欄補充』の方法を教える必要があるのか、それとも新しい『次の単語を予測』する方法の方が実際には優れているのか?」という点です。
以下に、研究者たちが発見したことを簡単な比喩を用いて説明します。
1. 「専門家」と「万能型」
研究者たちは、小さなものから非常に大きなものまで、38 種類の異なるロボット脳を両方の方法で訓練しました。
- MLM ロボット(専門家): 「空欄補充」ゲームのみで訓練されたこのロボットは、文の全体文脈を理解する達人となりました。複雑な質問への回答や、テキストの感情分類などのタスクにおいて最も優れていました。事件現場をあらゆる角度から見て事件を解決する探偵のようなものです。
- CLM ロボット(万能型): 「次の単語を予測」ゲームのみで訓練されたこのロボットは、特定のタスク(テキスト内の固有名詞の発見など)において驚くほど優れており、非常に速く学習しました。しかし、文の双方向的な深い理解を必要とするタスクでは、より苦労しました。
結論: 最高の総合的なテキスト理解を構築するには、「空欄補充」(MLM)法が依然として王者です。「次の単語を予測」(CLM)法だけでは、最高の「エンコーダー」(テキストを意味に変換するツール)を作るには十分ではありません。
2. 「速いスタート」の利点
ここが興味深い点です。CLM ロボットは、初期段階で非常に速く学習しました。
- 比喩: マラソンの準備をする二人の学生を想像してください。
- 学生 A(MLM): 遅く、しかし着実に勉強し、深い基礎を築きます。最初はゆっくりですが、後になって非常に強くなります。
- 学生 B(CLM): すぐに走り出し、非常に速く体力をつけます。最初の数マイルは学生 A よりも先行しています。
- 発見: 訓練を早期に停止した場合(時間や資金が不足しているため)、CLM ロボットは実際には非常に競争力があります。これは「データ効率」が高く、少ない訓練時間で良い結果を得られることを意味します。
3. 「安定した基盤」
研究者たちはまた、CLM ロボットの方が微調整(特定の作業への調整)が容易であることを発見しました。
- 比喩: CLM ロボットを、非常に堅く平らなコンクリートスラブの上に建てられた家だと考えてください。その上に特定の部屋(特定のタスクのためのキッチンなど)を建てても、家が揺れることなく容易に建設できます。
- MLM ロボットは全体的には強固ですが、特定のタスクに調整しようとしたとき、少し「ぐらつき」がありました。完璧な結果を得るには、より慎重なチューニングが必要でした。
4. 勝利の戦略:「二段階」訓練
この論文の最大の発見は、単一の方法を行うよりも勝る、これらのロボットを訓練するための新しいレシピです。
- レシピ: まず「次の単語を予測」方法(CLM)でロボットを訓練し、速く安定したスタートを切ります。その後、「空欄補充」方法(MLM)に切り替えて、その理解を深めます。
- 結果: この「二段階」アプローチにより、これまでにない最強のロボットが生まれました。CLM によるスタートの速度と安定性、そして MLM による仕上げの深い理解を組み合わせたのです。
- ボーナス: すでに「次の単語を予測」方法で訓練されたロボット(これは非常に一般的で入手が安価です)を、「空欄補充」方法で「追加訓練」するだけでも構いません。これは最初からロボットを訓練するよりもはるかに安価です。
まとめ
この論文は、最高の結果を得るためには、従来の「空欄補充」方法(MLM)が依然として不可欠である一方で、新しい「次の単語を予測」方法(CLM)を無視すべきではないと結論付けています。
最善の道はハイブリッドです:
- 開始: 速く安定した「次の単語を予測」訓練から始める(または、すでにこれを持っている事前学習済みモデルを使用する)。
- 完了: 深い「空欄補充」訓練で仕上げを行う。
この戦略は、利用可能な最も賢いテキスト理解ツールを生み出しながら、コストと計算資源を節約します。著者たちは、他の人々がこの「二段階」レシピを自分で試せるよう、すべてのコードとモデルを公開しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。