EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training
本論文は、継続的な事前学習を、エストニア語を強化した多言語リプレイおよび軽量な事後学習アライメントと組み合わせることで、多言語LLMにおける英語の性能と一般的な推論能力を効果的に維持しつつ、エストニア語能力を大幅に向上させられることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、物語を書いたり、問題を解決したり、質問に答えたりすることができる、今日の最も高度な人工知能ツールの背後にあるエンジンです。これらのシステムは、インターネット上の膨大な量のテキストを用いて学習し、何十億もの例を読み取ることで、人間の言語のパターンを学習します。しかし、彼らを教えるために使用されるデータは、英語に大きく偏っています。英語がデジタル世界を支配しているため、これらのモデルは英語のエキスパートになりますが、デジタル上の表現がはるかに少ないエストニア語のような小さな言語には苦戦することがよくあります。この不均衡は、AIが英語で完璧なエッセイを書ける一方で、エストニア語で同じことを求められたときには、混乱した、あるいは不正確なテキストを生成する可能性があることを意味しています。研究者たちは現在、このギャップを修正するために、英語に偏った強力なモデルに、すでに持っているスキルを壊すことなく新しい言語を教えることが可能かどうかを問い、取り組んでいます。
エストニアの研究チームは、エストニア語に特化した大規模言語モデルを作成することで、この問いに答えるべく立ち上がりました。彼らは、英語のデータで集中的に訓練されたモデルと、すでに多くの言語に多少なりとも精通しているモデルという、2つの既存のモデルからスタートしました。研究者たちは新しいモデルを一から構築したわけではありません。代わりに、これらの既存のシステムを取り上げ、特定のデータの混合物を用いて、集中的な「再教育」を与えました。まず、モデルに文学、学術的な文章、ウェブコンテンツを含む大量のエストニア語のテキストをさらすことで、言語知識の基礎を築きました。モデルが推論や他のトピックを理解する方法を忘れないようにするために、この学習フェーズ中に、英語のテキスト、コード、および数学の問題を混ぜ合わせました。「継続的な事前学習(continued pretraining)」として知られるこのプロセスにより、モデルは一般的な知性を維持しながら、エストニア語を学ぶことができました。
この初期学習の後、研究者たちは、チャットボットやアシスタントにとって極めて重要なスキルである「指示に従う能力」を向上させるために、モデルを洗練させました。彼らは、実際の人間による会話と合成された例を組み合わせて、ユーザーのコマンドに対してエストニア語と英語の両方で応答する方法をモデルに教えました。彼らのプロセスの鍵となるステップには、「チャットベクター・マージング(chat vector merging)」と呼ばれる手法が含まれていました。モデルを、新しい言語を学んだものの、礼儀正しく話したり複雑なルールに従ったりする方法を忘れてしまった学生だと想像してみてください。研究者たちは、指示に従うための「知識」を、元の英語バージョンのモデルから取り出し、それを新しいエストニア語学習バージョンのモデルへと融合させました。これにより、最終的な成果物は、流暢なエストニア語を話しつつ、両方の言語で指示を明確に理解して従う能力を保持することができました。
この実験の結果は、驚くべきものであり、かつ重要なものでした。学習を開始する前は、すでに多言語対応していたモデルの方が、英語中心のモデルよりもエストニア語のタスクにおいて優れた性能を示していました。しかし、適応プロセスを経た後、状況は逆転しました。強力な英語の基礎を持っていたモデルの方が、エストニア語においてはるかに大きな改善を示し、最終的には多言語モデルを上回りました。このことは、特定の言語におけるモデルの出発点が、その後にその言語をどれほど上手く学習できるかを必ずしも予測するわけではないことを示唆しています。研究者たちは、適応されたモデルが、以前よりもはるかに優れた形でエストニア語の文法を理解し、翻訳を行い、論理パズルを解けることを発見しました。彼らはまた、人間がモデルとチャットして最適な回答に投票できる公開の場でも、これらのモデルをテストしました。新しいエストニア語モデルは上位にランクインし、より大規模で複雑なシステムとも成功裏に競い合いました。
この研究は、モデルがどのように学習するかについての重要な限界も明らかにしました。研究者たちは、一部の他の研究で行われている手法である、エストニア語の学習データを複数回繰り返すことがモデルの学習を助けるかどうかをテストしました。彼らは、このサイズのモデルにおいては、データを2回目を通すことは実質的な利益をもたらさず、単に計算資源の無駄になることを発見しました。1回の学習サイクルで十分でした。さらに、研究者たちは、モデルがエストニア語には非常に長けてようになった一方で、わずかなトレードオフがあることも発見しました。つまり、英語での指示に従う能力がわずかに低下したのです。しかし、チャットベクター・マージングの手法によって、この失われた英語の能力の大部分が回復され、一般的な能力を犠牲にすることなく、モデルを小さな言語向けに特化させることが可能であることが証明されました。
この取り組みは、しばしば見過ごされがちな言語における人工知能を向上させるための、明確な進むべき道を示しています。新しい言語のデータと既存の知識を注意深く混ぜ合わせ、異なるモデルの振る舞いを融合させるスマートな手法を用いることで、ゼロから始める必要なく、特定のコミュニティのための強力なツールを作成することができます。研究結果は、大規模言語モデルを適応させる最も効果的な方法は、すでにその言語を知っているモデルから始めることではなく、一般的な推論に強いモデルを取り上げ、バランスの取れたデータの食事を与えて新しい言語を教えることである可能性を示唆しています。結果として得られたモデルは、グローバルな知性の堅牢性を維持しながら、ネイティブレベルの高品質な体験をエストニア語の話し手たちに提供するために、他の人々が利用できるよう公開されています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。