← 最新の論文
💬 NLP

From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference

ELMODは、特殊なデータの前処理と品質フィルタリングを通じて、限られた計算予算の下で70億パラメータのモデルに匹敵する性能を実現する、効率的なオンデバイス推論向けに設計された、コンパクトな27億パラメータのドイツ語言語モデルです。

原著者: Darina Gold, Alexander Schwirjow, Viktor Haag, Viktor Hangya, Joel Schlotthauer, Fabian Küch, Luzian Hahn

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Darina Gold, Alexander Schwirjow, Viktor Haag, Viktor Hangya, Joel Schlotthauer, Fabian Küch, Luzian Hahn

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界を、巨大なロボットたちがあらゆる言語を話せるようになるために学習しようとしている、大規模で賑やかな図書館だと想像してみてください。長い間、これらのロボットは、インターネットを命綱のように利用して、遠く離れた巨大で冷却されたデータセンターの中に住む必要がありました。彼らは、強力な電力網に接続されていなければ思考できない、優秀な学者のような存在でした。しかし、もしあなたが、ポケットの中、つまりスマートフォンの中に住み、電波のない洞窟の中にいても働いてくれる学者を求めたらどうでしょうか?これが「オンデバイス」AIの夢です。これを実現するために、科学者たちは、知能を失うことなく、小さなスペースに収まるように、これらの巨大な脳を縮小しようとしています。大きな課題は、非常に特定された高品質なレッスンを使って驚異的に教え込まない限り、小さな脳は通常、より愚かなロボットになってしまうということです。

ここで、ドイツ語に特化した、小さくて超スマートな言語モデルを構築することに決めた、フラウンホーファー研究所の研究者たちによる新しいプロジェクト「ELMOD」が登場します。言語モデルを、何十億冊もの本を読んで学習する学生だと考えてください。通常、学生を天才にするには、彼らに本の山を投げつけます。しかし、ELMODの創設者たちは、どの本を読ませるかに細心の注意を払うことで、同じくらい賢い学生を作れるのではないかと考えました。彼らは単にインターネットからランダムにページを拾い集めたのではありません。彼らは厳格な司書のように振る舞い、ノイズを取り除き、文法を修正し、退屈な部分をより教育的なものへと書き換えさえしました。彼らの目標は、モバイルデバイス上で効率的に動作する27億パラメータ(脳のサイズを示す尺度)のモデルを作成し、スマートなドイツ語の助手を持つためにスーパーコンピューターは必要ないということを証明することでした。

ポケットサイズの天才を作るレシピ

ELMODの物語は、シンプルな問いから始まります。「スマートフォンに収まるほど小さく、かつ、はるかに大きなモデルとも競合できるほどスマートなドイツ語AIを作れるだろうか?」研究者たちは、インターネット上のテキストという混沌としたジャンクヤードのような、膨大なデータの山からスタートしました。彼らには4.83兆語のデータがありましたが、そのほとんどはゴミ――広告、壊れたリンク、そして繰り返される無意味な内容――でした。

ステップ1:大掃除
まず、データを掃除しなければなりませんでした。グルメな料理を作ろうとしているのに、材料の中に石やプラスチックの包装材が混ざっている状況を想像してください。チームは、「石」を取り除くための一連のフィルターを使用しました。数字だけのページを捨て、ドイツ語を求めているところに英語が主体のテキストを排除し、さらに不適切で失礼な言葉も取り除きました。また、「重複排除」と呼ばれる巧妙なテクニックも使用しました。これは、誰かが料理本の中に同じレシピカードを千回も貼り付けているのを見つけて削除するようなものです。このプロセスは極めて重要でした。なぜなら、同じ退屈な内容を何度も読み返すことに時間とエネルギーを浪費するのを防いでくれたからです。

ステップ2:品質チェック
ゴミを取り除いた後、彼らは新たな問題に直面しました。残った本がすべて学習に適しているわけではないということです。あるものは単なるニュースの見出しであり、あるものは深い科学論文でした。研究者たちは、AIに「最高の」本から学んでほしいと考えていました。彼らは、テキストがどれほど教育的であるかに基づいて、0から5のスケールで採点するスマートなAI判定器(より大きなモデル)を使用しました。その結果、最高品質の本(スコア2以上)で学習させるとモデルはより賢くなるものの、さらに高いスコア(スコア3以上)にしても追加のブーストは得られないことが分かりました。しかし、ここが巧妙な点です。彼らは、たとえ「中程度」のスコア(約1.5から2)であっても、アップグレードが可能であることに気づいたのです。

ステップ3:書き換えの魔法
ここで魔法が起こりました。チームは「中程度の品質」のテキストを取り上げ、別のAIにそれらを書き換えさせました。彼らはAIにこう指示しました。「この退屈なブログ記事を取って、専門家向けの教科書の章、あるいは子供向けの楽しい物語、またはプロフェッショナルなブログのように書き換えなさい」。こうすることで、彼らは平均的なデータを高品質なレッスンへと変えたのです。それは、物語の下書きを取り、輝くまで磨き上げるような作業でした。彼らはこの方法で約730億の新しいトークン(テキストの塊)を生成し、新しい本を探すことなく、実質的に図書館をアップグレードしたのです。

ステップ4:トレーニング
洗浄・アップグレードされたライブラリの準備が整ったところで、彼らはモデルのトレーニングを開始しました。彼らには厳しい予算がありました。AIトレーニングを動かすエンジンである強力なH100 GPUを、55,000時間しか使用できませんでした。これを最大限に活用するため、彼らはモデルがどのように学ぶかを実験しました。数値の扱い方や、ドイツ語、英語、コードの異なる混合比率を試しました。その結果、50%の英語、40%のドイツ語、10%のコードという特定の混合比が最適であることを見出しました。また、学習プロセスの最後で学習速度を落とす手法(「アニーリング」と呼ばれる技術)が、学生が大きなテストの前に落ち着いてノートを復習するように、モデルが知識をより定着させるのに役立つことも発見しました。

結果:小さくとも強力

完成したとき、彼らはELMOD-2.7B、すなわち27億パラメータを持つモデルを手に入れました。これを比較対象として考えると、この分野を支配している巨大なモデルと比較して非常に小さいものです。しかし、ドイツ語のベンチマークでテストしたところ、結果は驚くべきものでした。

ELMODは単に優れた成績を収めただけでなく、そのサイズクラス(30億パラメータ未満)において最強のパフォーマンスを示し、ドイツ語のベンチマークにおいては、その3倍近い大きさ(70億パラメータ)のモデルとも肩を並べました。それは、巨大なトラックと同じ速さで走ることができるコンパクトなスポーツカーのようなものでした。研究者たちは、トリッキーな論理問題への回答から複雑な物語の理解まで、さまざまなタスクでテストを行い、データの量が2倍のモデルに対しても十分に渡り合えることを証明しました。

彼らはまた、モデルが安全で実生活に対応していることも確認しました。トレーニングデータからメールアドレスやクレジットカード番号などの個人情報を除去し、AIが誤ってプライベートな詳細を記憶しないようにしました。最後に、彼らはこれが実際にスマートフォンで動作することを証明しました。彼らは、異なるAndroidスマートフォンやMacBook Pro上でモデルを実行するデモアプリを作成し、近くにスーパーコンピューターがなくても、人間のユーザーにとって有用な速度でテキストを処理できることを示しました。

なぜこれが重要なのか

この論文は、優れたAIを作るために、無限の資金を持つ巨大なテック企業である必要はないということを示しています。データの質について賢明であること(ノイズを排除し、平均的なものをアップグレードし、モデルを教える方法に注意を払うこと)によって、ポケットに収まる強力なツールを作ることができるのです。ELMODは、ドイツ語において、小さく効率的なモデルが、大きくて高価なモデルと同じくらい有能であり得ることを証明しており、いつでもどこでも機能する、プライバシーに配慮したオフラインAIアシスタントへの扉を開いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →