← 最新の論文
💬 NLP

Index SLM Technical Report

Bilibiliは、2.8兆トークンで学習された1.9Bパラメータの基盤モデル、特殊なWarmup-Stable-Decayスケジュールの採用、およびNorm-Head層を特徴とするオープンな小型言語モデルシリーズ「Index-1.9B」を発表し、これは標準的なベンチマークにおいて競争力のある性能を達成しており、純粋な事前学習用、チャットアライメント用、およびキャラクターベースのロールプレイング用のバリアントが含まれています。

原著者: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ポケットに入るほど小さくて超スマートなロボットの脳を作っているところだと想像してみてください。ほとんどの人は、脳は大きければ大きいほど良いと考えていますが、Bilibiliのチームは、そのクラスを遥かに超える実力を発揮できる19億パラメータのロボット(仮にIndex-1.9Bと呼びましょう)を作れるかどうかを確かめることにしました。彼らは単に巨大なモデルを縮小したのではなく、主に中国語と英語の2.8兆語の読書材料を使用して、エンジンをゼロから作り直したのです。

これは、彼らがどのようにそれを行ったのか、何を発見したのか、そしてその過程で見つけた奇妙な驚きについての物語です。

秘伝のソース:彼らが脳を訓練する方法

1. 読書リスト(データ)
トレーニングデータを、ロボットの図書室だと考えてください。彼らはただインターネットを丸ごと放り込んだわけではありません。散らかった屋根裏部屋を整理する司書のように、データを綺麗にしました。重複を削除し(間違えて156,000回もコピーされていた月名のメニューさえも見つけ出しました!)、バイアスを取り除きました。

  • 配合: 図書室は主に本やウェブページで構成されていますが、6%のコードと、学術論文や百科事典のような高品質なものを10%含めるようにしました。
  • 驚き: 最終段階のトレーニング中に「指示書」(例:「詩を書いて」「この数学の問題を解いて」)を読むことで、ロボットがテストにおいて非常に賢くなることがわかりました。実際、この指示データの追加だけで、テストスコアは約7ポイント上昇しました。彼らは、この追加の読書による効果を明確にするために、これを含めたバージョンと含まないバージョンの2つのモデルをリリースしました。

2. 脳の構造(アーキテクチャ)
通常、決まった「脳のパワー」(パラメータ)がある場合、脳を「広く」するか(層の中のニューロンを多くする)、あるいは「深く」するか(多くの層を積み重ねる)を選択できます。

  • 発見: チームは「深く細い」デザイン(36層)と、「広く浅い」デザイン(9層)を比較しました。結果は、深い方が常に勝利しました。これは、幅の広い平屋の倉庫を作るよりも、超高層ビルを建てる方が優れたというようなものです。このサイズにおいては、横に広がるよりも上に積み上げる方が効果的でした。
  • スタビライザー(安定装置): 彼らはまた、特別な「Norm-Head」レイヤーを追加しました。ロボットが珍しい単語を予測しようとする際、脳が少し目まいを起こす様子を想像してください。この新しいレイヤーはスタビライザーとして機能し、ロボットが超高速で学習しているときでも、脳を穏やかに保ちます。

3. 学習スケジュール(「WSD」メソッド)
ほとんどのロボットは、一定のペースで学習するか、徐々に速度を落とします。Index-1.9Bは、「ウォームアップ–安定–減衰(Warmup–Stable–Decay)」スケジュールを使用しています。

  • 戦略: まず、ウォームアップします。次に、図書室全体を読みながら、一定の高速で学習します(「安定」フェーズ)。最後に、「減衰」フェーズでは、速度を落としますが、厳選された最高の書籍(学術論文や百科事典)だけを読むように切り替えます。
  • 結果: この「高品質なデータを読みながら速度を落とす」という組み合わせが、最大のパフォーマンス向上をもたらしました。

奇妙な驚き:「サージ(急上昇)」

ここからは、著者たちですらまだ完全には説明できていない部分です。
一定の速度で学習していた「安定」フェーズの最中、奇妙なことが起こりました。1.0兆から1.2兆トークンの読書が進んだところで、ロボットのテストスコアが突然跳ね上がったのです。学習速度もデータの種類も変えていないのに、平均的なレベルから、多くの7B(70億)モデルを上回るレベルへと突如として到達しました。

  • 確信: 論文では、これは謎であると認めています。彼らは、高品質なデータと高速な学習率が、その瞬間に「カチッ」と噛み合ったのではないかと推測していますが、正確な理由は証明できていません。それはまるで、先生が授業計画を変えていないにもかかわらず、特定の章を読んだ直後に生徒が突然すべてを理解したような状態です。

ロボットの異なるバージョン

チームは一つのモデルで止まりませんでした。彼らは一族(ファミリー)をリリースしました。

  • Index-1.9B-Base: あらゆることに対応できる、生のスマートな脳。
  • Index-1.9B-Pure: 指示書を一度も読んでいないコントロール版。これにより、メインモデルの「賢さ」が、あの追加の読書によるものであることが証明されます。
  • Index-1.9B-Chat: 人間に優しく話すように教え込まれたBaseモデル。「直接選好最適化(DPO)」と呼ばれる手法を用いています。これは、単に答えを出すだけでなく、良い会話と悪い会話の例を見せることで、「上手く」答える方法を教えるようなものです。
  • Index-1.9B-Character: ロールプレイができるバージョン。特定のキャラクターとの過去の会話を参照する「リトリーバル(検索)」のトリックを使用しており、キャラクター設定を維持します。これは非常に優秀で、ロールプレイングのテストにおいて多くの7Bから14Bモデルを上回る成績を収めています。

できること(と、できないこと)

勝利のポイント:

  • 知能: 数学、推論、一般的な知識に関する標準的なテストにおいて、Index-1.9Bは平均64.92を記録しました。これは、数倍の大きさを持つモデルとも競争でき、時にはそれらを凌駕します。具体的には、総合平均スコアにおいてLlama-2-13Bを上回っていますが、すべてのベンチマークですべての大型モデルに勝るわけではありません。
  • 言語: 中国語と英語に優れています。さらに、彼らが構築したトークナイザーは、比較されたトークナイザーの中で、日本語と韓国語に対して最も強力な圧縮率を達成しており、これらの言語において効率的です。
  • ロールプレイ: 一貫性の高いキャラクター演技が可能で、主要なリーダーボードで総合9位に入り、多くの7Bから14Bモデルを打ち負かしています。

限界:

  • 数学とコード: 悪くはありませんが、著者たちはこれらが依然として改善が必要な領域であることを認めています。まだ数学の天才ではありません。
  • 事実関係: サイズが小さいため、事実を捏造したり、複雑な指示を誤解したりすることがあります。
  • 謎: トレーニング中のあの突然のパフォーマンスの跳ね上がり? 彼らはまだその正確な理由を知りません。

結論

この論文は、スマートであるために必ずしも巨大で高価な脳は必要ないということを示しています。小さなロボットに適切な配合の高品質な本を与え、広くではなく深く読ませ、脳に特別なスタビライザーを与えれば、巨人に匹敵することができるのです。彼らはまた、「指示データ(命令に従う方法を学ぶこと)」がテストスコアにおける強力な「チートコード」であることを証明し、誰も隠し事をできないようにその証拠を公開しました。

これは、大きな個性と、いくつかの未解決の疑問、そして多くのポテンシャルを秘めた小さなモデルです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →