← 最新の論文
💬 NLP

FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

本論文は、事前学習コーパスから数十億規模の合成指示応答ペアを生成する手法であるFineInstructionsを導入しており、これにより大規模言語モデルを指示チューニングの目的のみに基づいてゼロから事前学習することが可能となり、標準的な事前学習アプローチと比較して自由形式の応答ベンチマークにおいて優れた性能を実現している。

原著者: Ajay Patel, Colin Raffel, Chris Callison-Burch

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Ajay Patel, Colin Raffel, Chris Callison-Burch

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに人間とチャットする方法を教えようとしていると想像してみてください。通常、この方法は、ロボットに膨大な本のライブラリを与えて、「すべてを読んで、次の単語を推測しろ」と言うようなものです。これは**事前学習(pre-training)**と呼ばれます。これは、ロボットが事実、歴史、そして文章の仕組みを学ぶ方法です。しかし、ここには落とし穴があります。何百万冊もの本を読んだ後、ロボットは文章を完成させることには長けていますが、実際に質問に答えたり、指示に従ったりすることに関しては非常に下手なのです。それは、百科事典を丸暗記したものの、「近くでおいしいピザ屋はどこ?」と聞かれるとフリーズしてしまう学生のようなものです。

これを解決するために、私たちは通常、ロボットに特別で小さな「指示カード(instruction cards)」、つまり質問と完璧な回答のセットを与え、「このスタイルを学べ!」と言います。しかし、問題は、こうしたカードが十分に足りないことです。数千、あるいは数百万個程度しかありません。これは、たった一冊の教科書だけで、学校全体の生徒を教えようとするようなものです。

大きなアイデア:「レシピ本」革命
COLM 2026で発表されたこの論文の著者たちは、突飛なアイデアを思いつきました。「なぜ、本全体のライブラリを指示カードに変えてしまわないだろうか?」

彼らはFineInstructionsと呼ばれる、一種のマシンを構築しました。これは魔法のキッチンだと考えてください。

  1. 材料: 彼らは、インターネット上の膨大な実在の文書(約3000億語のテキスト)を集めました。
  2. レシピカード: 彼らは、実際の人間がオンラインで投げかけた約1800万件のリアルな質問やプロンプト(例:「メッシとロナウド、どちらがより影響力があるか?」)からスタートしました。彼らは、特定の名前を空白に置き換えることで、これらを「レシピカード(テンプレート)」へと変えました。例えば、「<空白> と <空白> の間で、どちらがより <空白> か?」といった具合です。
  3. 調理: このマシンは、ドキュメント(例えばスマートウォッチに関するブログ記事)を見て、「このブログはこのレシピカードのどれかに適合するか?」と問いかけます。もしブログがApple WatchとGarminについて書いてあれば、「どちらがより頑丈か?」というレシピに一致します。
  4. 料理: その後、マシンはそのブログ記事を使って、空白を埋めて完璧な質問と回答のペアを作成します。まるで、ブログ記事が突然、Q&Aセッションに変わったかのようです。

結果:10億の新しいレッスン
これを行うことで、彼らはFineInstructionsと呼ばれる、10億件以上の合成された指示・回答ペアを含むデータセットを作成しました。これは巨大です!図書館全体を10億枚のフラッシュカードに変えるようなものです。

何を見出したか(その証拠)
チームは、これらの新しい指示カードのみを使用して、ゼロから小さなロボットの脳(18億パラメータのモデル)を訓練しました。彼らは従来の「次の単語を推測する」という方法を全く使いませんでした。

  • スコア: 人間の実際の質問にどれだけうまく答えるかを測定するベンチマーク(MixEvalMT-Bench-101AlpacaEvalなど)でテストした際、FineInstructionsで訓練されたロボットは、他の競合を圧倒しました。
  • 比較: 彼らは、本を質問に変えるための他の洗練された方法(IPTNemotron-CCの手法など)と比較しました。FineInstructionsのロボットは、大幅な差をつけて勝利しました。例えば、MixEvalベンチマークにおいて、Nemotron-CCと比較して約39%、標準的な訓練と比較して**69%**性能を向上させました。
  • 勝率: 他のモデルと直接対決させたチャット形式のテストでは、FineInstructionsのモデルは約**76%**の割合でNemotron-CCのベースラインに勝利しました。

明確に「そうではない」と述べていること
この論文が「主張していない」ことを知っておくことは重要です。

  • 「パープレキシティ(Perplexity)」についてではない: 著者らは、文章の次の単語を予測する能力(標準的なテストであるパープレキシティ)を測定すると、彼らの手法は従来の方法よりもむしろ悪くなる可能性があることを認めています。彼らはそのテストには関心がありません。彼らが関心があるのは、ロボットが人間にどれほど有用であるかということです。
  • 「魔法」でも「蒸留(Distillation)」でもない: 以前の手法の中には、超スマートなロボットを使ってすべての質問を書かせようとするものがありました。著者らは、それでは新しいロボットが新しいことを学ぶのではなく、単に古いロボットのスタイルをコピーしてしまうだけだと主張しています。彼らの手法は、実際の人間による質問を使用し、回答を実在のドキュメントに基づかせているため、異なっています。
  • 「解決済みの問題」ではない: この論文は、このアプローチが大きな前進であることを示唆していますが、複雑なテンプレートを完全に一致させることは依然として難しいことも指摘しています。また、現在の設定では、手動のチューニング(特定の適合スコアである0.865を選択するなど)を使用しており、それが絶対的な最適設定ではない可能性もあることも認めています。

結論
この論文は、ロボットへのデータの与え方、つまり生のテキストを10億組の現実的なQ&Aペアへと再構成することで、たとえ伝統的な「次の単語を推測する」訓練をスキップしたとしても、指示に従い人間に助けを与える能力を大幅に向上させることができると示唆しています。これは、ロボットを「読者」として教えることから、「ヘルパー(助っ人)」として教えることへの転換です。

著者らは、すべてのロボットが学習するための全く同じ量のテキストを受け取りながら、それを異なる形式で提供するという制御された実験を行ったため、その結果に自信を持っています。データは、「指示のみ」のフォーマットが、現実世界のタスクにおいて、より賢く、より有用なロボットを生み出すことを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →