← 最新の論文
💬 NLP

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

本論文は、局所的に正規化されたKLダイバージェンスを通じて、非ターゲットトークンにおける事前学習済みモデル固有のマルチモーダルなエントロピー構造を保持する教師あり微調整手法であるLP-SFTを提案し、それによって既存の能力やサンプリングの多様性の低下を抑制しつつ、ダウンストリームの性能を向上させる。

原著者: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に優秀で博識なロボットに、指示に従う方法を教えていると想像してください。このロボットはすでにインターネット上のほぼすべての内容を読み終えており、言語のリズム、数学の論理、そしてコードの構造を学習しています。この初期学習フェーズは「事前学習(pretraining)」と呼ばれます。次に、あなたはロボットに、数学の問題を解いたりコンピュータコードを書いたりといった、特定の仕事(タスク)を教えようとしています。あなたは正解の例をロボットに見せ、ロボットはその例に合わせて自分の脳を調整します。このプロセスは「教師あり微調整(Supervised Fine-Tuning: SFT)」と呼ばれます。

しかし、そこには落とし穴があります。ロボットに新しい仕事を完璧に習得させようとすると、時として、優れた一般的な会話能力を忘れてしまうことがあるのです。ロボットは、あなたが示した唯一の「正解」に執着しすぎるあまり、文章が終わり得る他の興味深く妥当な方法をすべて忘れてしまいます。それはまるで、ある数学の問題に対して一つの特定の答えを完璧に暗記したために、少し異なるバージョンの問題が解けなくなってしまった学生や、物語の始め方をたった一つの方法しか知らない作家のようなものです。この分野における大きな疑問は、「どうすれば、ロボットが持つ元の豊かで多様な知識を失わせることなく、新しい仕事を教えることができるのか?」ということです。

これこそが、論文「LP-SFT」が取り組んでいる課題です。著者であるトップ大学の研究チームは、これらのロボットを教える標準的な方法(「クロスエントロピー」と呼ばれるもの)が、少し強引すぎることに気づきました。その方法はロボットに対し、「私が今示しているこの一つの単語だけを見ろ。他のことはすべて無視しろ」と命じているのです。問題は、ロボットの元の脳には、実は「正解となり得る」多くの単語のマップが備わっているということなのです。ロボットにただ一つのターゲットとなる単語だけに集中させることで、私たちは図らずも、他のあらゆる可能性という名のマップを消し去ってしまい、創造性の喪失や、「破滅的忘却(catastrophic forgetting)」と呼ばれる、以前持っていたスキルを忘れてしまう現象を引き起こしてしまうのです。

研究者たちは、これらのロボットがどのように思考しているかについて、非常に興味深い発見をしました。彼らは、ロボットが単に一つの単語を選んでいるのではなく、しばしば同等に優れたいくつかの選択肢の間で揺れ動いており、「マルチモーダルなエントロピー構造」を作り出していることを見出したのです。これは、道の分かれ道を想像してみてください。時として、ロボットはすべて等しく妥当な2つまたは3つの経路を見ていることがあります。標準的な学習法は、ロボットにただ一つの経路を選ばせ、たとえ他の経路が完全に合理的であったとしても、それらを焼き払ってしまうのです。

これを解決するために、チームはLP-SFT(Local-Preserving Supervised Fine-Tuning:局所保存型教師あり微調整)という新しい手法を提案しました。LP-SFTは、ロボットに向かって「この単語を選べ!」と叫ぶ代わりに、「この単語を選びなさい。でも、他にもかなり良かった他の3つか4つの単語のことも忘れないでね」と伝えます。

その仕組みを、簡単な比喩を使って説明しましょう。あなたが犬に特定のボールを取ってくる訓練をしていると想像してください。標準的な方法では、犬が「まさにそのボール」を持ってきたときだけ報酬を与え、他のものはすべて無視します。すると、やがて犬は他の玩具を探すこと自体をやめてしまうかもしれません。LP-SFTは、「赤いボール(ターゲット)を持ってきて。でも、そのついでに、青いボールや緑のボールも楽しかったということも覚えておいてね」と言うようなものです。この手法は、ロボットが選び得た上位10個の単語による小さな「セーフゾーン」を作り出します。まず、教えている単語の一つを取り除き(混乱を防ぐため)、残りの9つの単語の相対的な人気度(出現確率)が、以前の状態と同じまま維持されるように、ロボットを優しく促すのです。

このアプローチの結果は、非常に有望です。研究者が異なるモデル(QwenやLlamaなど)やタスク(数学、コーディング、一般的なチャット)でLP-SFTをテストしたところ、LP-SFTは従来の方法よりも優れた成果を上げることがわかりました。LP-SFTで訓練されたロボットは、教えられた特定のタスク(数学やコーディングのテストでの高スコア)において優れた能力を発揮しただけでなく、多様性や創造性を維持することにも成功しました。彼らは、他の方法と比較して、一般的な知識を忘れることが少なかったのです。実際、この手法は、単一の正解を得ることと、多様な解決策を保持し続けることの間の、最高のバランスを実現しました。

この論文は、ロボットの元の「可能性のマップ」を尊重することで、その脳を壊すことなく新しいスキルを教えることができると示唆しています。これは、機械に完璧さを教えるためには、時には少しの「不確実性」を残させておく必要があるということを思い出させてくれます。研究者たちは、この「局所的な保存(local preservation)」が、ロボットが退屈で一本調子な思考へと陥るのを防ぎ、スマートで柔軟で、次に来るあらゆる事態に備えられた状態を維持するのに役立つことを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →