← 最新の論文
🤖 machine learning

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

本論文は、直交部分空間ルーティング、曲率を考慮したスケーリング、および適応的なエキスパート活性化を通じてルーターおよびエキスパートのドリフトを軽減する、マルチモーダル継続的インストラクションチューニングのための安定化されたMixture-of-ExpertsフレームワークであるSAMEを提案し、新たな長シーケンス・ベンチマークにおいて最先端の性能を達成している。

原著者: Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

数学の問題を解くことには天才的なのに、詩を読まされると突然数え方を忘れてしまう学生を想像してみてください。これが、現代のマルチモーダル大規模言語モデル(MLLM)が直面している核心的な課題です。これらは、画像を見たりテキストを読んだりして、膨大なデータを学習することで世界の仕組みについて答える方法を学ぶ、強力なコンピュータです。これらは、「写真の中の猫を説明して」や「この物理の問題を解いて」といった指示に従うように訓練されています。しかし、現実の世界では、これらのシステムはすべてを一度に学ぶわけではありません。代わりに、数学の授業から歴史の授業へ、そして美術の授業へと進級する学生のように、新しい種類のタスクに次々と遭遇していくのです。問題は、これらのモデルが新しいスキルを学ぶにつれて、以前のスキルを忘れてしまうことがよくある点であり、科学者はこれを「破滅的忘却」と呼んでいます。モデルに有用であり続けてもらうためには、すでに知っていることを消去することなく、新しいことを教える方法を研究者が見つけ出す必要があります。

長い間、専門家たちは、モデルに専門化されたヘルパーのチームを与えるという「混合エキスパート(Mixture of Experts)」と呼ばれる構造によって、この問題を解決しようとしてきました。モデルを、異なる種類の仕事を担当する様々な「作業員(エキスパート)」がいる大きなオフィスだと考えてください。質問が入ってくると、「ルーター」と呼ばれるマネージャーが、どの作業員が回答に最も適しているかを判断します。質問がチャートに関するものであれば、ルーターはそれをデータアナリストに送り、詩に関するものであれば、ライターに送ります。このシステムは、タスクが安定している場合にはうまく機能しますが、モデルが新しいタスクの長いシーケンスを学習しなければならない場合、研究者は欠陥があることを発見しました。モデルが新しいスキルを学習するにつれて、マネージャーはミスをし始め、古いタイプの質問を間違った作業員に送ってしまうようになりました。同時に、作業員自身も変化し始め、初期のタスクのために培った特定のスキルを失っていきました。この二重の失敗により、モデルは質問を間違った人に送るだけでなく、その人が本来行うべき仕事のやり方さえも忘れてしまったのです。

研究チームは、これらの問題を解決するために「SAME」と呼ばれる新しい手法を提案しました。彼らは、マネージャーの混乱と作業員の記憶喪失は、それぞれ異なる解決策を必要とする別々の問題であることを見出しました。マネージャーが混乱するのを防ぐために、研究者たちはモデルが世界をどのように捉えているかを注意深く追跡するシステムを設計しました。新しいレッスンごとにマネージャーが考えを完全に変えてしまうのではなく、その焦点の移り変わりを制限するようにしたのです。マネージャーが質問を分類する新しい方法を学ぶことは許可しつつ、以前のタスクに不可欠であった古い分類方法を保護しました。これにより、例えば医療画像に関する質問が、地図を読んだり化学の問題を解いたりすることを学んだ後でも、引き続き医療専門家に送られるようになります。

作業員が仕事を忘れるのを防ぐために、研究者たちは、作業員の新しい学習がどれほど古いスキルを損なう可能性があるかを測定する方法を導入しました。彼らは作業員が過去に見てきたデータの種類を確認し、その履歴を利用して、古いスキルを損なうような変化を抑制しました。これは、作業員に対して「新しいスキルを学んでもいいが、以前の機械を修理する方法を消し去らないような方法で学びなさい」と伝えるようなものです。このようにすることで、モデルは新しいタスクに適応しながらも、以前のタスクから得た特定の能力を保持することができます。さらに、研究者たちは、すべての作業員がすべてのレッスンで活動する必要はないことも発見しました。彼らは、現在のタスクに必要のない作業員を一時的に停止させるルールを作成し、これによりエネルギーを節約し、無関係な情報によって誤って変更されるのを防いでいます。

チームはこの新しいアプローチを、現実世界の乱雑で多様な現実を模倣した、彼らが作成した新しい一連のタスクを含む、難易度の高いベンチマークでテストしました。この新しいテストには、医療文書の読解から、科学的なチャートの分析、複雑な道路シーンの理解、化学式に至るまで、10種類の異なるタスクが含まれています。結果として、彼らの手法であるSAMEは、従来の手法よりも古いタスクを記憶することにおいて著しく優れていることが示されました。8つのタスクが続く特定の長いシーケンスを用いたテストでは、新しい手法は、他のアプローチと比較して、最初のタスクにおける精度をはるかに高く維持しました。また、必要な作業員のみを更新するため、トレーニングに必要な時間やコンピュータメモリも少なく、より効率的であることも証明されました。

おそらく最も重要なことは、研究者が、モデルが正しい答えは出しているものの、形式を誤ってしまうという、微妙だがよくある失敗を防げることを観察した点です。例えば、タスクが回答に大文字を要求する場合、新しいタスクを学んだ後に、モデルが小文字で回答を始めてしまうことがあります。新しいシステムはモデルの一貫性を保ち、次のタスクのスタイルに惑わされることなく、各タスクの特定のフォーマット規則に従うことを保証しました。意思決定のプロセスと回答者の記憶の両方を安定させることで、この研究は、人工知能がすでに持っている基礎を失うことなく、継続的に学習し、その能力を拡張するためのより信頼できる方法を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →