← 最新の論文
🤖 machine learning

LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment

LARAは、凍結されたモデルの残差ストリームに低ランク補正を直接注入することで、パラメータ適合性能、スケーリング係数によるスムーズな推論時制御、および単一のデバイス上での複数の異なる振る舞いの同時ホスティングを可能にする軽量な適応手法である。

原著者: Pascal Ekin, Hyosun Choi, Wei Jie

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Pascal Ekin, Hyosun Choi, Wei Jie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、インターネット上のほぼすべての情報を読み込んだ、超スマートなロボットを持っています。それは天才ですが、少し頑固でもあります。一度学習した教訓を書き換えることは容易ではなく、新しい技を教えようとすると、脳が壊れてしまうか、自分自身の全く新しいバージョンを保存するために膨大なメモリが必要になります。これが大規模言語モデル(LLM)の世界です。このロボットに、Pythonコードを書いたり医学的な助言を与えたりといった特定の仕事を手伝わせるために、科学者たちは通常、「ファインチューニング」と呼ばれる手法を使います。これは、ロボットに新しい教科書を与えるようなものです。最も一般的な古い手法であるLoRAは、ロボットの脳を分解し、内部の指示マニュアルの数ページを書き換え、それを再び接着するというものです。これはうまく機能しますが、非常に「重い」作業です。もしロボットに、コーダーであり、医師であり、詩人であってほしいなら、あなたは3つの異なる重いバージョンの脳を持ち歩かなければならず、それはスマートフォンのような小さなデバイスでは不可能です。

そこで登場するのが、ロイヤル・ホロウェイ大学とウエスト・ロンドン大学の研究者による新しいアイデア、LARA(Lightweight Additive Residual Adaptation:軽量加算残留適応)です。L-A-R-Aは、ロボットの内部マニュアルを書き換える代わりに、ロボットの思考のストリーム(流れ)の直前に、小さくて取り外し可能な「メモ」を付け加えるという方法をとります。このメモは非常に小さく軽量であるため、同じロボットの中に、さまざまな「人格」(コーディング用、数学用、親切な性格用など)のライブラリを丸ごと持たせることができます。そして、ロボットは、脳全体をロードし直すことなく、言葉を一つひとつ紡ぐごとに、瞬時にこれらの中の人格を切り替えることができます。この論文は、この「メモを取る」手法が、重い「書き換え」手法と同じくらいうまく機能することを示しています。しかも、それにはスーパーパワーがあります。それは、新しい振る舞いの「音量」を上げたり下げたりできることです。これにより、多くの振る舞いを極めて小さなスペースに詰め込むことができ、多才なAIをあなたのデバイス上で直接動かすことが可能になります。

問題点:重い脳

巨大で凍りついた天才の像を想像してみてください。それは完璧ですが、変化することができません。もしその像にフランス語を話させたいと思っても、単に囁くだけでは不十分です。石の中に新しい筋肉を刻み込まなければなりません。それが、ほとんどのAI適応が行っていることです。それは、像を削ろうとする試みです。普及している手法であるLoRAは、像の筋肉の上に薄い粘土の層を重ねるようなものです。それは機能しますが、もし像にフランス語、スペイン語、ドイツ語を話させたいなら、3つの異なる像を用意するか、あるいは入れ替えながら使うための3つの異なる粘土の層が必要になります。これは遅く、多くのスペースを消費します。

解決策:付箋

LARAの開発者たちは、異なる問いを立てました。「もし、像には一切触れないとしたらどうだろうか?」と。彫刻したり粘土を足したりする代わりに、彼らはロボットが何かに手を伸ばすたびに、その手に小さな魔法の付箋を貼ることにしたのです。

AIの世界では、この「手」は**残留ストリーム(residual stream)**と呼ばれます。それは、モデルのレイヤーを通過する情報の流れであり、ロボットの思考を運ぶ川のようなものです。LARAは川底(凍結された重み)を変えることはしません。ただ、小さな低ランクのスポンジを川に浸し、わずかな「修正」を絞り出し、それを水に戻すだけです。

  • スポンジ: これは、訓練可能なパラメータがわずか239万個しかない小さなモジュールです。
  • 川: メインモデル(15億パラメータのモデル)は、完全に凍結され、手を触れられることはありません。

メインモデルには決して触れないため、「ベース」となるロボットは常にそこにあり、準備ができています。スポンジは、思考が流れる際に、ほんの少しの風味を加えるだけなのです。

魔法のトリック

この論文は、このアプローチについて3つの素晴らしい発見を報告しています。

1. 重い手法と同等であること
研究者たちは、コード作成タスクと「好みの学習(ロボットにより親切で失礼にならないよう教える)」タスクでLARAをテストしました。彼らは、全く同じ数の訓練可能なパラメータを使用して、重い粘土の手法(LoRA)と比較しました。結果はどうだったでしょうか? LARAはLoRAに匹つきました。 元の脳には一切触れずに、コードを書いたり、好みに従ったりすることを、LoRAと同じくらい上手く学習したのです。これは、付箋が、マニュアルを書き換えることと同じくらい効果的であったことを意味します。

2. 音量つまみ
ここからがLARAの遊び心のある部分です。「修正」は単なる加算的なメモであるため、ロボットが話す瞬間に、**γ\gamma(ガンマ)**と呼ばれるダイヤルを回すことができます。

  • γ=0\gamma = 0 に設定すると、ロボットはメモを無視し、凍結されたベースモデルと全く同じように振る舞います。
  • γ=1\gamma = 1 に設定すると、メモをフル活用します。
  • γ=0.5\gamma = 0.5 に設定すると、半分ずつになります。

論文では、このつまみを操作するだけで、「退屈なベースモデル」と「専門的なコーダー」の間をスムーズに行き来できることが示されています。一度貼り付けてしまう重い粘土の手法(LoRA)では、このようなことはできません。あれは永続的な変化だからです。LARAを使えば、「ねえロボット、コーダーとして70%、詩人として30%の割合で振る舞って」と、音量を調整するだけで指示できるのです。

3. 人格のライブラリ
これが最も重要な点です。ベースが凍結されており、メモが極めて小さいため、同じ15億パラメータのモデル上に、7つの異なる振る舞いを同時に共存させることができます。

  • 研究者たちは、6つの微調整された振る舞い(コード、一般的なチャット、数学、医療、2つ目のコードセット、要約)と、1つの「好み」の振る舞いを、一つの凍結されたモデルに入れました。
  • これら7つすべての追加の重量は、合計でわずか33 MBでした。
  • もし古い方法を使っていたら、モデルの完全なコピーが7つ必要になり、21.6 GBもの容量を消費していたでしょう。

7つの異なる人格を、たった一つのMP3ファイルのサイズに収めることを想像してみてください。モデルは、小さな「ルーター(交通整理員)」を使用して、ロボットが次に言おうとしている単語ごとに、どの人格を借りるべきかを判断します。文の内容が数学に関するものであれば、数学のメモを掴みます。コーディングに関するものであれば、コードのメモを掴みます。文が曖昧な場合は、それらを混ぜ合わせることさえ可能です。

注意点(と未来)

この論文は、これがまだあらゆることに対する魔法の杖ではないことを慎重に述べています。

  • 「コード」テスト: LARAがLoRAと同等に機能するという証明は、主にコードのデータセットに対して行われました。著者らは、おそらく他のトピックでも機能するだろうと考えていますが、あらゆる可能なトピックについて完全にテストしたわけではありません。
  • 「増幅」の限界: 音量つまみ(γ\gamma)を高く設定しすぎると(例えば3に設定するなど)、特に多くのメモが積み重なっている場合、ロボットは言葉に詰まったり間違いを犯したりし始めます。単一のメモは安定していますが、6つのメモを積み重ねて音量を最大にすると、川が氾濫してしまいます。
  • ルーターの混乱: 二つの振る舞いが非常に似ている場合(例えば、2つの異なるコードデータセット)、交通整理員が時として混乱し、票を割ってしまうことがあります。しかし、論文によれば、たとえ混乱しても、両方のメモがコード作成を助けようとしているため、ロボットは依然として優れた仕事を行うことがわかりました。

なぜこれが重要なのか

この論文は、新しいスキルを得るたびに、巨大で別々の脳を構築する必要はないかもしれないことを示唆しています。代わりに、一つの強固で凍結された脳と、小さな、切り替え可能なメモが入ったバックパックを持つことができるのです。これは、メモリが限られているスマートフォンやノートパソコンなどのデバイスでAIを動かす上で非常に重要です。これは、あなたのスマートフォンが、巨大なアプリをダウンロードしたり大規模なアップデートを待ったりすることなく、数学のチューターからコーディングのアシスタント、さらにはクリエイティブ・ライティングのパートナーへと、瞬時に切り替えられるAIを一台持つ未来を示唆しています。研究者たちはこれを「構成可能な適応(composable adaptation)」と呼んでいますが、あなたはこれを、ロボットに「小さくて魔法のような付箋のワードローブ」を与えたのだと考えてもよいでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →