← 最新の論文
🤖 machine learning

RAP: Runtime Adaptive Pruning for LLM Inference

本論文は、変化するメモリ制約とワークロード条件の下で有用性を最大化するためにモデル重みと KV キャッシュの保持を共同最適化し、LLM 推論のプルーニング戦略をリアルタイムで動的に適応させる強化学習駆動型のフレームワークである RAP を紹介する。

原著者: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で非常に賢い図書館の助手(大規模言語モデル、または LLM)がいると想像してください。この助手は物語を書いたり、質問に答えたり、問題を解決したりできます。しかし、ここには一つの欠点があります。この助手はあまりにも巨大なため、稼働させるだけで倉庫いっぱいの棚(メモリ)と、膨大な数の作業員(計算能力)が必要になるのです。

もしこの助手をスマートフォンやノートパソコンのような小さなデバイスで動かそうとすると、スペース不足や速度低下により、しばしばクラッシュしてしまいます。

問題点:「万能型」の過ち

現在、多くの人はこの巨大な助手を縮小しようとして、棚を取り外したり、固定されたルールに基づいて作業員を解雇したりするなど、その一部を恒久的に削ぎ落としています。「では、常に図書館の 30% を削減しましょう」と言うのです。

しかし、この論文はそれが悪い考えだと主張しています。なぜなら、図書館のニーズは毎日変化するからです。

  • シナリオ A: ユーザーが非常に短い質問をした場合。助手は会話の記憶にわずかなスペースしか必要としません。
  • シナリオ B: ユーザーが 1 万語の小説を書くよう依頼した場合。助手はこれまでの物語を追跡するための「メモ帳」(KV キャッシュと呼ばれる)を保持するために、突然膨大なスペースを必要とします。

もしスマートフォンに収めるために助手の脳の 30% を恒久的に削ぎ落とせば、誰かが長い質問をした際にシステムが破綻する可能性があります。逆に何も削らなければ、そもそもスマートフォンに収まりません。既存の方法は硬い鎧のようです。重すぎて着られないか、軽量化するために切り詰めれば、身が露わになってしまうのです。

解決策:RAP(ランタイム適応型プルーニング)

著者たちは、RAPを提案しています。これは、助手にリアルタイムで形状を変える賢く伸縮性のあるスーツを与えるようなものです。

助手を一度きりで切り捨てるのではなく、RAP は強化学習(RL)エージェントを使用します。このエージェントを、熟練した交通整理員ステージマネージャーだと考えてください。

  1. 群衆を観察する: 助手が作業を開始する前に、エージェントは具体的なリクエストを確認します。短い質問ですか?長い物語ですか?他のアプリが動作しているためスマートフォンのメモリがいっぱいですか?
  2. 即座に決定する: 観察に基づき、エージェントは今この瞬間に、何を一時的に隠すか決定します。
    • リクエストが短くメモリが逼迫している場合、スペースを節約するために重い「思考」部分(FFN レイヤー)を隠すかもしれません。
    • リクエストが長くメモリがいっぱいの場合、長い物語を追跡するために必要な「注意」部分(MHA レイヤー)を隠すかもしれません。
  3. 最良の部分を保つ: エージェントは、脳のすべての部分が同等ではないことを知っています。あるレイヤーは特定のタスクにとってより重要です。それはGreedy Sequential Importanceと呼ばれる特別な「重要度スキャナ」を使用して、回答を台無しにすることなく安全に退避させることができる部分を正確に特定します。

仕組み(比喩)

天候がまだわからない状態で、旅行用のスーツケースをパッキングすると想像してください。

  • 古い方法: 重い冬のコートと水着を常に自宅に残すことにします。雨が降れば濡れてしまいます。晴れれば水着がありません。
  • RAP の方法: 賢いロボット助手がいます。
    • あなたはロボットに「小さなスーツケース(メモリ制限)を持って、ビーチ(長い会話)に行く」と伝えます。
    • ロボットは即座に重いコートを軽い T シャツと交換し、水着は残します。
    • あなたはロボットに「小さなスーツケースを持って、山(短い会話)に行く」と伝えます。
    • ロボットは水着を暖かい帽子と交換します。

このロボットは強化学習を通じて経験から学び、毎回完璧な交換を行い、スーツケースに収まりつつ、その旅行に必要なものを正確に揃えることを保証します。

発見されたこと

この論文では、この「賢いロボット」を Llama や Qwen などの人気 AI モデルでテストしました。

  • より良い結果: メモリが逼迫している場合、RAP は従来の「固定された切り捨て」方法よりも AI をはるかに良く機能させました。クラッシュせず、回答も賢いままでした。
  • 柔軟性: 人間の再調整なしに、異なる種類のリクエスト(短いもの対長いもの)を処理しました。
  • 速度: 決定を下す「ロボット」は非常に高速で小さく、プロセスを全く遅らせませんでした。会話にほぼ追加の時間を加えることなく動作しました。

結論

RAP は、大規模な AI モデルをより小さなデバイスで実行するための新しい方法です。AI の一部を恒久的に切り捨てるのではなく、特定のタスクと利用可能なスペースに必要な部分のみを保持しながら、AI をその場で動的に再構成します。これは、硬く重いスーツを着るのと、その日の活動に応じて適応する賢く伸縮性のあるスーツを着るのとの違いです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →