← 最新の論文
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

本論文は、既存のベースラインと比較して大規模言語モデルにおける推測的デコーディングの処理量を最大4.2倍、エネルギー効率を最大5.6倍向上させるために、新規制御機構を備えたNPU-PIM協調を活用するタスクレベルの非同期異種モバイルアーキテクチャであるAHASDを導入する。

原著者: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

長い物語を書こうとしていると想像してください。しかし、厳しいルールがあります。あなたが書くすべての単語を、非常に賢く、遅く、そして高価な編集者(ターゲットモデル)にチェックしてもらってからでないと、次の単語を書くことができないのです。これにより、執筆は信じられないほど遅くなります。

これを加速させるために、あなたは素早くエネルギッシュなアシスタント(ドラフトモデル)を雇い、次のいくつかの単語を推測させます。あなたはこれらの推測を書き留め、その後、賢い編集者がそれらを一度にすべてチェックします。推測が良ければ、それらを保持して先に進みます。悪ければ、それらを捨てて最初からやり直します。これをスペキュレイティブデコーディングと呼びます。

しかし、モバイルフォンでは、このプロセスには 2 つの大きな問題があります:

  1. 「待ちゲーム」問題:アシスタントが 2 語を推測することもあれば、20 語を推測することもあります。アシスタントが遅いと、編集者は待機して暇になります。アシスタントが速いと、編集者は次のバッチを待つために待機して暇になります。彼らは互いに完了するのを待って手を取り合い続けており、これは時間の無駄です。
  2. 「悪い推測」問題:アシスタントが過信し、文脈が難しいために、無意味な段落全体を推測してしまうことがあります。編集者は全体を却下しなければならず、アシスタントが推測に費やしたすべてのエネルギーが無駄になります。

この論文は、PIM(メモリ内処理)と呼ばれる特殊なコンピュータチップと、標準的な AI チップであるNPUを使用して、モバイルフォン上のこれらの問題を解決するために設計された新しいシステムAHASDを紹介しています。

以下は、簡単なアナロジーを用いた AHASD の仕組みです:

1. 「非同期ダンス」(タスクレベルの非同期実行)

古いシステムでは、アシスタントと編集者は完璧に同期して踊らなければなりませんでした。アシスタントが止まれば、編集者も止まりました。
AHASDはこの鎖を断ち切ります。アシスタント(メモリチップである PIM で動作)と編集者(プロセッサである NPU で動作)が独立して作業できるようにします。

  • アナロジー:工場の組立ラインを想像してください。作業者が機械の完了を待ってから次のステップを開始するのではなく、作業者は機械が前のバッチを処理している間に、箱(キュー)から新しい部品を取り出して作業し続けます。彼らは互いを待たず、ラインを動き続けさせます。これにより、あるデバイスが何もしずに座っている「アイドル時間」が排除されます。

2. 「自信レーダー」(エントロピー履歴認識ドラフティング)

アシスタントは、慎重であるべき時に、過信して無茶な推測を始めてしまうことがあります。
AHASDはアシスタントに「自信レーダー」を与えます。それは最近の推測の履歴を調べます。

  • アナロジー:天気予報士を想像してください。過去 3 日間、雨の予報を外し続けていた場合、雲が似ていても、次の日の雨予報は止めます。同様に、アシスタントの推測の「自信」が低い(エントロピーが高い)場合、システムはこう伝えます。「先読みして推測するのをやめろ!次の単語を推測する前に、編集者が現在の単語を確認するのを待て」。これにより、アシスタントが確実に捨てられることになる推測にエネルギーを浪費することを防ぎます。

3. 「スマートタイマー」(時間認識事前検証)

アシスタントが作業を終えても、編集者がまだ忙しいことがあります。アシスタントは再び推測を開始するかもしれませんが、推測しすぎると、編集者がチェックする作業がなくなり、待機してしまいます。
AHASDは「スマートタイマー」を使用して、アシスタントがいつ停止し、自分で素早い「ミニチェック」(事前検証)を行うべきかを正確に決定します。

  • アナロジー:シェフ(アシスタント)が野菜を切りながら、 sous-chef(編集者)がソースを調理している状況を想像してください。シェフはソースが完成するまでの時間を正確に知っています。シェフがソースが 5 秒で完成することを認識したら、野菜を切り続けるのをやめ、野菜が準備できているか確認するために素早い味見(事前検証)を行います。これにより、sous-chef はソースが完成した瞬間に新鮮な野菜を用意でき、sous-chef が待機して立ちすくむことがなくなります。

結果

著者らは、このシステムのシミュレーションをモバイルフォンチップ上で構築しました。その結果、以下が判明しました:

  • 速度:標準的なグラフィックカード(GPU)のみを使用する場合と比較して最大4.2 倍高速であり、モバイルチップとメモリ処理を組み合わせようとした以前の試みと比較して1.5 倍高速です。
  • バッテリー寿命:標準的な GPU と比較して最大5.6 倍のエネルギー効率を達成し、以前の最良のモバイルシステムと比較して1.24 倍優れています。
  • コスト:これらのすべての新しい機能は、メモリチップ上の追加スペースの約**3%**しか占有しません。これほどの大きな速度向上に対する代償は非常に小さいものです。

要約すると、AHASD は、互いを待ち続けるのをやめ、推測する前に自分の自信を確認し、作業がスムーズに流れるようにバッテリーを無駄にすることなく休憩のタイミングを完璧に調整するチームを、スマートフォンの AI に与えるようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →