← 最新の論文
🤖 AI

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAGは、知能を継続的に学習可能なエンティティ認識器と3層の知識グラフを中心とした協調的なモジュールへと分解することで、大規模なモデル圧縮を必要とせずに、効率的でプライバシーが守られたオフラインのLLMアシスタンスを可能にし、汎用的なスマートフォン上で競争力のあるマルチホップ推論性能を実現する、完全なオンデバイス・フレームワークである。

原著者: Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのスマートフォンの中に、超賢いロボットの友達が住んでいると想像してみてください。この友達は「大規模言語モデル(LLM)」によって動いており、チャットをしたり、物語を書いたり、ほとんど何にでも答えることができます。しかし、一つだけ条件があります。真に役に立つためには、あなたの人生――あなたの写真、メモ、プライベートな会話――を記憶する必要があります。ただし、それらのデータを、紛失したり盗まれたりする可能性がある巨大なクラウドサーバーに送ることなく、です。これが「オンデバイスAI」の世界です。あなたのポケットの中に、脳と記憶の両方を留めておくのです。

しかし、スマートフォンのサイズに収まるような脳を作ることは、バックパックの中に図書館を詰め込もうとするようなものです。最大の課題は「メモリ(記憶)」です。標準的なロボットの脳は、すべてを自身の「パラメトリック・メモリ(内部の重み)」の中に記憶しようとしますが、これは携帯電話には重すぎますし、新しいことを学んだときに更新するのが容易ではありません。これを解決するために、科学者たちは「RAG(検索拡張生成)」を使用しています。RAGを、ロボットにノートを与えることだと考えてください。質問を受けたとき、ロボットは単に推測するのではなく、ノートをめくって事実を見つけ出し、それから答えを書き出します。問題は、ほとんどのノートが、ただのバラバラな紙の束であることです。もし、3つの異なるページにある3つの異なる事実を結びつける必要がある複雑な質問をされた場合、バラバラの紙の束ではナビゲートするのが困難です。この論文はこう問いかけます。「スマートフォンで動作するのにスーパーコンピューターを必要とせず、複雑なパズルを解くことができる、スマートで整理されたノートをどうすれば構築できるだろうか?」


問題点:「巨大な脳」 vs 「小さなスマートフォン」

しばらくの間、AIをより賢くするための解決策は単純に見えました。それは、単に脳を大きくすることです。しかし、この論文の著者である「SmartRAG」は、それがモバイルデバイスにとっては間違ったアプローチであると主張しています。巨大なクラウドの脳をそのままスマートフォンに収まるように縮小することはできません。重すぎて、バッテリーを消費しすぎ、考えるのに時間がかかりすぎるからです。

彼らは異なるアイデアを提案しています。一つの巨大な脳ですべてをやろうとするのではなく、専門化された軽量なワーカーのチームを作ろうというアイデアです。彼らはこれを「SmartRAG」と呼んでいます。これは、あなたの個人データを、乱雑なテキストの山ではなく、構造化された「知識グラフ(つながりのある事実のウェブ)」として整理し、スマートフォン上で完全に動作するように設計されたシステムです。

チーム:4人の専門ワーカー

SmartRAGは、スマートなアシスタントとしての仕事を、それぞれ異なるモジュールが担当する4つの明確な役割に分割しています。

  1. 知覚(探偵): これは、あなたのテキストやメモを読むチームメンバーです。EvoNERと呼ばれる特別なツールを使用して、重要な名前や事実を見つけ出します。面白い点は、EvoNERが「継続的に学習可能」であることです。想像してみてください。毎日新しい手がかりの種類を学ぶ探偵です。もしあなたが新しい種類のエンティティ(新しいスラングやニッチな趣味など)に言及しても、EvoNERは巨大な脳全体を再学習させることなく、即座にそれを認識することを学習し、自身の「ラベル・インベントリ」を更新できます。
  2. メモリ(司書): 探偵が事実を見つけたら、司書がそれを保管します。ただし、単に引き出しにファイルするのではなく、司書は3層構造の知識グラフであるMRGraphを構築します。
    • 第1層は、事実をそれが出自した正確な段落にリンクさせます(これにより、情報のソースがどこであるかが分かります)。
    • 第2層は、類似した事実をクラスター(「トピック」フォルダのようなもの)にグループ化します。
    • 第3層は、素早い読み取りのために生のテキストを準備しておきます。
      この構造により、質問をしたときに、システムは事実がどのようにつながっているかを正確に把握でき、あらゆる情報の「プロベナンス(由来)」を保持することができます。
  3. フォーカス(ナビゲーター): あなたが質問をするとき、ナビゲーターは単にキーワードを探すのではありません。それはハイブリッド・パイプラインを使用します。情報のつながりのウェブ(グラフ)を確認し、言葉を一致させ(語彙検索)、意味を理解します(意味検索)。もしあなたが「私が気に入った映画の監督が有名にした本の著者は誰か?」といった多段階の質問をした場合、ナビゲーターは単に推測するのではなく、グラフを通じて経路を辿り、一つの事実から次の事実へと飛び移ることができます。
  4. 思考(脳): これは、高機能な大規模言語モデル(LLM)を使用する唯一の部分です。しかし、ここでのトリックは、LLMは「高価値」な仕事に対してのみ呼び出されるということです。LLMはすべてのページを読むわけではありません。検索の計画を立てたり、新しい事実のタイプにラベルを付けたり、最終的な回答を書いたりするためにのみ介入します。LLMを厳格に制御することで、システムは膨大な量のバッテリーとメモリを節約します。

実生活での動作

研究者たちは、実際のスマートフォン(具体的にはSnapdragonプロセッサを搭載したOnePlusデバイス)でこのシステムをテストしました。彼らは、非常に小さく効率的なバージョンのLLM(クラウドで使用される巨大なモデルと比較して、わずか17億パラメータという極めて小さいもの)を使用しました。

彼らはSmartRAGを以下の手法と比較しました:

  • LLMのみ: すべてを記憶しようとする小さな脳。
  • ナイーブなRAG: 検索するためのバラバラな紙の山を持つ小さな脳。
  • クラウド規模のモデル: スマートフォンでは動作できない、最大320億パラメータの巨大な脳。

結果:
複数の証拠を結びつける必要がある複雑な質問(マルチホップ推論)において、小さな1.7Bの脳を持つSmartRAGは、巨大なクラウドモデルと同等、あるいは場合によってはそれ以上の性能を発揮しました。

  • MultiHopQAベンチマークにおいて、SmartRAGは**50.17%**の正解率を達成し、1.7Bの「LLMのみ」のバージョン(22.00%)を大幅に上回り、32Bモデル(31.54%)をも凌駕しました。
  • しかし、直接的な事実に関する質問(TriviaQAベンチマーク)では、32Bモデルが依然として優位にあり、SmartRAGの**50.00%に対して51.45%**を記録しました。
  • 全体として、SmartRAGは知識集約的なタスク(NQ、HotpotQA、MultiHopQA)において、より大きなモデルと同等またはそれを上回る性能を示し、同時にデータをプライバシー保護するためにスマートフォン上で完全に動作しました。応答時間は実用的でしたが、著者は、メモリをまず検索する必要があるため、1.7Bモデルによるフルプロセスでの「最初のトークンまでの時間(Time to First Token)」は約36.9秒であったと述べています。

彼らが否定したもの

この論文は、いくつかの一般的な考えに対して明確に反論しています:

  • クラウドの圧縮: 巨大なクラウドベースのグラフシステムをそのままスマートフォンに縮小することはできません。数学的およびエネルギー的なコストが高すぎるためです。
  • LLMネイティブな抽出: メモリの整理(事実の抽出とグラフの構築)を行うために巨大なLLMをすべてに使用することは、スマートフォンのためには遅すぎ、エネルギー消費が激しすぎることを彼らは発見しました。「知覚」モジュールは、重いLLMではなく、軽量で学習可能なコンポーネントである必要があります。
  • ナイーブなベクトル検索: 単純な「意味的類似性」(似たような言葉を見つけること)だけに頼ることは、論理的なつながりを必要とする複雑な質問には不十分です。

結論

著者たちは、オンデバイスAIの未来は、脳を大きくすることではなく、システムをよりスマートにすることにあると示唆しています。事実を「気づく(知覚)」こと、(事実を)「整理する(メモリ)」こと、(事実を)「見つける(フォーカス)」こと、そして(事実について)「考える(思考)」ことを分離することで、SmartRAGは、小型で効率的なスマートフォンが、通常はスーパーコンピューターを必要とする複雑な推論タスクを処理できることを示しました。

このシステムはまだ完璧ではありませんが(AIや政治といった非常に特定のトピックでは依然として苦戦しており、速度も改善の余地があります)、実験は、構造化されたグラフベースのアプローチが、プライバシー重視のオフラインAIアシスタントへの実行可能な道であることを証明しています。適切なアーキテクチャがあれば、あなたのスマートフォンのパーソナルアシスタントは、あなたの秘密をすべてポケットの中に留めたまま、クラウドの巨人のように賢くなれる可能性があることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →