← 最新论文
🤖 AI

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG 是一个全端侧框架,通过将智能分解为以持续可学习的实体识别器和三层知识图谱为核心的协同模块,在普通智能手机上实现了具有竞争力的多跳推理性能,从而在无需大规模模型压缩的情况下,实现了高效、私密且离线的 LLM 辅助。

原作者: Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的手机里住着一个超级聪明的机器人朋友。它由“大语言模型”(LLM)驱动,可以聊天、写故事,并回答几乎任何问题。但有一个限制:为了真正发挥作用,这个机器人需要记住你的生活——你的照片、笔记和你私密的对话——同时又不能将这些数据发送到可能丢失或被窃取的巨型云端服务器中。这就是**端侧 AI(on-device AI)**的世界:将大脑和记忆都留在你的口袋里,以确保隐私和速度。

然而,要把一个“大脑”装进手机里,就像试图把一座图书馆塞进一个背包一样困难。最大的挑战是记忆。一个标准的机器人大脑试图通过其自身的“参数化记忆”(其内部权重)来记住一切,但这对于手机来说太重了,而且当它学习新知识时,很难进行更新。为了解决这个问题,科学家们使用了 RAG(检索增强生成)。把 RAG 想象成给机器人一本笔记本。当被问到一个问题时,它不仅仅是靠猜测;它会翻阅笔记本寻找事实,然后写出答案。问题在于,大多数笔记本就像是一堆散乱的纸页。如果你问一个需要连接三张不同页面上三个不同事实的复杂问题,这堆散乱的纸页就很难进行导航。这篇论文在问:我们如何为手机构建一个聪明、有组织的笔记本,使其能够处理复杂的谜题,而不需要依靠超级计算机来运行?


问题:“大脑袋” vs. “小手机”

一段时间以来,让 AI 变得更聪明的解决方案似乎很简单:只要把大脑做大就行。但本文的作者们,即 SmartRAG 的研究者,认为对于移动设备来说,这是一个错误的路径。你不能直接把一个巨大的云端大脑缩小到能塞进手机里;它太重了,会消耗太多电量,而且思考速度太慢。

他们提出了一个不同的想法:与其建立一个试图做所有事情的巨大大脑,不如建立一个由专门的、轻量级的工作人员组成的团队。他们称之为 SmartRAG。这是一个旨在完全在你的智能手机上运行的系统,它将你的个人数据组织成一个结构化的“知识图谱”(可以理解为一个相互连接的事实网络),而不是一堆杂乱的文本。

团队:四位专业工作人员

SmartRAG 将担任智能助手的工作拆分为四个不同的角色,每个角色由不同的模块处理:

  1. 感知(侦探): 这是负责阅读你的短信和笔记的团队成员。它使用一种名为 EvoNER 的特殊工具来识别重要的名称和事实。酷的地方在于?EvoNER 是“可持续学习的”。想象一下一位每天都在学习新线索类型的侦探,而无需回到学校重新受训。如果你提到了一种新的实体类型(比如一个新的俚语或小众爱好),EvoNER 可以即时学习识别它,更新自己的“标签清单”,而无需重新训练整个庞大的大脑。
  2. 记忆(图书管理员): 一旦侦探找到了一个事实,图书管理员就会将其归档。但图书管理员不仅仅是把它放进抽屉里,而是构建了一个 MRGraph,一个三层结构的知识图谱。
    • 第一层 将事实链接到它们来源的具体段落(这样你就知道信息的出处)。
    • 第二层 将相似的事实聚类在一起(就像一个“主题”文件夹)。
    • 第三层 保留原始文本以便快速阅读。
      这种结构确保了当你提问时,系统确切地知道事实是如何连接的,从而保留了每一条信息的“溯源性”(来源)。
  3. 聚焦(导航员): 当你提出问题时,导航员不仅仅是搜索关键词。它使用了一个混合流水线。它查看连接的网络(图谱)、匹配词汇(词法搜索)并理解含义(语义搜索)。如果你问一个多步骤的问题,比如“谁写了那本由我喜欢的电影导演所成名的书?”,导航员可以通过追踪图谱中的路径,从一个事实跳转到下一个事实,而不是仅仅靠猜。
  4. 思考(大脑): 这是唯一使用重型大语言模型(LLM)的部分。但诀窍在于:LLM 只用于“高价值”的工作。它不会阅读每一页,它只在规划搜索、标记新事实类型或撰写最终答案时介入。通过对 LLM 进行严格的控制,该系统节省了大量的电池和内存。

现实生活中的运作方式

研究人员在真实的智能手机(具体为搭载 Snapdragon 处理器的 OnePlus 设备)上测试了这个系统。他们使用了一个非常小、非常高效的 LLM 版本(仅有 17 亿参数,这与云端使用的庞大模型相比微不足道)。

他们将 SmartRAG 与其他方法进行了对比:

  • 仅使用 LLM: 只有一个试图记住一切的小大脑。
  • 朴素 RAG(Naïve RAG): 一个带着一堆乱纸进行搜索的小大脑。
  • 云端规模的模型: 高达 320 亿参数的巨大大脑,无法在手机上运行。

结果:
在需要连接多个证据的复杂问题(多跳推理)上,拥有 1.7B 小大脑的 SmartRAG 表现出了竞争力,在某些情况下甚至优于大规模的云端模型。

  • MultiHopQA 基准测试中,SmartRAG 达到了 50.17% 的正确率,显著超过了 1.7B 的“仅使用 LLM”版本(得分为 22.00%),并超越了 32B 模型(得分为 31.54%)。
  • 然而,在 TriviaQA(一个针对直接事实性问题的基准测试)上,32B 模型仍然占据优势,得分为 51.45%,而 SmartRAG 为 50.00%
  • 总体而言,在处理像 NQHotpotQAMultiHopQA 这样需要大量知识的任务时,SmartRAG 匹配或超过了更大的模型,同时完全在手机上运行以保护隐私。响应时间是实际可行的,尽管作者指出,由于必须先搜索记忆,1.7B 模型在执行完整过程时的“首个 Token 延迟时间”(开始说话的时间)约为 36.9 秒

他们排除了哪些方案

论文明确反对了一些常见观点:

  • 仅仅压缩云端: 你不能简单地将一个巨大的云端图谱系统缩小并放入手机;其数学成本和能量成本都太高了。
  • LLM 原生提取: 他们发现,使用大型 LLM 来完成组织记忆(提取事实和构建图谱)的所有工作,对于手机来说太慢且太耗电。因此,“感知”模块必须是一个轻量级的、可训练的组件,而不是沉重的 LLM。
  • 朴素向量搜索: 仅仅依赖简单的“语义相似性”(寻找听起来相似的词)不足以应对需要逻辑连接的复杂问题。

结论

作者们认为,端侧 AI 的未来不在于把大脑做大,而在于让系统变得更聪明。通过将“察觉事实”(感知)、“组织事实”(记忆)、“寻找事实”(聚焦)和“思考事实”(思考)的工作分开,SmartRAG 表明,一个高效的小型手机也可以处理通常需要超级计算机才能完成的复杂推理任务。

虽然该系统目前还不完美(它在处理 AI 和政治等非常特定的主题时仍有些吃力,且速度还可以更快),但实验证明,一种结构化的、基于图谱的方法是实现隐私导向、离线 AI 助手的可行路径。它表明,有了正确的架构,你手机里的个人助手很快就能像云端巨头一样聪明,同时让你所有的秘密都留在你的口袋里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →