← 最新论文
💻 computer science

Implementation and Optimization of HQC Decoding on NPU-Integrated Devices

本文提出了一种在集成 NPU 的设备上,利用 Hexagon Vector eXtensions (HVX) 对高通 Hexagon 处理器进行优化的 NIST 标准化 HQC 解码算法实现,通过将主导解码内核重构为向量化执行方式,实现了高达 18.13 倍的能效提升。

原作者: Vu Minh Chau, Nguyen Ngoc Kiet, Pham Quang Minh, Mai Xuan Ngoc, Nguyen Duc Anh, Hoang Ta

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Vu Minh Chau, Nguyen Ngoc Kiet, Pham Quang Minh, Mai Xuan Ngoc, Nguyen Duc Anh, Hoang Ta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的智能手机是一座繁忙的城市。多年来,这座城市的主要发电厂(CPU)一直在承担所有的重活,其中包括一项非常困难且专业的任务,叫做“HQC 解码”。这项任务就像是一个复杂的安检程序,旨在保护你的信息免受未来量子计算机的威胁。

问题在于,这个安检程序过于沉重,不仅消耗手机电池,还会拖慢主发电厂的速度,导致留给应用程序和游戏的能量变少。

核心理念:使用专门的物流车队
本文作者意识到,虽然主发电厂擅长处理通用任务,但手机中隐藏着一支专门的物流车队,即 NPU(神经网络处理器)。通常,这支车队被用于人脸识别或语言翻译等 AI 任务。然而,研究人员发现,“HQC 解码”这一安全检查任务的结构,实际上与这支专门车队的工作方式完美契合。

他们没有强迫主发电厂去干这些重活,而是重新设计了安全检查程序,让专门的车队(利用被称为 HVX 的向量扩展技术)来代劳。

他们是如何做到的:三大升级
将解码过程想象成一个三步走的流水线。研究人员不仅仅是告诉新车队“跑快点”;他们完全重构了流水线,以匹配车队的优势:

  1. “哈达玛德”排序(Reed-Muller 步骤):

    • 旧方法: 主发电厂逐一查看一份庞大的数字列表,一个接一个地检查它们以寻找最大值。这就像一名图书管理员正在逐一检查书架上的每一本书,试图找出最厚的那一本。
    • 新方法: 专门的车队可以一次性查看整排书籍。他们重新设计了流程,使车队能够同时检查 64 或 128 个数字。他们还确保如果两个数字并列最大,车队选出的结果与图书管理员选出的完全一致,从而保证安全性完美无缺。
  2. “症候式”检查(Reed-Solomon 步骤):

    • 旧方法: 这一步涉及在特殊“有限域”(一种奇特的数字系统)中的复杂数学运算。旧方法就像是通过翻阅一本打开极其缓慢的巨型百科全书来寻找答案。
    • 新方法: 研究人员教会了车队一个新技巧:不再是查找答案,而是进行并行计算。这就像是有 64 名工人同时解决每个小部分的谜题,而不是一名工人按顺序一个接一个地完成。
  3. “根搜索”(寻找错误):

    • 旧方法: 这是一个循序渐进的过程,你必须等待一个结果产生后才能开始下一步,这对于并行处理的车队来说非常缓慢。
    • 新方法: 他们将策略改为“Chien 搜索”。与其等待,不如将所有可能的答案打包进一辆宽大的卡车,然后一次性驶过整个列表,瞬间标记出错误。

结果:速度与电池续航的大获全胜
团队在一款真实的手机(骁龙 8 Gen 2)和高精度模拟器上测试了这一新系统。以下是他们的发现:

  • 速度: 与旧方法相比,新方法在实际手机上的解码速度快了 2 到 3 倍。在模拟器中(忽略启动引擎所需的时间),它快了 23 到 34 倍
  • 电池寿命: 这是最大的胜利。新方法每次解码任务消耗的能量减少了 11 到 18 倍。这就像是用电动踏板车代替燃油卡车来完成同样的递送任务。
  • 释放 CPU: 当旧方法运行时,主处理器处于 93–97% 的忙碌状态,几乎没有余力处理其他事务。而使用新方法时,主处理器仅有 1% 的忙碌度(它只需发出指令并等待)。这让手机在后台进行安全检查的同时,仍能流畅运行游戏、观看视频或执行其他任务。

一个重要的注意事项:“批处理”技巧
论文指出有一个小小的代价。向专门车队发送单个任务需要一点准备时间(约半秒钟)。为了提高效率,他们不会一次只发送一个任务。相反,他们将许多任务进行批处理(Batching),然后一次性全部发送。这样可以将设置成本分摊到许多任务中,使整个过程变得极其高效。

总结
本文证明了,通过重新思考我们组织数据的方式,我们可以利用手机的 AI 硬件(NPU)来处理高强度的密码学任务。这让手机运行更快、更省电,并让主处理器能够腾出手来处理其他事情,同时保持完全相同的安全标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →