想象一下,你拥有一个全新的、功能极其强大但非常挑剔的厨房电器(空间 NPU)。它旨在以极高的能源效率来烹饪美食(运行 AI 模型),非常适合小型便携式设备。然而,这个电器并不自带食谱,而且说明书是用只有少数专家厨师才能看懂的秘密代码编写的。
多年来,要让像“大语言模型”(LLM)这样复杂的菜肴在这台机器上运行,需要一位人类大师级厨师花费数周时间,手动调整每一个步骤,试图弄清楚如何在不浪费时间和能量的情况下搬运厨房里的食材。
这篇论文描述了一种解决该问题的新方法,即使用一个两阶段的“机器人厨师”系统,它先向人类学习,然后开始自主烹饪。
第一阶段:人类与学徒
首先,研究人员教会了一个 AI 编程代理(“学徒”)如何烹饪一道特定的菜肴:Llama-3.2-1B。
- 过程: 人类厨师不仅仅是在旁观看;他们扮演了引导者的角色。他们告诉学徒:“这是计划。让我们尝试这一步。噢,失败了吗?让我们记下为什么失败了,以及我们是如何修复它的。”
- 结果: 通过合作,他们创造出了一份比之前最佳手动尝试快 2.2 倍的启动烹饪速度,且在出菜速度上快了 4.0 倍的食谱。
- 秘诀: 至关重要的是,他们不仅是在烹饪美食;他们还编写了一本详细的食谱(文档),记录了每一次错误、每一次修复以及每一个“恍然大悟”的时刻。这不仅仅是一个日志;这是一个结构化的教学计划。
第二阶段:自动驾驶厨师
在第二阶段,研究人员将那本详细的食谱转化为了机器人技能。
- 技能系统: 他们构建了一个包含八个特定阶段的系统(比如“切洋葱”、“煎肉”、“调味酱汁”)。每个阶段都有严格的“试味”(数值检查),以确保在进入下一步之前,食物的味道完全正确。如果味道不对,机器人会自动从其技能列表中尝试另一种技术。
- 自主性: 一旦这个系统准备就绪,他们就让机器人厨师独自工作。他们给了它八个全新的、不同的食谱(其他 LLM,如 Qwen 和 SmolLM),这些是它以前从未见过的。
- 结果: 在没有任何人类帮助的情况下,机器人厨师在 0.5 到 4 小时内成功烹饪了所有八道新菜。
- 其中三道新菜的烹饪效率与最初人类协助完成的那道菜一样高效。
- 该系统证明了它的泛化能力:它不仅仅是背诵了第一个食谱;它学会了如何针对这种特定的电器进行烹饪,并将这些技能应用到了新的食材上。
为什么这很重要(用通俗的话说)
把空间 NPU 想象成一个高科技、节能的汽车发动机。
- 以前: 要让汽车运转起来,你需要一名机械师手动连接每一个火花塞和喷油嘴。这既耗时又昂贵。
- 现在: 研究人员制造了一位“自动驾驶机械师”。首先,一个人类教了机械师如何修理一种特定的发动机型号。然后,机械师学会了修理这类发动机的原理。现在,机械师可以走进一个停放着同类不同型号发动机的修理厂,并在几小时内完美地修好它,同时通过自我检查来确保运行安全。
核心结论
论文声称,通过将人类指导与能够记录详细笔记并将其转化为可重用“技能”的 AI 相结合,他们现在可以自主地将复杂的 AI 模型部署到专门的、高能效的硬件上。他们成功部署了八个此前从未在该硬件上运行过的新模型,证明了该系统可以学习、适应并在没有持续人类监督的情况下工作。
技术摘要:从人工引导到自主化:面向空间 NPU 端到端 LLM 部署的智能体技能系统
问题陈述
空间神经处理单元(Spatial NPUs)为边缘侧大语言模型(LLM)推理提供了一个高能效的平台。然而,在这些资源受限的硬件加速器上进行端到端的 LLM 部署仍然是一个劳动密集型过程,需要大量的专家工程支持。虽然 AI 编程智能体已经开始降低工程成本,但现有的研究主要集中在单算子(single-kernel)优化上,而非完整的端到端部署。此外,目前尚无框架能将完整的部署工作流编码为可组合的“智能体技能”(Agent Skills),以自主处理空间 NPU 所需的显式硬件管理、数据移动调度以及分块级(tile-level)算子放置。
方法论
作者提出了一种在 AMD XDNA™2 NPU 上实例化的两阶段方法论,旨在实现从人工引导开发向智能体自主化的过渡。
第一阶段:人工引导的智能体辅助(参考部署):
团队使用 AI 编程智能体(Claude Code 配合 Claude Opus 4.7)作为副驾驶,在 AMD XDNA™2 NPU 上完成了 BF16 格式 Llama-3.2-1B 模型的端到端部署。为了应对稀疏的工具文档和晦涩的错误信息,他们采用了“文档优先”的原则。通过一套结构化的 Markdown 文档(例如 plan.md、issues.md、perf_opt_traj.md)来追踪优化轨迹、调试步骤和设计决策。智能体在人类监督下执行代码编辑、性能分析和工具运行,且每项决策均被记录。该过程实现了相比于手工优化基准(IRON)在 Prefill 阶段 2.2 倍、Decode 阶段 4.0 倍的加速。关键优化包括向量化、特定形状的 Tile 调优、融合算子设计(将 15 个算子合并为 3 个调度指令)以及主机侧优化(如零拷贝缓冲区映射和跳过冗余数据传输)。
第二阶段:智能体技能系统(自主部署):
第一阶段的文档和优化轨迹被提炼为一个可复用的“智能体技能系统”。该系统通过一个八阶段流水线来编排新遇到的 LLM 的部署:
- 阶段 0–3(正确性): 通过将模型分解为 CPU FP32 Oracle(参考模型)、验证单个 NPU 算子、将其组装进单个 Transformer 块,并逐层扩展至全 N 层模型,从而建立端到端的函数正确性。
- 阶段 4–5(优化): 应用特定的优化技能(如多算子合并、缓冲区复用、布局对齐)来解决 Prefill 和 Decode 阶段的瓶颈。
- 阶段 6(集成): 将 Prefill 和 Decode 集成到单个运行器(Runner)中,并收集新的发现。
- 阶段 7(独立评估): 生成一个独立的评估智能体(不携带先验上下文)来重新审计部署、重新运行数值门禁并验证性能报告,以防止奖励作弊(reward hacking)。
至关重要的是,阶段 0–6 强制执行针对 CPU FP32 参考模型的严格数值正确性门禁(测量绝对误差、相对误差和 Pearson 相关系数)。如果门禁失败,系统会自动调用基于已知失败模式的调试技能,或请求人工干预。
核心贡献
- 高性能参考部署: 在 AMD XDNA 2 NPU 上实现了 Llama-3.2-1B 的端到端部署,其性能优于手工优化基准(Prefill 加速 2.2 倍,Decode 加速 4.0 倍),并将整个优化轨迹文档化,为技能系统奠定了基础。
- 面向 NPU 的智能体技能系统: 一个包含八阶段技能链、具有严格数值门禁、可根据常见模式自动触发的优化与调试技能集,以及独立评估智能体的新颖系统。这是首个针对空间 NPU 端到端 LLM 部署的技能集。
- 自主部署八种新模型: 首次在 AMD XDNA 2 NPU 上自主完成了八种其他解码器架构 LLM(包括 Llama-3.2-3B、SmolLM2-1.7B 以及各类 Qwen2.5/3 模型)的开源端到端部署。这些部署在几乎无需人工引导的情况下,在 0.5 至 4 小时的智能体墙钟时间(wall time)内完成。
结果
利用智能体技能系统,团队成功部署了另外八种 LLM。所有模型均通过了数值正确性门禁并经过人工验证。
- 效率: 八个模型中的三个(Llama-3.2-3B、SmolLM2-1.7B、Qwen2.5-3B)实现了匹配或超过 Llama-3.2-1B 参考模型的持续性能(ηscale 范围在 0.94 到 1.27 之间)。这些模型与参考模型具有相似的 Transformer 块结构,使得现有算子能够有效处理它们。
- 局限性: 其余五个模型的效率较低(ηscale 为 0.24–0.94)。作者将其归因于更小的单算子工作负载(无法摊销调度开销)以及不支持的操作(如 QKV Bias、每头 Q/K 归一化),这些因素需要填充(padding)或阻碍了算子融合。
- 部署时间: 自主部署在 0.5 到 4 小时内完成,与手动部署相比显著降低了工程量。
意义
本文声称展示了对先前未遇到的 LLM 的“功能泛化”,证明了从人工引导优化中提炼出的技能系统可以自主部署具有竞争力的空间 NPU 上的 LLM 实现,而无需额外的模型特定人工工程。它通过从单算子优化转向完整的端到端部署工作流,填补了现有研究的空白。这项工作为降低高效能空间加速器上边缘侧 LLM 部署的工程门槛建立了路径,表明智能体自主化最终可以取代该领域对大量专家工程的需求。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。