← 最新论文
🤖 AI

End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference

本文提出了学习分配(Learning to Allocate, L2A),这是一个端到端的框架,使大语言模型能够根据输入难度和实时资源约束动态调整其计算足迹,在无需单独模型微调的情况下,在广泛的效率帕累托前沿上实现了接近稠密模型的准确度。

原作者: Yuhang Chen, Jinhao Duan, Ruichen Zhang, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Tianlong Chen, Xi Liu

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhang Chen, Jinhao Duan, Ruichen Zhang, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Tianlong Chen, Xi Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手(大语言模型)来帮你解决问题。通常情况下,这个机器人的构建方式就像一条僵化的工厂装配线。无论你问的是一个简单的问题,比如“2+2等于几?”,还是一个复杂的问题,比如“写一个 Python 脚本来模拟黑洞”,机器人都会运行完全相同数量的机器、检查完全相同数量的蓝图,并消耗完全相同的电量。

如果你的电网完美且永不变化,这没问题。但在现实世界中,资源是混乱的。有时你的网络连接很慢,有时你的电脑内存快耗尽了,或者你正在使用一个可能在两分钟内就会关闭的廉ently 云服务器。如果机器人在资源匮乏时仍然运行完整的装配线,它要么会崩溃(耗尽电力),要么会等待太久(反应太慢)。

这篇论文介绍了一个名为 L2A (Learning to Allocate) 的新系统。你可以把 L2A 想象成给机器人配备了一个聪明的、灵活的经理,他可以观察当前的情况,并决定实时投入多少精力来工作。

以下是它的工作原理,使用了简单的类比:

1. “预算”信号

想象机器人的仪表盘上有一个“预算旋钮”,范围从 0 到 1。

  • 1.0 意味着“全速前进,使用所有资源,慢慢来”。
  • 0.1 意味着“我们处于紧急状态!在电力切断前,使用最低限度的资源完成任务”。

在现实世界中,这个旋钮会根据以下因素自动调节:

  • 时间: “在服务器关闭前,你只剩下 2 分钟了。”
  • 内存: “你的电脑快没有 RAM 了。”
  • 队列: “太多人在提问了;我们需要加快速度。”

2. 三个智能开关

L2A 并没有只是简单地将整个机器人开启或关闭,而是给了机器人三个特定的“调光开关”,它可以根据预算旋钮和问题的难度来调节这些开关:

  • “层跳过”开关(深度):
    把机器人的大脑想象成一个由 30 层楼组成的堆叠。通常情况下,每个问题都要经过所有 30 层。

    • 简单问题: 经理说:“这很简单。让我们跳过第 10 层到第 25 层,直接得出答案。”
    • 难题: 经理说:“这很棘手。我们需要访问每一层来进行思考。”
    • 结果: 机器人在处理简单任务时节省能量,但在处理难题时保持全功率运转。
  • “头剪枝”开关(宽度):
    在每一层内部,有许多不同的“专家”(注意力头)在观察这个问题。

    • 简单问题: 经理说:“我们只需要 2 个专家来看这个问题。让其他 10 个休息吧。”
    • 难题: “我们需要全部 10 个专家来进行辩论。”
    • 结果: 机器人在任务简单时使用更少的工人。
  • “推理停止”开关(时间):
    有时机器人会在给出答案之前进行“出声思考”(生成长串的推理过程)。

    • 简单问题: 经理说:“思考 5 秒后就停止。直接给出答案。”
    • 难题: “持续思考 30 秒,直到你确定为止。”
    • 结果: 机器人在不需要时不会浪费时间进行冗长的解释。

3. 它是如何学习的

机器人并不是通过硬性规则(如“如果是数学题,就跳过 5 层”)来编程的。相反,它学习一种策略。

  • 在训练期间,机器人在“预算旋钮”被随机设定在不同水平时进行练习。
  • 它学习了一条简单的规则:“当预算较低时,我必须节俭。当预算较高时,我可以深入思考。但我同时也必须观察问题:如果是一个很难的数学题,即使预算紧张,我也需要保持大脑开启。”

实验结果

论文在两个流行的机器人大脑(Llama-3 和 Qwen)上进行了测试。以下是研究发现:

  • “一刀切”方法(静态模型): 如果你强迫机器人始终跳过相同的工作量,它要么会在困难任务上崩溃,要么会在简单任务上浪费能量。
  • “L2A”方法: 机器人能够完美适配。
    • 在简单任务上,它能节省高达 34% 的计算能力(跳过层和注意力头)。
    • 在困难任务(如复杂的数学或编程)上,它会保持全功率。
    • 至关重要的是: 即使在被迫以极低资源工作的环境下,它也不会丧失解决难题的能力。它几乎能保持与完整、缓慢版本相当的准确度,而其他方法则会表现得很糟糕。

总结

这篇论文提出了一个系统,将僵化、静态的 AI 转变为一个灵活的、具备资源意识的工人。它不仅是在猜测问题的难度,还会倾听环境(时间、内存、服务器状态),并动态决定使用多少“脑力”。这确保了 AI 在资源匮乏时永远不会崩溃,而在资源充足时也绝不会浪费能量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →