← 最新论文
💻 computer science

TokenPowerSandbox: Evidence-Gated CPU-First Screening for Energy-Aware LLM Serving

TokenPowerSandbox 是一个以证据为门控、以 CPU 为核心的筛选框架,它结合了可解释投影与有限的 GPU 探测,旨在实现对 LLM 服务的高能耗预测精度,同时明确展示了能耗模型在认证延迟性能方面的局限性。

原作者: Chenxu Niu

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenxu Niu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当大型语言模型回答问题时,它会在专门的计算机芯片上进行大量的数学运算。这个过程会消耗电能,而消耗的电量取决于问题的长度、同时提问的人数以及软件如何调整以应对负载。对于运行这些系统的公司来说,准确了解特定设置的成本至关重要。他们希望节省资金并减少环境足迹,但同时也必须向用户承诺答案会快速出现。挑战在于,在实际硬件上测试每一种可能的设置既缓慢又昂贵,而试图使用标准计算机来猜测结果则往往具有危险的误差。

研究人员开发了一种名为 TokenPowerSandbox 的新方法来解决这个问题。该团队并没有试图用廉价的猜测来取代昂贵的硬件,而是创建了一个严格的工作流,将计算机预测视为必须由现实世界证据证实的初步想法。他们建立了一个系统,首先使用标准计算机筛选掉明显糟糕的选项,然后通过在真实芯片上进行一次极短、极快的测量来检查预测是否成立,最后仅对最有潜力的候选方案进行完整、全面的测试。这种方法确保了决策是基于经过验证的事实,而非可能在特定情况下出错的自信猜测。

研究人员在运行特定语言模型的单块高端显卡 NVIDIA H100 上测试了这个系统。他们首先在标准计算机上创建了一个简单的模型,该模型可以根据文本长度和用户数量来估算能量消耗。为了确保该模型的公平性,他们首先基于六种不同工作负载的小型数据集对其进行了训练。接着,他们锁定了模型的设置,使其无法学习新知识,并在一组完全独立且从未见过的负载集上对其进行了测试。结果令人印象深刻:在能量预测方面,计算机的估算值与真实芯片使用的实际能量误差在约 6% 以内,并且在几乎所有情况下都能正确排列出哪些设置效率最高。

然而,这项研究揭示了一个简单的平均值会掩盖的关键局限性。虽然计算机在预测能量方面表现出色,但在系统负载较低时,它无法预测第一个词出现的等待时间。在这些低流量情况下,计算机的猜测极其离谱。研究人员在系统中建立了一个安全机制来处理这种情况。系统被编程为在超出其能力范围时承认这一点。如果流量过轻,系统会拒绝对速度进行预测,转而要求进行实际测量。这种“弃权”规则防止了团队因错误的自信感而犯下代价高昂的错误。

为了寻找最佳设置,团队对比了十二种不同的配置。仅靠计算机进行的筛选正确识别了哪些设置最省能,但它完全未能识别出哪些设置足够快以满足用户需求。事实上,计算机对速度的排序几乎与现实完全相反。通过增加一个简短、快速的测量步骤,团队成功修复了速度排名,并成功识别出了那个既节能又足够快速的最佳配置。如果没有这个快速检查,他们将会选择一个在理论上看起来很好、但在实际应用中对用户而言太慢的设置。

最后一步是在一个新的、独立的测试中证明所选设置确实有效。研究人员锁定了他们的选择,并在同一硬件上针对预先选定的专家基准进行了测试。新设置在每生成一千个单词时减少了约 1.4% 的能量消耗,并将首字延迟降低了 21% 以上。这些数字看起来可能很小,但在大规模数据中心的世界里,它们代表着显著的节省。该研究并未声称解决了所有计算机或所有模型的问题,也没有声称适用于复杂的多个芯片网络。相反,它为如何安全地做出这些决策建立了可靠的基础。

这项工作的核心教训是:廉价的预测只有在配合对自身局限性的清晰理解时才是有用的。计算机可以高精度地模拟任务的能量成本,但它目前还无法模拟系统繁忙时产生的复杂延迟。研究人员表明,通过将简单的模型与几次有针对性的现实世界检查相结合,并让系统知道何时停止猜测,你就可以在不浪费时间或金钱的情况下找到最佳设置。这种方法提供了一种值得信赖的方式,来应对节省能源与保持服务快速之间的权衡,确保最终决策是基于证据而非希望。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →