← 最新论文
🤖 AI

Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware

本文针对消费级 RTX 4060Ti GPU 上的九种开源大语言模型进行了定量基准测试,结果表明,能源效率更多地是由模型架构和量化技术而非参数量驱动的,其中像 gemma3 和 llama3.2 这样的 1B 模型实现了最低的每 Token 能源成本,而像 7B-Mistral 这样较大的模型消耗的能量显著更高。

原作者: Philipp M. Zähl, Anika Hennig

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Philipp M. Zähl, Anika Hennig

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚打造了一个住在你电脑里的超级聪明机器人朋友,它随时准备回答问题、写故事,或者帮你写代码,而且永远不会把你的秘密发送到巨大的云端服务器。这就是“本地”人工智能的世界,由于人们对隐私和速度的需求,这一趋势正在爆发式增长。但这里有一个问题:这些聪明的机器人非常“饥饿”。虽然我们早就知道在超级计算机上训练这些庞大的 AI 大脑会消耗大量电力(就像为一座小城市供电一天那样),但我们一直并不清楚在普通的家用电脑上仅仅与它们“交谈”需要多少能量。这就像我们知道汽车在高速公路上油耗很高,却不知道在和你聊天时,车子仅仅在车库里怠速运转时会消耗多少燃料。随着越来越多的人开始在自己的笔记本电脑或游戏 PC 上运行这些 AI 助手,理解这种“活跃状态下”的能源账单,对于你的钱包和地球环境来说都成为了一个现实的担忧。

这正是来自德国亚琛应用技术大学(FH Aachen University of Applied Sciences)的一个研究团队介入的地方。他们想要看看在标准的消费级显卡——特别是像 NVIDIA RTX 4060 Ti 这种你可能会在高端游戏 PC 中看到的显卡——上运行时,哪些流行的免费 AI 模型是最“节能”的。他们没有仅仅询问“哪个模型给出的答案最好?”,而是问道:“哪个模型在消耗最少电量的情况下给出最好的答案?”他们设计了一个受控实验,向九个不同的开源 AI 模型(范围从微小的 10 亿参数模型到较大的 70 亿参数模型)输入了一组固定的 15 个问题,涵盖了从简单的常识(如“法国的首都是哪里?”)到复杂的任务(如编写代码或解释深奥概念)。

研究人员扮演了“能源侦探”的角色,使用名为 nvidia-smi 的工具,在模型工作时每秒两次检查显卡的功耗。至关重要的一点是,他们并没有只测量总功率,而是仔细减去了显卡的基准“待机”功率,从而分离出 AI 思考过程所消耗的精确能量。他们的主要目标是计算生成每一个单词(或称“标记/token”)需要消耗的总能量(单位为焦耳)。他们的发现表明,大并不一定意味着好。事实上,那些微小的模型,特别是 gemma3:1bllama3.2:1b,成为了效率之王。这些小型的能量冠军仅用 0.56 焦耳的能量就能生成一个单词,并且每秒可以吐出超过 170 个单词。

相比之下,那个较大的 70 亿参数模型(Mistral)效率要低得多,每个单词消耗的能量高达最有效率的小模型的 4.4 倍。研究还揭示了一个奇特的惊喜:其中一个模型 qwen3.5:2b 在处理每个提示词(prompt)时消耗了惊人的能量。研究人员认为,这并不是因为模型运行缓慢,而是因为它在进行内部“思考”——使用一种叫做“扩展推理”的技术,在开口说话前先规划答案——即使最终输出很短,这种过程也会消耗额外的能量。这凸显了仅仅观察整个问题的总能量可能会产生误导;真正的效率指标是生成每个标记(token)所需的能量。最终,论文指出,对于任何在自己硬件上运行 AI 的人来说,最节能的选择并不一定是功能最强大或规模最大的模型,而是那个拥有适合当前任务的架构和规模的模型,这证明了有时,最小的脑袋才是最环保的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →