← 最新论文
🤖 AI

More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning

本文引入了一个针对本地部署的紧凑型开源权重语言模型在数学推理方面的受控评估框架,通过揭示显著的权衡关系证明了仅凭准确率不足以进行模型选择,即尽管 Qwen3:4b 在特定数据集上具有更高的准确率,但 Gemma3:4b 却展现出更优越的能源效率。

原作者: Orion Powers, Daniella Seum, Khaled Slhoub

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Orion Powers, Daniella Seum, Khaled Slhoub

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在过去的几年里,计算机已经学会了以一种近乎人类的流利程度进行阅读和写作。这些被称为“大语言模型”的系统,可以通过基于从海量文本中学习到的模式来预测句子中的下一个词,从而解决问题、编写故事并回答问题。长期以来,使用这些强大工具的唯一方法是通过互联网向一家科技公司拥有的庞大服务器集群发送问题。但一种新的趋势正在改变这一动态。研究人员和开发人员现在能够下载较小版本的模型,并将它们直接运行在自己的计算机上,就像安装标准软件程序一样。这种转变带来了显著的益处:你的数据保留在本地机器上以确保隐私,你无需为每个问题付费,并且即使在没有互联网连接的情况下也能使用这项技术。然而,在本地运行这些程序也带来了一系列新的挑战。当模型在你的自有硬件上运行时,它会消耗电量、产生热量并需要时间进行“思考”。仅仅因为一个模型足够小,可以装进笔记本电脑,并不意味着它足够高效,以至于可以投入日常实际使用。

佛罗里达理工学院的一个研究小组致力于了解运行这些本地模型的现实世界权衡情况。他们想知道,最准确的模型是否也是最高效的模型,或者选择最合适的工具是否需要在速度、能量和正确性之间进行平衡。为了找到答案,他们专注于一种特定的任务类型:数学推理。数学问题是这类测试的理想选择,因为它们有明确且客观的答案。与答案具有主观性的创意写作提示不同,数学问题要么有正确的解,要么没有。研究人员选择了三个紧凑型模型,每个模型的参数量都少于五十亿——这是衡量模型规模和复杂度的指标。这些由谷歌、微软和阿里巴巴开发的模型被选中,是因为它们足够小,可以在标准的消费级计算机上运行,而不需要专门的、昂贵的设备。

该团队设计了一个严谨的实验以确保公平比较。他们收集了三组不同的数学题,范围涵盖从八年级算术到大学水平的微积分及高级统计学。随后,他们将这些完全相同的问题输入到三个模型中,并在同一台计算机上以相同的设置运行。至关重要的是,他们不仅仅观察模型是否得到了正确答案。他们还精确测量了每个问题解决所需的时间、模型生成了多少个词,以及计算机的显卡在过程中消耗了多少电能。他们构建了一个系统来自动检查最终答案,通过剔除多余的文本或格式,以查看核心数字或解是否与预期结果相匹配。这使他们能够将真正的推理错误与简单的格式错误区分开来。

结果揭示了准确性与效率之间令人惊讶的脱节。没有一个模型能在所有方面都表现出色。其中一个由阿里巴巴开发的模型在八年级数学和高级统计测试中取得了最高的准确率。另一个来自谷歌的模型在微积分问题上表现最佳。第三个来自微软的模型在所有三个类别中都表现挣扎,得到的正确答案极少。然而,当研究人员观察能量效率时,排名发生了剧烈变化。谷歌模型在功耗方面是明显的赢家。对于它消耗的每一单位电量,它产生的正确答案大约是阿里巴巴模型的三倍。阿里巴巴的模型虽然通常是最准确的,但需要显著更多的时间和能量来生成响应,产生了远超解决问题所需的文本量。微软的模型尽管在某些情况下能耗较低,但由于其准确性太低,其效率收益变得毫无意义。

研究还强调了这些模型配置方式的重要性。阿里巴巴的模型有一个“思考”模式,即在回答之前会停顿以进行推理。研究人员在测试中禁用了这一功能,以确保能与不具备相同能力的其它模型进行公平比较。他们指出,这种选择可能会降低阿里巴巴模型的准确率(与其开启思考功能时的表现相比),但为了保持测试条件的一致性,这是必要的。此外,研究人员发现,微软模型的低性能并非由于计算机无法读取答案。系统成功地从几乎所有的响应中提取出了答案,这意味着其糟糕的结果是由于模型提供了错误的解,而非测试过程本身的失败。

最终,这项研究表明,对于任何希望在自有硬件上运行这些模型的人来说,准确性并不是唯一的衡量指标。一个准确度稍低但仅使用一小部分能量和时间的模型,对于计算资源有限的学生或小型团队来说可能是更好的选择。研究结果表明,不存在单一的“最佳”模型用于本地使用。相反,正确的选择完全取决于具体的任务和用户的硬件约束。如果目标是以最高的精度解决复杂的微积分问题,那么可能会倾向于选择其中一个模型。如果目标是在节省电池寿命或电力的同时快速处理数百个问题,那么另一个模型则成为逻辑上的首选。这项研究提供了一种清晰、有据可查的方法来进行此类决策,使其超越了简单的准确率评分,转向对这些工具在现实世界中表现的更具实践意义的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →