← 最新论文
💬 NLP

Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

Daedalus-150M 是一款专门为高效 CPU 推理而设计的轻量级语言模型,通过将其三分之二的注意力层替换为固定宽度的卷积层,实现了在长上下文场景下卓越的速度与压缩率,同时其性能超越了在显著更多 Token 上训练的数据密集型大型模型。

原作者: Christos Koutsiaris

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Christos Koutsiaris

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

如今大多数使用人工智能的人,所交互的系统都运行在为大型数据中心设计的强大且专门的计算机芯片上。这些系统旨在同时处理数千个请求,这一过程使得它们能够将沉重的计算成本分摊给众多用户。但对于使用标准笔记本电脑或台式机的个人用户来说,效率的规则完全改变了。在个人机器上,计算机无法依赖大规模并行处理;相反,它受限于将数据从内存移动到处理器的速度。每当计算机生成句子中的一个新词时,它都必须重新阅读整个对话的历史记录,以理解上下文。随着对话变得越来越长,这种“重新阅读”变成了一项沉重的税收,显著减慢了系统的速度。研究人员面临的挑战是,构建一种既能很好地理解语言,又不会在普通硬件上运行时被这种不断增长的记忆负担所拖累的模型。

一位研究人员通过设计一种名为 Daedalus-150M 的新型语言模型来解决这个问题,该模型专门针对标准计算机处理器上的单用户设计。他们并没有尝试将一个庞大复杂的模型缩小,而是从用户机器的约束条件出发,从底层开始构建架构以实现适配。结果是一个表现得像混合动力引擎的系统。它结合了两种不同的信息处理方式:一种是记住整个对话历史的传统方法,另一种是仅记住最后几个瞬间的新型、更简单的方法。在这种设计中,模型拥有十八层处理层。其中六层使用传统方法来维持对长期上下文的深度理解,而另外十二层则使用一种仅回溯两步的短期记忆技术。这意味着在计算机思考的两个三分之二的时间里,它不需要重新阅读整个对话历史,而只需关注紧接的过去。

研究人员将这种设计与一个几乎完全相同的模型进行了测试,后者在所有十八层中都使用了传统的、耗费内存的方法。这两个模型都在大约六百亿个单词的数据量上进行了训练,并且都被压缩到了较小的规模以便在标准计算机上运行。这次对比是非常严格且预先设定的:研究人员在看到结果之前,就已经精确决定了什么才算作胜利。混合模型在回答问题和完成任务的能力上与传统模型持平,但在速度方面表现得明显更好。当对话较短时,两个模型的运行速度相近。然而,随着对话变长,传统模型因为需要阅读越来越多的历史记录而显著变慢。相比之下,混合模型则保持了更加稳定的节奏。在对话长度达到两千个单词时,混合模型生成文本的速度几乎是其传统对手的两倍。

这种速度优势不仅仅是一个理论上的计算;它是直接在标准计算机处理器上测量的。研究人员发现,混合模型通过避免重新阅读整个历史记录,节省了大量的数据移动,而这正是这些机器的主要瓶颈。虽然对数据规模的简单计算表明混合模型应该只快一点点,但实际的性能差距要大得多。这是因为传统方法涉及依赖于整个历史记录的复杂、逐步计算,这些计算在单个处理器上执行起来非常缓慢。混合方法通过保持其大部分记忆状态既小又固定,从而完全避开了这些缓慢的步骤。此外,该模型的体积也更小,在硬盘上占用的空间减少了约百分之六,这对于存储空间有限的用户来说是一个实用的好处。

尽管取得了这些成功,研究人员仍谨慎地报告了哪些方面并未完美运作。他们发现,模型中短期记忆部分的约一半通道最终处于闲置状态,本质上是在无所事事。他们还发现,该模型使用的词汇量对于其规模而言过大,浪费了一些容量。此外,当他们尝试专门针对用于提速的压缩数据格式进行训练时,过程失败了,这意味着模型必须在训练后进行压缩,这略微降低了其准确性。这些属于工程问题而非设计的根本缺陷,研究人员指出,未来的版本可以通过调整模型的启动方式和压缩方式来解决这些问题。

最终结果表明,这种特定的设计选择——将长期记忆与短期记忆相结合——完全达到了针对目标环境的设计初衷。该模型在一套由五个标准语言测试组成的测试集中,得分高于其他同等规模且训练数据量为三到六倍的模型。它甚至超越了一个经过一万亿词训练的模型,尽管一个规模更大的模型在原始智能方面仍略占优势。核心启示在于,对于使用标准计算机的单用户而言,构建语言模型最高效的方式不是使其尽可能聪明,而是使其在内存占用上尽可能轻量。通过接受模型不需要为每一步都重新阅读整个对话这一事实,研究人员创造了一个即使在对话增长时也能让人感到响应迅速且高效的系统,证明了不同的架构方法可以解决日常计算中的特定问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →