HRM-Text: Efficient Pretraining Beyond Scaling
本文介绍了 HRM-Text,这是一个拥有 10 亿参数的模型,它通过结合分层循环架构、专用训练技术以及仅指令预训练,在大幅降低基础语言模型研究的计算与数据需求的同时,实现了与规模大得多的模型相媲美的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,当前的人工智能状态就像一座巨大、高速的工厂。为了制造一台“智能”机器,这些工厂将数万亿页原始文本(如同整个互联网)倒入搅拌机,并消耗价值数十亿美元的电力将其 churn 出来。结果虽然产生了一个智能模型,但这个过程如此昂贵且耗能,以至于只有少数巨头公司负担得起运营这座工厂的费用。
你分享的这篇论文,HRM-Text,提出了一种截然不同的构建这些机器的方式。他们不是建立一座庞大、蛮力的工厂,而是建造了一个小型、高效的车间,像人脑一样进行学习。
以下是他们如何实现这一点的分解说明,使用了简单的类比:
1. 大脑类比:“慢思考者”与“快执行者”
当今大多数人工智能模型就像一个人试图同时做所有事情:阅读、思考和写作,全部在一种巨大而混乱的 rush 中完成。
作者观察了人脑的工作原理。他们注意到,我们的大脑有一个额顶叶回路:一个将缓慢、战略性的思考(规划大局)与快速、执行性的思考(进行实际工作)分离开来的系统。
- 旧方式:标准的人工智能就像一名试图不停歇地跑马拉松的短跑运动员。它会感到疲惫和困惑。
- HRM-Text 方式:他们构建了一个具有两层的模型:
- "H"模块(指挥官):这是缓慢、战略性的层级。它花一点时间理解大局并设定方向。
- "L"模块(专家):这是快速、执行性的层级。它迅速处理细节,并根据指挥官的计划完善答案。
- 结果:通过将“规划”与“执行”分离,模型不会迷失在细节中。它学得更快、更高效。
2. 训练方法:停止阅读问题,开始回答问题
当前的人工智能模型是通过阅读一本书,并尝试预测书中每一个单词的下一个单词来进行训练的,包括问题本身。这就像一名学生为了考试而学习,试图逐字逐句地背诵老师的问题,而不是学习如何解决问题。
HRM-Text 改变了规则:
- “任务完成”目标:模型不再试图预测整个句子,只有在答案出错时才会受到惩罚。在训练期间,它忽略问题部分。
- "PrefixLM"技巧:想象一名学生在阅读问题。对于标准的人工智能,学生只能查看他们已经写下的单词。而对于 HRM-Text,学生被允许在写下答案之前先通读整个问题(来回查看)。这帮助他们更好地理解上下文,而无需死记硬背问题文本本身。
3. “魔法”稳定器
训练一个以循环(递归)方式“思考”的模型 notoriously 困难;这就像试图在地板震动时平衡一摞盘子。这篇论文引入了两个“稳定器”以防止这摞盘子倒塌:
- MagicNorm:把它想象成一个减震器。它确保当模型“思考”许多步骤时,计算机内部的数字不会变得过大或过小,这通常会导致学习崩溃。
- Warmup Deep Credit Assignment(预热深度信用分配):想象教一个孩子走路。你不会在第一天就要求他们跑马拉松。你从短步开始,随着他们变得强壮,你让他们迈更大的步子。HRM-Text 开始时只回顾几步以从错误中学习,随着它变得更聪明,逐渐回顾更远的步骤。这防止模型过早地因自己的历史而感到困惑。
结果:“大卫对抗歌利亚”的胜利
该论文声称,通过这些技巧,他们构建了一个10 亿参数模型(一个相对较小的人工智能),仅使用400 亿个 token(与谷歌或 Meta 等巨头使用的数万亿相比,这是一个微小的数据量)进行了训练。
- 成本:他们花费了约1,500 美元,使用 16 张显卡运行了不到两天。
- 对比:尽管这个模型微小且廉价,但其表现与那些花费数十万美元、耗时数月训练的庞大模型一样好(有时甚至更好)。
- 效率:为了获得相同的结果,标准模型需要100 到 900 倍的数据和96 到 432 倍的计算能力。
大局观
作者并不是说这就是最终完美的人工智能。他们说的是:“我们证明了这是可能的。”
他们表明,你不需要数十亿美元的预算来构建智能人工智能。通过设计像大脑一样思考的架构(慢规划 + 快执行),并训练它专注于解决问题(忽略问题文本),你可以使人工智能研究民主化。这意味着小型实验室、大学甚至个人现在都可以从头开始训练自己的基础模型,打破目前仅由最富有的公司持有的垄断。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。