Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode
该论文介绍了 Nanbeige4.2-3B,这是一个紧凑的 3B 参数通用智能体模型,通过 Looped Transformer 架构和先进的强化学习训练在 28T token 上进行了预训练,在多种智能体基准测试中显著超越了像 Qwen3.5-9B 和 Gemma4-12B 这样规模更大的模型,同时保持了强大的推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机就像巨大的、超级聪明的图书馆的世界。长期以来,想要从这些图书馆中获得真正优质的答案,唯一的办法就是不断把它们建得更大、更强,往里面塞进越来越多的书(数据)和越来越多的书架(参数)。这个想法很简单:如果你想要一个天才,你需要一个巨大的大脑。但如果ed你可以打造出一个口袋大小的天才呢?这正是目前人工智能领域的一个重大课题:我们能否制造出既小巧高效,又能像那些庞大且耗能的巨兽一样解决复杂问题的 AI 模型?
为了理解这个挑战,可以将一个 AI 模型想象成一名学生。“推理型”学生擅长数学和逻辑谜题,而“智能体型(agentic)”学生则擅长实际动手做事——比如使用计算器、搜索互联网或撰写报告。通常,小个子的学生可能在一件事上很出色,但在另一件事上却表现糟糕。他们可能是数学天才却不会用电脑,或者虽然擅长点击按钮却搞不清任务背后的逻辑。这项研究的目标是看看我们是否可以训练一个单一的小型学生,使其既成为逻辑大师,又成为行动专家,而无需依赖一个巨大的大脑。
于是有了 Nanbeige4.2-3B,这是来自 Nanbeige LLM 实验室的一个新模型,它试图解开这个谜题。可以将这个模型看作是一个“紧凑型通用智能体”——一个仅有 30 亿参数的微型大脑,却拒绝被其规模所限制。研究人员发现,你并不需要通过增大模型规模来让它变得更聪明;你只需要教会它如何更高效地使用大脑。
秘诀所在:“循环”大脑
Nanbeige4.2-3B 使用的第一种技巧是一种被称为**循环 Transformer(Looped Transformer)**的巧妙架构黑科技。想象一下,标准的 AI 模型就像一条拥有 30 个工位的工厂流水线。一段数据(比如一个问题)经过第 1 个工位,然后是第 2 个、第 3 个,一直到第 30 个,任务就完成了。为了让工厂变得更聪明,通常的做法是增加更多的工位,但这会让工厂变得庞大且昂贵。
然而,Nanbeige 决定保持工厂规模不变,但让工人工作得更努力。他们没有增加新的工位,而是构建了一个“循环”。在数据流经 30 个工位一次之后,它会被送回起点,再次运行通过这相同的 30 个工位。这就像一名学生读完一段艰涩的文字后,又重新读了一遍,以捕捉第一次阅读时遗漏的细节。这种“循环”使得模型可以在不增加任何新部件的情况下,对信息进行更深层次的处理。论文指出,从头开始训练带有此循环的模型(而非仅仅是在现有模型上添加循环)是成功的关键。
训练这位“口袋天才”
构建好大脑后,他们必须对其进行教学。研究人员并没有只是向模型喂养随机的事实;他们创建了一个严苛的训练营,分为三个截然不同的阶段,非常类似于运动队的训练计划。
第一阶段:基础构建(预训练)
在学习执行任务之前,模型阅读了包含 28 万亿个 token(token 是文本的片段,如单词或单词的一部分)的海量图书馆。他们专门调整了这份阅读清单,加入了大量的数学、代码和科学内容,以确保模型拥有强大的逻辑骨架。
第二阶段:实战演练(监督微调)
接下来,他们教导模型如何真正去“做事”。他们创建了一个庞大的“轨迹(trajectories)”集合——即解决问题的逐步记录。这些不仅仅是简单的提问,而是复杂的场景,例如修复一个损坏的计算机程序、整理混乱的办公室,或使用各种不同的工具来寻找信息。
- 策略: 他们从短小的逻辑问题(64K 上下文长度)开始,逐渐过渡到更长、更复杂的任务(最高达 256K token)。
- 过滤器: 他们并不会接受任何答案。如果模型在一个长任务的中途犯了错,他们会教它如何恢复。他们使用了一种“损失掩码(loss mask)”,告诉模型:“嘿,你在第 3 步搞砸了,但不要忘记那里发生了什么,以便你在第 4 步进行修正。”这教会了模型具备韧性,而不仅仅是追求完美。
第三阶段:教练的哨声(强化学习)
最后,他们使用一种称为强化学习(RL)的技术来磨练模型的行为。这就像教练观察球员,通过给予加分和扣分来引导动作。
- 制止喋喋不絮: 他们注意到模型有时会陷入循环,不断重复自己或说个不停。他们训练模型在任务完成后立即停止,使其回答更加简洁高效。
- “长度控制”: 对于困难的数学问题,他们允许模型进行尽可能长时间的思考。但对于较简单的题目,如果模型思考太久,则会受到惩罚。这迫使模型在可以精简时保持简洁,在必要时保持周全。
- 行动奖励: 他们会对正确使用工具的行为给予额外加分,并对重复犯错的行为进行扣分。这有助于稳定模型在处理长周期、复杂任务时的表现。
结果:小而强大
那么,这个只有 30 亿参数的小模型真的有效吗?结果表明,它的实力惊人。在测试中,面对规模大得多的模型,Nanbeige4.2-3B 不仅能抗衡,甚至经常胜出。
- 击败巨头: 在衡量模型作为个人助手能力(处理办公任务、使用工具和编程)的测试中,Nanbeige4.2-3B 的表现优于 90 亿甚至 120 亿参数的模型。例如,在 SWE-bench Verified(一项修复软件漏洞的测试)中,它得分 63.6%,击败了 90 亿参数的 Qwen3.5(53.1%)和 120 亿参数的 Gemma4(44.2%)。
- 推理能力: 它并未因体积小而牺牲脑力。在 GPQA-Diamond 等高难度数学和科学测试中,它得分 87.4%,高于那些更大的模型。
- 现实应用: 当被放入名为 OpenClaw 的真实世界“个人助理”设置中时,它处理日常任务、办公流程和深度研究的能力优于更大的模型,证明了它不仅是一个实验室实验,更是一个实用的工具。
这意味着什么
论文明确反对“必须通过做大模型来使其更聪明”的观点。它表明,通过正确的架构(循环)、正确的数据(28 万亿 token 的高质量混合数据)以及正确的训练方法(阶段性强化学习),小型模型也可以实现此前认为只有大规模大脑才能实现的“智能体”能力。
然而,作者也谨慎地指出,这是针对该特定模型规模和架构的一项成就。他们并不声称这解决了所有的 AI 问题。相反,他们暗示这种方法开启了一扇新的大门:我们现在可以构建紧凑、高效的 AI 助手,让它们在个人电脑本地运行,能够处理复杂的、多步骤的工作,而无需依赖云端的超级计算机。他们认为,未来的重点或许不在于构建更大的大脑,而在于教会更小的脑如何进行“循环思考”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。