← 最新论文
🤖 AI

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode

该论文介绍了 Nanbeige4.2-3B,这是一个紧凑的 3B 参数通用智能体模型,通过 Looped Transformer 架构和先进的强化学习训练在 28T token 上进行了预训练,在多种智能体基准测试中显著超越了像 Qwen3.5-9B 和 Gemma4-12B 这样规模更大的模型,同时保持了强大的推理能力。

原作者: Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang
发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机就像巨大的、超级聪明的图书馆的世界。长期以来,想要从这些图书馆中获得真正优质的答案,唯一的办法就是不断把它们建得更大、更强,往里面塞进越来越多的书(数据)和越来越多的书架(参数)。这个想法很简单:如果你想要一个天才,你需要一个巨大的大脑。但如果ed你可以打造出一个口袋大小的天才呢?这正是目前人工智能领域的一个重大课题:我们能否制造出既小巧高效,又能像那些庞大且耗能的巨兽一样解决复杂问题的 AI 模型?

为了理解这个挑战,可以将一个 AI 模型想象成一名学生。“推理型”学生擅长数学和逻辑谜题,而“智能体型(agentic)”学生则擅长实际动手做事——比如使用计算器、搜索互联网或撰写报告。通常,小个子的学生可能在一件事上很出色,但在另一件事上却表现糟糕。他们可能是数学天才却不会用电脑,或者虽然擅长点击按钮却搞不清任务背后的逻辑。这项研究的目标是看看我们是否可以训练一个单一的小型学生,使其既成为逻辑大师,又成为行动专家,而无需依赖一个巨大的大脑。

于是有了 Nanbeige4.2-3B,这是来自 Nanbeige LLM 实验室的一个新模型,它试图解开这个谜题。可以将这个模型看作是一个“紧凑型通用智能体”——一个仅有 30 亿参数的微型大脑,却拒绝被其规模所限制。研究人员发现,你并不需要通过增大模型规模来让它变得更聪明;你只需要教会它如何更高效地使用大脑。

秘诀所在:“循环”大脑

Nanbeige4.2-3B 使用的第一种技巧是一种被称为**循环 Transformer(Looped Transformer)**的巧妙架构黑科技。想象一下,标准的 AI 模型就像一条拥有 30 个工位的工厂流水线。一段数据(比如一个问题)经过第 1 个工位,然后是第 2 个、第 3 个,一直到第 30 个,任务就完成了。为了让工厂变得更聪明,通常的做法是增加更多的工位,但这会让工厂变得庞大且昂贵。

然而,Nanbeige 决定保持工厂规模不变,但让工人工作得更努力。他们没有增加新的工位,而是构建了一个“循环”。在数据流经 30 个工位一次之后,它会被送回起点,再次运行通过这相同的 30 个工位。这就像一名学生读完一段艰涩的文字后,又重新读了一遍,以捕捉第一次阅读时遗漏的细节。这种“循环”使得模型可以在不增加任何新部件的情况下,对信息进行更深层次的处理。论文指出,从头开始训练带有此循环的模型(而非仅仅是在现有模型上添加循环)是成功的关键。

训练这位“口袋天才”

构建好大脑后,他们必须对其进行教学。研究人员并没有只是向模型喂养随机的事实;他们创建了一个严苛的训练营,分为三个截然不同的阶段,非常类似于运动队的训练计划。

第一阶段:基础构建(预训练)
在学习执行任务之前,模型阅读了包含 28 万亿个 token(token 是文本的片段,如单词或单词的一部分)的海量图书馆。他们专门调整了这份阅读清单,加入了大量的数学、代码和科学内容,以确保模型拥有强大的逻辑骨架。

第二阶段:实战演练(监督微调)
接下来,他们教导模型如何真正去“做事”。他们创建了一个庞大的“轨迹(trajectories)”集合——即解决问题的逐步记录。这些不仅仅是简单的提问,而是复杂的场景,例如修复一个损坏的计算机程序、整理混乱的办公室,或使用各种不同的工具来寻找信息。

  • 策略: 他们从短小的逻辑问题(64K 上下文长度)开始,逐渐过渡到更长、更复杂的任务(最高达 256K token)。
  • 过滤器: 他们并不会接受任何答案。如果模型在一个长任务的中途犯了错,他们会教它如何恢复。他们使用了一种“损失掩码(loss mask)”,告诉模型:“嘿,你在第 3 步搞砸了,但不要忘记那里发生了什么,以便你在第 4 步进行修正。”这教会了模型具备韧性,而不仅仅是追求完美。

第三阶段:教练的哨声(强化学习)
最后,他们使用一种称为强化学习(RL)的技术来磨练模型的行为。这就像教练观察球员,通过给予加分和扣分来引导动作。

  • 制止喋喋不絮: 他们注意到模型有时会陷入循环,不断重复自己或说个不停。他们训练模型在任务完成后立即停止,使其回答更加简洁高效。
  • “长度控制”: 对于困难的数学问题,他们允许模型进行尽可能长时间的思考。但对于较简单的题目,如果模型思考太久,则会受到惩罚。这迫使模型在可以精简时保持简洁,在必要时保持周全。
  • 行动奖励: 他们会对正确使用工具的行为给予额外加分,并对重复犯错的行为进行扣分。这有助于稳定模型在处理长周期、复杂任务时的表现。

结果:小而强大

那么,这个只有 30 亿参数的小模型真的有效吗?结果表明,它的实力惊人。在测试中,面对规模大得多的模型,Nanbeige4.2-3B 不仅能抗衡,甚至经常胜出。

  • 击败巨头: 在衡量模型作为个人助手能力(处理办公任务、使用工具和编程)的测试中,Nanbeige4.2-3B 的表现优于 90 亿甚至 120 亿参数的模型。例如,在 SWE-bench Verified(一项修复软件漏洞的测试)中,它得分 63.6%,击败了 90 亿参数的 Qwen3.5(53.1%)和 120 亿参数的 Gemma4(44.2%)。
  • 推理能力: 它并未因体积小而牺牲脑力。在 GPQA-Diamond 等高难度数学和科学测试中,它得分 87.4%,高于那些更大的模型。
  • 现实应用: 当被放入名为 OpenClaw 的真实世界“个人助理”设置中时,它处理日常任务、办公流程和深度研究的能力优于更大的模型,证明了它不仅是一个实验室实验,更是一个实用的工具。

这意味着什么

论文明确反对“必须通过做大模型来使其更聪明”的观点。它表明,通过正确的架构(循环)、正确的数据(28 万亿 token 的高质量混合数据)以及正确的训练方法(阶段性强化学习),小型模型也可以实现此前认为只有大规模大脑才能实现的“智能体”能力。

然而,作者也谨慎地指出,这是针对该特定模型规模和架构的一项成就。他们并不声称这解决了所有的 AI 问题。相反,他们暗示这种方法开启了一扇新的大门:我们现在可以构建紧凑、高效的 AI 助手,让它们在个人电脑本地运行,能够处理复杂的、多步骤的工作,而无需依赖云端的超级计算机。他们认为,未来的重点或许不在于构建更大的大脑,而在于教会更小的脑如何进行“循环思考”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →