Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
该论文介绍了 Intern-S2-Mobius,这是一种将知识存储在共享记忆模块中的过程与在专用推理器中进行迭代组合推理的过程相解耦的基础模型架构,在实现与 Transformer 基准模型相当的性能的同时,显著减少了训练数据量并提升了近 4 倍的推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为机器人构建一个终极大脑。在过去的十年里,我们构建的最强大的大脑都是基于一种被称为“Transformer”的设计。把 Transformer 想象成一座巨大的、多层结构的图书馆,每一本书(知识)都被锁在特定楼层的特定房间里。为了找到一个事实,机器人必须逐个房间、逐层爬楼梯,检查每个房间里的每一本书,直到找到它需要的内容。这种方式虽然有效,但速度很慢,而且机器人每次移动时都必须带着整座图书馆。科学家们一直试图通过仅仅扩大图书馆规模、增加书籍数量来让这些大脑变得更聪明,但他们正撞上一堵墙:机器人的运行成本变得越来越高,而且它们有时为了寻找一个简单的答案而变得喋喋不休。现在的关键问题是:我们能否重新设计大脑本身,让它不必背负整座图书馆,却仍能更快、更聪明地找到答案?
这正是上海人工智能实验室的 Intern-S2-Mobius 团队通过他们的新论文所提出的方案。他们引入了一种名为 Mobius 的新架构,试图通过将大脑拆分为两个截然不同的部分来解决这个问题:一个巨大的、共享的“知识仓库”和一个“推理工作者”团队。Mobius 不再将知识锁在多层建筑的房间里,而是将所有知识放入一个所有工作者都可以即时访问的庞大共享数据库中。这些工作者(被称为推理者)不仅仅是读完一本书就结束;他们可以在仓库和自身之间来回跳跃,向仓库询问特定的事实,思考这些事实,并在开口说话之前在一个持续的循环中不断完善他们的答案。
该论文指出,这种“解耦”设计是一个游戏规则的改变者。在实验中,他们发现 Mobius 模型仅使用 6_2.6% 的训练数据就能达到与传统 Transformer 相当的学习效果。更令人印象深刻的是,当他们将一个拥有 350 亿参数的大型模型升级为使用 Mobius 设计时,它不仅能跟上旧式设计的步伐,而且给出答案的速度快了近 4 倍。其秘诀似乎在于 Mobius 阻止了机器人在思考时大声喋喋不休。与其生成一段冗长的、词藻堆砌的思维链(例如“步骤 1,步骤 2,步骤 3……”),Mobius 模型是在一个隐藏的、沉默的空间内进行重度运算,不断完善其想法,直到准备好吐出一个简短且完美的答案。
然而,作者也谨慎地指出,这还不是解决所有问题的万灵药。他们表示,虽然这种设计在效率和速度方面表现出色,但未来可能需要新的硬件才能使其完美运行,并且目前仍在测试其是否真的能够实现自我“进化”或对连续物理世界进行建模。但就目前而言,研究结果展示了一条充满希望的路径:通过将我们“知道什么”与我们“如何思考”分离,我们或许终于可以构建出既极其聪明又出奇高效的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。