← 最新论文
🤖 machine learning

Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

Star Elastic 是一种新颖的训后方法,它通过单次训练运行,从单一父模型高效生成多个嵌套推理子模型,从而实现动态的、阶段特定的预算控制,与独立训练或压缩基线相比,在显著降低训练成本的同时改善了精度与延迟之间的权衡。

原作者: Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan, Sharath Turuvekere Sreenivas, Aditya Vavre, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Sheldon Liang, Marcin Chochowski, Zijia Chen, Akhiad Bercovich
发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan, Sharath Turuvekere Sreenivas, Aditya Vavre, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Sheldon Liang, Marcin Chochowski, Zijia Chen, Akhiad Bercovich, Ran Zilberstein, Ran El-Yaniv, Yonatan Geifman, Daniel Korzekwa, Yoshi Suhara, Oluwatobi Olabiyi, Ashwath Aithal, Nima Tajbakhsh, Pavlo Molchanov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一间专为大规模人群烹制美食而设计的宏大高端厨房。这间厨房就是你的大型语言模型(LLM)

传统上,如果你要举办小型家庭晚餐、中型聚会和大型宴会,你需要建造三间完全独立的厨房。你必须购买三套烤箱,雇佣三组不同的厨师团队,并支付三个独立的建设项目费用。这极其昂贵且浪费。

Star Elastic 是一项改变游戏规则的新发明。它不再建造三间厨房,而是建造一间超级灵活的厨房,能够瞬间自我调整以适应任何需求。

以下是其工作原理,分解为简单的概念:

1. “一间厨房,多种尺寸”的诀窍

通常,为了获得更小、更便宜的 AI 模型,研究人员必须先训练一个巨型模型,然后尝试通过切除部分(如修剪树木)来“缩小”它。这既缓慢又昂贵,而且往往导致模型的智能程度不如从头训练出来的模型。

Star Elastic 的做法不同。它采用一个巨大的“父”模型(Nemotron Nano v3),并教会它一项特殊技能:如何同时具备多种不同的尺寸。

  • 这就像俄罗斯套娃(Matryoshka)。在这个 300 亿参数的巨大娃娃内部,有一个完美的 230 亿参数娃娃,而在这个娃娃内部,又有一个完美的 120 亿参数娃娃。
  • 它们都生活在同一个“房子”里(同一个计算机文件)。你不需要下载三个不同的文件;只需打开那个大文件,然后告诉它:“我今天只需要小版本。”

2. “智能路由器”(厨房经理)

模型如何知道该使用哪些部分?它使用一个可学习的路由器

  • 想象一位厨房经理正在查看你的订单。
  • 如果你点一份简单的沙拉(简单的问题),经理会说:“好的,我们只用小型搅拌机和基础刀具套装。”
  • 如果你点一份复杂的舒芙蕾(难的数学问题),经理会说:“我们需要大烤箱、重型搅拌机以及所有厨师!”
  • 论文表明,这位经理经过训练,能够确切知道“厨房”的哪些部分最重要。它为小版本保留最佳工具,仅在需要大版本时才添加额外的重型工具。

3. “思考与回答”策略

这是论文中最巧妙的技巧,称为弹性预算控制

  • 当 AI 解决难题时,它通常做两件事:思考(推理步骤)和回答(撰写最终结果)。
  • 旧方法:AI 在思考和回答时使用相同的“大脑尺寸”。这就像用一辆巨大的、耗油的卡车去杂货店,然后再去邮局,即使邮局就在街对面。
  • Star Elastic 方法:AI 可以切换档位!
    • 第一阶段(思考):它使用更小、更快的模型来头脑风暴并思考问题。这既便宜又快速。
    • 第二阶段(回答):一旦思考完成,它就切换到更大、更智能的模型来撰写最终答案。这确保了答案的完美。
  • 结果:你获得了巨型大脑的准确性,同时享受了小型大脑的速度和成本。论文声称,与使用单一固定尺寸相比,这能使 AI 的准确率提高16%,速度提升1.9 倍

4. “魔法切片”(零样本提取)

通常,如果你想要一个更小的模型,你必须训练它数月。有了 Star Elastic,“切片”是瞬间完成的。

  • 因为该模型从一开始就被训练为具有灵活性,你可以**零样本(zero-shot)**地“切下”小版本或中版本。
  • 这意味着你不需要重新训练它们。你只需取出大文件,应用“切割”,砰——你就立即拥有了一个可用的、高质量的小模型。
  • 论文声称,与从头构建模型相比,这节省了360 倍的训练成本;与之前的压缩方法相比,节省了7 倍的成本。

5. “小行李箱”(量化)

最后,论文讨论了如何将这些模型进一步缩小,以便在手机或小型计算机上运行。

  • 他们使用了一种称为量化感知蒸馏的技术。想象一下,将一幅沉重的高清画作转化为一个占用空间极小但仍完美呈现的数字文件。
  • 他们创建了适配4 位8 位格式(非常小的数字足迹)的模型版本。
  • 即使在这些微小的格式中,“俄罗斯套娃”技巧仍然有效。你仍然可以从一个微小的文件中切分出小型、中型和大型版本。

胜利总结

  • 成本:你只需训练一次,就能获得多个模型。这就像购买一张主题公园门票,可以乘坐所有过山车,而不是为每个游乐设施单独购票。
  • 速度:通过使用小大脑进行思考,大大脑进行回答,你节省了时间和金钱。
  • 存储:你只需存储一个文件,即可访问三种不同尺寸的模型。

简而言之,Star Elastic 阻止了我们为每项工作构建独立、僵化的 AI 模型。相反,它构建了一个变色龙般的 AI,能够瞬间改变其尺寸和算力以适应任务,在节省巨额资金和时间的同时,实际上变得更智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →