UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
本文介绍了 UniScale,这是一个在线框架,它通过使用上下文多臂老虎机将模型路由与测试时扩展统一到一个单一的自适应优化空间中,从而在大型语言模型部署中实现卓越的质量-成本权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营一家繁忙的餐厅厨房。你的目标是尽可能快速且廉价地(低计算成本)为顾客提供美味佳肴(高质量答案)。
在大型语言模型(LLM)的世界里,厨师们传统上使用两种独立的策略来管理任务:
- “菜单切换”(模型路由/Model Routing): 如果顾客点了一份简单的沙拉,你就把它交给初级厨师。如果他们点了一份复杂的十道菜盛宴,你就把它交给主厨。问题在于,你手头的厨师是固定的。你很难找到一个处理“中等难度”菜品的“中级”厨师。你要么只能得到一份简单的沙拉,要么只能得到一场盛大的宴席,中间缺乏平滑的过渡。
- “额外努力”(测试时缩放/Test-Time Scaling): 你保留同一位厨师,但要求他多思考。也许他不是只品尝一次汤,而是品尝五次;或者他在端上菜品之前,先写出三种不同的食谱。问题在于,即使是最优秀的厨师也有极限。如果菜品过于复杂,再多的思考也无法挽救,他们可能会精疲力竭(浪费大量时间和精力)。
问题所在:
长期以来,这两种策略是分开运行的。论文指出,这就像是一个经理负责决定使用哪位厨师,而另一个经理负责决定那位厨师应该如何努力工作,而这两个经理之间从未交流过。这导致了低效:你可能会把一个简单的订单发给主厨,导致他过度思考;或者把一个困难的订单发给初级厨师,导致他过早放弃。
解决方案:UNISCALE
作者介绍了一个名为 UNISCALE(统一推理缩放/Unified Inference Scaling)的新系统。你可以把它想象成一位超级智能的主厨,能够实时管理整个厨房。
UNISCALE 不仅仅是在选择厨师或努力程度,这位主厨会观察每一份订单,并即时制定一个结合了两者的定制方案:
- “这个订单有点棘手,所以让我们用那位四星级厨师,但让他检查两次工作。”
- “这个订单很简单,所以让我们用那位一星级厨师,但为了保险起见,让他复核一遍。”
- “这是一个噩梦级的订单,我们需要五星级厨师写出五个不同的版本,然后从中选出最好的一个。”
它是如何学习的(“聪明服务员”):
厨房是混乱的。订单在变,新厨师在加入,旧厨师有时也会离开。主厨无法记住每一条规则。相反,UNISCALE 扮演着一个通过实践学习的聪明服务员的角色。
- 它使用了一种名为 LinUCB 的方法(一种用于博弈和决策的数学技巧)。
- 每当它完成一道菜,它都会获得反馈:“味道好吗?”以及“成本是多少?”
- 它利用这些反馈来构建心理地图。它学到了:“对于数学题,使用 8B 模型并进行 4 次检查是最完美的,”但“对于编程,使用 14B 模型并进行 2 次检查效果更好。”
- 至关重要的是,它在探索(尝试新的组合以观察效果)与利用(使用已知行之有效的方案)之间取得了平衡。
秘密武器:
为了实现快速高效,该系统有两个特别的技巧:
- “提前退出”(路径感知早期退出/Path-Aware Early Exiting): 想象一下厨师们正在编写多个食谱。系统有一个“试吃员”(验证器),他在工作进行的过程中进行检查。如果试吃员发现某个食谱显然会做得非常糟糕,系统会立即告诉那位厨师停止工作。这节省了大量的精力和时间,因为它不会等待那个糟糕的食谱完成。
- “通用评分卡”(成本模型/Cost Model): 系统不仅仅计算“步骤”。它以一种统一的方式计算“努力程度”。它理解搬动一个重锅(内存)与切菜(计算)一样累人。这使得它能够在平等的条件下,将一个小厨师做大量工作与一个大厨师做少量工作进行比较。
结果:
论文在数学问题(如 AIME 考试)上测试了这个系统。
- 更好的平衡: UNISCALE 找到了每个问题的“甜点位”。它不仅仅是选择了最大的模型或最高的努力程度,它找到了完美的结合。
- 更平滑的曲线: UNISCALE 没有在“廉价但差”和“昂贵但好”之间产生跳跃,而是创造了一条平滑的曲线——你可以通过投入略微增加的成本来获得略微提升的答案,一直上升到最高水平。
- 适应性: 当“厨房”发生变化时(例如,一位厨师离开了,或者订单类型发生了变化),UNISCALE 能迅速找到新的最佳策略,而旧系统则会陷入停滞或犯错。
总结:
UNISCALE 就像是一位管弦乐团的顶级指挥家。它不仅仅是在决定使用更响亮的乐器(更大的模型)或要求乐手演奏得更快(更多的努力),它还在实时聆听音乐的同时,动态地决定由哪位乐手演奏哪部分内容,以及他们要如何演奏,同时在任何乐手奏错音符时及时制止。这带来了一场精彩的演出(高质量),同时消耗了最少的能量(低成本)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。