← 最新论文
🤖 machine learning

ParetoBandit: Budget-Paced Adaptive Routing for Non-Stationary LLM Serving

ParetoBandit 是一种基于成本感知上下文多臂老虎机的开源自适应路由系统,它通过在线原对偶预算控制、几何遗忘机制和热插拔注册表,首次实现了在动态非平稳环境下对大语言模型组合的实时预算约束、价格与质量波动自适应以及运行时模型无缝集成。

原作者: Annette Taberner-Miller

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Annette Taberner-Miller

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ParetoBandit 的新系统,它的核心任务可以比作是一个超级智能的“餐厅点餐经理”

想象一下,你开了一家大餐厅(这就是生产环境中的大模型服务),菜单上有几十种不同的菜品(不同的 AI 模型)。

  • 有的菜便宜但味道一般(便宜的小模型);
  • 有的菜贵但味道顶级(昂贵的大模型);
  • 有时候,厨师(模型提供商)会突然把某道菜的价格减半,或者悄悄把某道菜的配方改差了(模型质量下降或价格波动)。

传统的点餐经理(现有的路由系统)通常很死板:要么只点最贵的,要么只点最便宜的,或者根据一张死板的菜单表来点。一旦市场变了(价格变了、菜不好吃了),他们就会反应迟钝,导致要么花冤枉钱,要么吃到难吃的菜。

ParetoBandit 就是那个能“见风使舵”、精打细算的超级经理。 它不仅能实时调整策略,还能严格控制在你的总预算内。

下面我用三个生动的比喻来解释它是如何工作的:

1. 像“自动巡航的油门”一样控制预算

(预算节律控制 Budget-Paced Adaptive Routing)

  • 痛点: 以前,如果你想控制每顿饭平均花 50 元,系统可能一开始花 100 元,后面再想办法省回来,结果总账超了。或者它根本不知道今天菜价涨了,还在按昨天的价格点菜。
  • ParetoBandit 的做法: 它像一个智能油门
    • 它设定了一个“每单最高花费”的天花板(比如每请求不能超过 0.005 美元)。
    • 它有一个实时仪表盘:如果刚才几单花多了,它就立刻把“油门”踩下去,强制只点便宜菜;如果刚才几单花少了,它就松开油门,允许点一些更贵的菜来提升体验。
    • 关键点: 这种调整是闭环的,就像自动驾驶汽车一样,时刻感知路况(花费),自动微调,确保你永远不会超速(超预算)。

2. 像“拥有记忆橡皮擦”的厨师

(非平稳适应 Non-Stationary Adaptation)

  • 痛点: 假设“米其林三星”厨师突然把招牌菜做得很难吃(模型质量静默下降),但他没告诉你。传统的经理因为记得“这道菜以前很好吃”,会一直点,直到你投诉。
  • ParetoBandit 的做法: 它有一个**“记忆橡皮擦”**(几何遗忘机制)。
    • 它不会死记硬背所有历史数据。它认为最近的数据最重要,很久以前的数据会逐渐变淡(被擦除)。
    • 如果某道菜突然变难吃了,经理在尝了几次后,发现“最近的味道不对”,它就会迅速把这道菜从推荐名单里踢出去,转而尝试别的。
    • 如果某道菜突然降价了,它也能立刻发现:“哇,现在这个价格太划算了!”于是立刻增加点单量。
    • 这种机制让它能快速适应变化,而不是被过去的经验拖后腿。

3. 像“试吃员”的新品引进

(运行时组合管理 Runtime Portfolio Management)

  • 痛点: 餐厅要上新菜(新模型),但不知道好不好吃。如果直接全量推广,万一很难吃就砸了招牌;如果不敢试,又可能错过爆款。
  • ParetoBandit 的做法: 它有一套科学的“试吃”流程
    • 当新模型加入时,它会强制给这个新模型几个“试吃机会”(强制探索)。
    • 在试吃期间,它会严格监控:如果新菜又贵又难吃,直接拉黑;如果新菜便宜又好吃,就慢慢增加点单量。
    • 最厉害的是,它不会盲目跟风。如果新模型很贵但质量一般,预算管理器会直接把它“关在门外”,直到证明它物有所值。

它的实际表现如何?

论文通过大量实验证明了这个“超级经理”有多强:

  1. 省钱又好吃: 在 1800 多次测试中,它几乎完美地控制了预算(从未超过目标太多),同时还能根据预算灵活地在“便宜菜”和“豪华菜”之间切换,达到了性价比的极致(帕累托最优)。
  2. 反应神速: 当某道菜价格突然减半,它能立刻抓住机会提升整体质量;当某道菜质量突然变差,它能立刻发现并停止点单,且不会超支。
  3. 速度极快: 做这个决策只需要 0.00002 秒(22.5 微秒)。这比 AI 生成回答的时间(通常几秒)要快几十万倍,完全不会让用户感觉到卡顿。

总结

ParetoBandit 就像是一个既懂数学、又懂市场、还特别守规矩的 AI 管家

它解决了大模型服务中最大的难题:如何在价格和质量不断变化的世界里,既保证用户体验(质量好),又严格控制成本(不超支),还能随时应对突发状况(新模型、价格战、质量下滑)。

对于任何需要调用多个 AI 模型的企业来说,这就像是从“人工记账”升级到了“全自动智能财务系统”,让每一分钱都花在刀刃上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →