← 最新论文
💻 computer science

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

本文介绍了 RouteJudge,这是一个通过基于用户偏好的成对比较来评估大语言模型(LLM)路由策略的开放式在线平台,并附带了 ORBIT,一个用于标准化路由算法开发、基准测试和集成的模块化工具箱。

原作者: Guannan Lai, Haoran Hu, Han-Jia Ye

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Guannan Lai, Haoran Hu, Han-Jia Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营一家规模宏大、高科技的餐厅。你拥有一个庞大的厨房,里面雇佣了各种不同技能水平的厨师:有些人动作极快但只能做简单的菜肴;而另一些人则是动作缓慢、价格昂贵的天才,能够烹饪复杂的杰作。

问题所在:“一刀切”的错误
过去,当人们想要使用人工智能(如大语言模型)时,往往会对每一个订单都选择那位“最强”的厨师(即最强大的 AI)。但这是一种浪费。如果顾客只想吃个快速三明治,把他们送到那个昂贵且缓慢的天才厨师那里,就是在浪费金钱和时间。如果他们想要一顿复杂的十道菜大餐,那快速厨师可能会失败。

这就是 LLM 路由(LLM Routing) 的作用。它就像一位聪明的领班,会观察顾客的订单并做出决定:“好吧,对于这个简单的请求,把它交给快速厨师。对于这个困难的请求,把它交给天才。”

旧的测试方法:“标准答案”陷阱
直到现在,科学家们一直使用僵化的标准答案来测试这些“聪明的领班”。他们给领班一个问题,看领班选择了哪位厨师,然后检查该厨师的答案是否与预先写好的“正确”答案相符。

  • 缺陷: 现实生活并不是一场多项选择题考试。有时,一个问题可能有许多种“正确”的回答方式。有人可能想要简短幽默的回答,而另一个人可能想要冗长严肃的回答。旧的测试方法无法判断领班是否真的选择了那个顾客最喜欢的方案。

新的解决方案:RouteJudge
作者引入了 RouteJudge,它就像是一个现场举办的露天美食节。

  • 运作方式: RouteJudge 不再对照僵化的标准答案,而是让真实的人去品尝食物。
  • 设置: 当顾客提出一个问题时,几种不同的“聪明领班”(路由策略)会各自给出自己的推荐。
  • 品鉴测试: 系统取出两个最好的推荐,隐藏掉厨师和领班的名字,然后询问顾客:“您更喜欢这两道菜中的哪一个?”
  • 评分: 如果顾客喜欢这道菜,系统就会把功劳归于推荐了那位厨师的领班。这不在于谁做出了“完美”的答案,而在于谁做出了人类真正偏好的选择。

工具箱:ORBIT
构建这些聪明的领班非常困难,因为每个人的构建方式都不同。为了解决这个问题,作者还创建了 ORBIT(最优路由与预算推理工具箱)。

  • 类比: 把 ORBIT 想象成一个标准化的“厨房套装”或一本通用的食谱。它为每位研究人员提供了相同的量杯、相同的食材清单以及相同的烹饪说明。
  • 重要性: 这确保了当研究人员构建一个新的“聪明领班”时,他们都在遵循相同的规则。这使得他们可以轻松地在厨房(离线)中测试新的领班,然后将他们送到美食节(RouteJudge)去观察真实顾客的反应。

他们的发现(快照)
这篇论文展示了这一新系统的早期结果:

  1. 离线 vs. 在线: 一个在厨房里表现出色(通过纸面测试)的领班,并不总是在美食节上获胜。有时,人类实际更偏好的简单、廉价的策略,竟然击败了复杂且昂贵的策略。
  2. 成本很重要: 系统表明,最好的厨师并不总是最贵的那个。最聪明的领班是那个能在成本、速度和顾客真实需求之间取得平衡的人。

总结
这篇论文为测试 AI 管理员建立了一种新方法。它不再问“他们是否选对了答案?”,而是问“他们是否选了人类真正喜欢的答案?”它提供了一个标准化的工具包(ORBIT)来构建这些管理者,并提供了一个实时平台(RouteJudge)来根据真实的人类偏好对他们进行测试,从而确保人工智能在现实世界中被高效且有效地利用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →