← 最新论文
🤖 machine learning

UCCI: Calibrated Uncertainty for Cost-Optimal LLM Cascade Routing

UCCI 是一个以校准优先的路由框架,它通过保序回归将令牌级不确定性映射为每个查询的误差概率,并通过约束成本最小化优化升级阈值,在保持生产环境命名实体识别任务高精度的同时,相较于现有路由基线实现了推理成本降低 31%。

原作者: Varun Kotte

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Varun Kotte

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一个繁忙的客服中心。你有两类客服代表:

  • 初级代表:速度快、成本低,擅长处理简单问题,例如“你们的营业时间是什么?”
  • 高级专家:速度慢、成本高,但能解决棘手问题,例如“我该如何修复这个复杂的漏洞?”

你的目标是通过让初级代表尽可能多地处理来电来节省成本,但你不能承担让他们搞砸难题的风险。问题在于:初级代表经常自以为知道答案,而实际上并不知道。他们可能在给出错误建议时表现得信心十足。

本文介绍了UCCI,一个智能的“交通指挥”系统,用于决定何时让初级代表处理来电,何时将其升级给高级专家。

以下是 UCCI 的工作原理,分解为简单步骤:

1. 问题:“自信陷阱”

通常,计算机试图猜测自己的自信程度。如果初级代表说“我有 90% 的把握”,系统可能会允许他们处理该来电。但在人工智能(大型语言模型)的世界里,这个"90% 的把握”往往是个谎言。它是未校准的。初级代表可能在难题上声称"90% 把握”却答错,也可能在简单问题上声称"50% 把握”却答对。

由于这些置信度数值不可靠,公司通常必须针对每项新任务手动猜测并测试(调整)规则。这就像试图驾驶一辆速度表损坏的汽车;你只能猜测自己开得有多快。

2. 解决方案:UCCI(“吐真剂”)

UCCI 通过做两件主要事情来解决这个问题:

步骤 A:校准(“吐真剂”)
在系统上线之前,UCCI 会抽取一部分问题样本,并将初级代表的回答与真实答案进行比对。它使用一种名为保序回归(Isotonic Regression)的数学工具(将其视为“真相过滤器”),将初级代表不稳定的置信度分数映射为真实的概率。

  • 校准前:初级代表说“我有 80% 的把握”。(现实:他们只有 50% 的正确率)。
  • UCCI 校准后:系统将那个"80%"转化为真实的"50% 出错概率”。
  • 结果:系统现在知道了犯错的实际风险,而不仅仅是人工智能声称的风险。

步骤 B:成本最优决策(“智能交通指挥”)
既然系统知道了实际风险,它就使用一条简单的规则:

  • 如果初级代表犯错的实际风险较低,就让他们处理(省钱!)。
  • 如果实际风险较高,就将其转交给高级专家(多花钱,但确保正确)。

系统会计算出确切的“临界点”,即超过该点后,将来电转交给高级专家就不再划算。

3. 结果:在不降低质量的前提下节省成本

作者在现实世界的任务中测试了该方法:分析照片以查找相机品牌、镜头类型和设置等细节(这项任务称为命名实体识别)。他们使用了 75,000 条真实客户查询。

  • 设置:一个小而快的人工智能模型(40 亿参数)对比一个大而慢、昂贵的人工智能模型(120 亿参数)。
  • 结果:使用 UCCI,与全程仅使用昂贵的高级模型相比,他们将这些查询的处理总成本降低了31%
  • 质量:他们保持了极高的准确率(Micro-F1 为 0.91)。
  • 对比:UCCI 显著优于其他试图猜测规则的方法(例如简单的“熵”检查或其他基于学习的路由器)。

4. 核心启示

本文认为,秘诀不在于寻找一个完美的复杂算法来猜测阈值。秘诀在于校准

如果你将嘈杂、不可靠的信号(人工智能的原始置信度)用简单的“真相过滤器”(校准)进行修正,你就能得到一个近乎完美的决策者。本文声称,一旦你拥有了校准后的分数,就不需要过度设计其余部分;你只需要选择正确的价格点来决定何时升级。

简而言之:UCCI 教会人工智能诚实地表达其不确定程度,然后利用这种诚实来为你节省大量资金,同时保持答案的正确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →