← 最新论文
🤖 AI

When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems

本文介绍了一种贝叶斯统计框架,该框架通过将自动化指标与人工判断进行校准,从而在底层模型达到生命周期终点时,实现基于大语言模型的生产系统向新系统的自信、高效且可复现的迁移,并在一个服务数百万用户的商业问答平台上进行了验证。

原作者: Emma Casey, David Roberts, David Sim, Ian Beaver

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Emma Casey, David Roberts, David Sim, Ian Beaver

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一个庞大且高科技的客户服务呼叫中心。多年来,你的客服人员一直依赖一位特定、超智能的数字助手(人工智能)来协助回答客户问题。这位助手表现卓越,已成为你业务的支柱。但突然,开发该助手的公司宣布:“下个月我们将退役此模型。它已达到‘生命周期终点’。”

你面临一个问题:你需要立即更换一位新助手,但不能随意挑选。如果选错了,你的客服人员可能会给出错误答案、显得粗鲁,或回复时间过长,从而导致客户愤怒。

本文是 Verint 公司撰写的一份指南,介绍如何在避免混乱的情况下,将旧数字助手替换为新助手。以下是他们做法的简明解释:

1. 问题:“黑盒”替换

通常,更换软件时只需执行检查清单即可。但人工智能的情况更为复杂。旧人工智能与新人工智能可能使用不同的“语言”,或对指令的解读方式不同。

  • 陷阱:你不能仅仅问新人工智能:“你更优秀吗?”因为它可能会撒谎或感到困惑。
  • 挑战:你有成千上万条客户问题需要核查,但没有足够的人力去阅读每一条答案以判断其质量。

2. 解决方案:“校准秤”

作者创建了一个框架(即分步方案)来解决这一问题。这就像在称量黄金之前先校准秤一样。

步骤 A:“人工抽查”(校准)
他们并未完全信任计算机对答案的评分,而是首先邀请一小群人,对旧人工智能和新人工智能生成的少量答案样本进行评分。

  • 他们将人工评分结果与计算机自动评分工具的结果进行对比。
  • 类比:想象你有一台新型高科技体重秤。你站上去,它显示你的体重为 200 磅。但你知道这是错误的,因为你昨天用一台可靠的秤称过,显示为 180 磅。于是你意识到,这台新秤“偏差”了 20 磅。现在你可以使用这台新秤,但必须从每次读数中减去 20 磅才能得到真实体重。
  • 论文方法:他们采用了一种统计方法(贝叶斯分析),精确计算出计算机评分工具“偏差”的程度,并据此调整预期。这使得他们能够信任计算机对剩余成千上万条问题的评分,因为他们已校正了计算机的偏差。

步骤 B:“风格警察”
人工智能不仅要回答正确,还必须听起来专业。

  • 团队设置了简单的“触发器”。如果人工智能说出诸如“根据我的消息来源”或“基于所提供的信息”等短语,就会被标记为“风格不佳”。
  • 他们还检查人工智能是否过于啰嗦(字数过多)或过于生硬(字数过少)。

步骤 C:“拒绝”测试
有时,人工智能应该说“我不知道”,而不是编造答案。

  • 团队核查:新人工智能在“应该”说“我不知道”时是否这样做了?它是否在自信地撒谎?或者它是否在实际上“知道”答案时却说“我不知道”?他们需要新人工智能拒绝回答的频率与旧人工智能保持一致。

3. 实验:“味觉测试”

他们将此框架应用于其真实系统,该系统每月处理 530 万次聊天。

  • 候选者:他们列出了来自亚马逊、谷歌、Anthropic 等公司的 10 种不同人工智能模型,以考察谁能胜任这项工作。
  • 淘汰轮次
    • 某些模型甚至无法遵循基本的格式要求(例如以特定代码格式书写),因此被立即淘汰。
    • 某些模型速度太慢(如同蜗牛与兔子相比)。
    • 某些模型成本过高。
    • 某些模型“过于诚实”(过于频繁地说“我不知道”),这令系统感到困扰。
  • 决赛选手:经过“校准秤”和“风格警察”检查后,他们最终锁定两位强劲竞争者:Nova 2 LiteQwen3-32B

4. 转折:“微调指令”

选定获胜者后,他们提出一个问题:“能否通过重写给予人工智能的指令,让它们表现得更好?”

  • 他们尝试使用高级工具自动重写提示(即给予人工智能的指令)。
  • 结果:令人惊讶的是,他们为旧人工智能编写的原始指令,在新人工智能上几乎完美适用。那些花哨的自动调整并未带来太大帮助。这就像试图调谐一台已经清晰无比的收音机;任何调整反而只会让杂音更严重。

5. 结论

论文总结道:当你的人工智能模型被“退役”时,无需惊慌。

  • 核心启示:如果你采用“校准”方法,就可以自信地更换模型。不要盲目信任计算机的自动评分;应首先用少量人工评分进行校验。
  • 成果:他们成功将系统迁移至一个新模型,该模型速度更快、成本更低,且质量与旧模型相当,而无需花费数月时间人工核查每一条答案。

简而言之,他们构建了一个科学过滤器,使公司能够快速、安全地更换其人工智能“大脑”,确保新大脑与旧大脑一样聪明、礼貌,而无需庞大的真人评分团队去核查每一条思路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →