← 最新论文
💬 NLP

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

本文介绍了一个由 Nubank 开发的统一、评估驱动型框架,该框架整合了结构化上下文工程、人机协同迭代以及严格的 LLM 评判评估,成功地在五个领域为超过 1 亿用户部署了生产级客户支持 AI 智能体,在显著提升满意度和自助服务率的同时,证明了离线指标与在线影响之间存在强相关性。

原作者: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你经营着一家拥有 1 亿客户的大型银行。每天,都有数百万人打电话或通过聊天咨询类似的问题,比如:“我的信用卡在哪儿?”或者“为什么我欠了这么多钱?”

在过去,你需要一支庞大的真人客服团队来回答这些问题。但现在,你想构建一个超级智能的 AI 机器人来处理这些对话。问题在于:如果机器人给出了错误的答案,客户会感到愤怒、失去信任并离开。你不能仅仅靠“猜测”来判断机器人的表现是否良好;在让它与真实人类交谈之前,你需要 100% 确定它的表现。

这篇论文是来自 Nubank(一家巨型银行)关于如何安全且成功地构建这些 AI 机器人的蓝图。以下是他们是如何做的,用简单的语言解释如下:

1. 问题所在:在没有碰撞测试的情况下制造汽车

通常,当人们构建 AI 时,他们编写指令,进行少量测试,然后听天由命。作者说,这就像造了一辆车,然后直接把它开下悬崖,以此来测试安全气囊是否起作用。在客户支持领域,一次“碰撞”的代价实在太高了。

他们需要一种方法,在让机器人与哪怕一个真实人类交谈之前,先在“模拟器”中对其进行数千次的测试。

2. 解决方案:“评估驱动型”工厂

他们没有仅仅编写指令,而是构建了一条包含四个主要站点的流水线。把这想象成在调校一辆赛车:

  • 第一站:模块化套件(上下文工程)
    他们没有为机器人编写一份冗长、混乱的说明书,而是将其拆解成了乐高积木块。

    • 规则: 机器人应该如何说话(礼貌、简洁)。
    • 剧本: 针对特定问题的逐步指南(例如:“如果卡片丢失,执行步骤 A,然后执行步骤 B”)。
    • 工具: 机器人实际可以执行的操作列表(例如检查数据库或重新发卡)。
    • 记忆: 机器人记录对话中所学内容的便签本。
    • 为什么重要: 如果机器人的问候语出错了,你只需要更换“问候语乐高块”即可。你不需要重建整辆车。
  • 第二站:机器人裁判(LLM-as-a-Judge)
    你如何知道机器人做得好不好?你不能让机器人给自己打分。因此,他们使用了另一个 AI(即“裁判”)来为第一个机器人的回答评分。

    • 难点: 裁判 AI 有时会有偏见或偷懒。为了解决这个问题,他们使用了一种名为 GEPA 的特殊技术。想象一位教练在观察裁判 AI 给试卷打分时,发现裁判判得太严厉了,于是重新编写了更公平的评分标准。他们自动进行这种操作,直到评分变得极其一致。
  • 第三站:人工安全网(评分者间信度)
    在信任 AI 裁判之前,他们先让真实的人类对相同的答案进行评分。他们检查人类之间的意见是否一致。如果人类在 90% 的情况下达成一致,他们就知道测试是公平的。然后,他们确保 AI 裁判与人类的达成一致程度也同样高。

  • 第四站:实战测试(A/B 测试)
    一旦机器人通过了模拟器测试,他们就会让它与一小部分真实客户交谈(例如 1% 的用户)。他们将这个新机器人与旧系统进行对比。如果新机器人的表现让客户更开心,他们就会让它接触更多的人。

3. 结果:机器人胜出

他们在五种不同类型的问题上测试了这个系统:

  1. 卡片递送: “我的卡片在哪儿?”
  2. 债务管理: “我该如何偿还贷款?”
  3. 信用额度: “我能提高额度吗?”
  4. 卡片管理: “修改我的 PIN 码。”
  5. 产品讲解: “这个功能是做什么用的?”

神奇的数据:

  • 幸福感: 对于“卡片递送”机器人,客户满意度(通过名为 tNPS 的得分衡量)提升了 37 个点。这是一个巨大的进步。
  • 自助服务: 更多的人在不需要人工干预的情况下解决了问题。其“自助服务率”上升了 29 个点
  • 人类 vs 机器人: 在五种情况中的四种里,机器人的表现几乎与顶尖专家不相上下(差距仅在几个百分点内)。唯一的短板是在非常复杂的“债务管理”领域,这很正常,因为那是涉及最难数学计算和共情能力的难题。

4. 核心教训:“如果你能衡量它,你就能修复它”

这篇论文最重要的启示是:你的测试质量决定了你改进的速度。

由于他们构建了一个如此严密的测试系统(“模拟器”),他们可以对机器人的指令进行修改,并立即知道它是变好了还是变差了。他们不需要等待数周才能看到客户是否开心。他们可以在模拟器中对机器人进行数十次迭代(改进),当他们最终发布时,它已经是一个冠军级的选手了。

简而言之: 他们不仅仅是构建了一个聪明的 AI;他们构建了一个用于测试 AI 的智能测试实验室。正因为这个实验室如此出色,他们向世界推出的机器人才如此可靠、令人愉悦,并准备好服务于 1 亿用户。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →