Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
本文介绍了一个由 Nubank 开发的统一、评估驱动型框架,该框架整合了结构化上下文工程、人机协同迭代以及严格的 LLM 评判评估,成功地在五个领域为超过 1 亿用户部署了生产级客户支持 AI 智能体,在显著提升满意度和自助服务率的同时,证明了离线指标与在线影响之间存在强相关性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你经营着一家拥有 1 亿客户的大型银行。每天,都有数百万人打电话或通过聊天咨询类似的问题,比如:“我的信用卡在哪儿?”或者“为什么我欠了这么多钱?”
在过去,你需要一支庞大的真人客服团队来回答这些问题。但现在,你想构建一个超级智能的 AI 机器人来处理这些对话。问题在于:如果机器人给出了错误的答案,客户会感到愤怒、失去信任并离开。你不能仅仅靠“猜测”来判断机器人的表现是否良好;在让它与真实人类交谈之前,你需要 100% 确定它的表现。
这篇论文是来自 Nubank(一家巨型银行)关于如何安全且成功地构建这些 AI 机器人的蓝图。以下是他们是如何做的,用简单的语言解释如下:
1. 问题所在:在没有碰撞测试的情况下制造汽车
通常,当人们构建 AI 时,他们编写指令,进行少量测试,然后听天由命。作者说,这就像造了一辆车,然后直接把它开下悬崖,以此来测试安全气囊是否起作用。在客户支持领域,一次“碰撞”的代价实在太高了。
他们需要一种方法,在让机器人与哪怕一个真实人类交谈之前,先在“模拟器”中对其进行数千次的测试。
2. 解决方案:“评估驱动型”工厂
他们没有仅仅编写指令,而是构建了一条包含四个主要站点的流水线。把这想象成在调校一辆赛车:
第一站:模块化套件(上下文工程)
他们没有为机器人编写一份冗长、混乱的说明书,而是将其拆解成了乐高积木块。- 规则: 机器人应该如何说话(礼貌、简洁)。
- 剧本: 针对特定问题的逐步指南(例如:“如果卡片丢失,执行步骤 A,然后执行步骤 B”)。
- 工具: 机器人实际可以执行的操作列表(例如检查数据库或重新发卡)。
- 记忆: 机器人记录对话中所学内容的便签本。
- 为什么重要: 如果机器人的问候语出错了,你只需要更换“问候语乐高块”即可。你不需要重建整辆车。
第二站:机器人裁判(LLM-as-a-Judge)
你如何知道机器人做得好不好?你不能让机器人给自己打分。因此,他们使用了另一个 AI(即“裁判”)来为第一个机器人的回答评分。- 难点: 裁判 AI 有时会有偏见或偷懒。为了解决这个问题,他们使用了一种名为 GEPA 的特殊技术。想象一位教练在观察裁判 AI 给试卷打分时,发现裁判判得太严厉了,于是重新编写了更公平的评分标准。他们自动进行这种操作,直到评分变得极其一致。
第三站:人工安全网(评分者间信度)
在信任 AI 裁判之前,他们先让真实的人类对相同的答案进行评分。他们检查人类之间的意见是否一致。如果人类在 90% 的情况下达成一致,他们就知道测试是公平的。然后,他们确保 AI 裁判与人类的达成一致程度也同样高。第四站:实战测试(A/B 测试)
一旦机器人通过了模拟器测试,他们就会让它与一小部分真实客户交谈(例如 1% 的用户)。他们将这个新机器人与旧系统进行对比。如果新机器人的表现让客户更开心,他们就会让它接触更多的人。
3. 结果:机器人胜出
他们在五种不同类型的问题上测试了这个系统:
- 卡片递送: “我的卡片在哪儿?”
- 债务管理: “我该如何偿还贷款?”
- 信用额度: “我能提高额度吗?”
- 卡片管理: “修改我的 PIN 码。”
- 产品讲解: “这个功能是做什么用的?”
神奇的数据:
- 幸福感: 对于“卡片递送”机器人,客户满意度(通过名为 tNPS 的得分衡量)提升了 37 个点。这是一个巨大的进步。
- 自助服务: 更多的人在不需要人工干预的情况下解决了问题。其“自助服务率”上升了 29 个点。
- 人类 vs 机器人: 在五种情况中的四种里,机器人的表现几乎与顶尖专家不相上下(差距仅在几个百分点内)。唯一的短板是在非常复杂的“债务管理”领域,这很正常,因为那是涉及最难数学计算和共情能力的难题。
4. 核心教训:“如果你能衡量它,你就能修复它”
这篇论文最重要的启示是:你的测试质量决定了你改进的速度。
由于他们构建了一个如此严密的测试系统(“模拟器”),他们可以对机器人的指令进行修改,并立即知道它是变好了还是变差了。他们不需要等待数周才能看到客户是否开心。他们可以在模拟器中对机器人进行数十次迭代(改进),当他们最终发布时,它已经是一个冠军级的选手了。
简而言之: 他们不仅仅是构建了一个聪明的 AI;他们构建了一个用于测试 AI 的智能测试实验室。正因为这个实验室如此出色,他们向世界推出的机器人才如此可靠、令人愉悦,并准备好服务于 1 亿用户。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。