← 最新论文
💻 computer science

Learning Selective LLM Autonomy from Copilot Feedback in Enterprise Customer Support Workflows

本文介绍了一个已部署的系统,该系统利用副驾驶反馈和界面交互轨迹来训练一个选择性大语言模型代理,以自动化企业客户支持工作流,在通过基于置信度的拒绝机制保持质量的同时,实现了45%的自动化率和39%的处理时间缩短。

原作者: Nikita Borovkov, Elisei Rykov, Olga Tsymboi, Sergei Filimonov, Nikita Surnachev, Dmitry Bitman, Anatolii Potapov

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikita Borovkov, Elisei Rykov, Olga Tsymboi, Sergei Filimonov, Nikita Surnachev, Dmitry Bitman, Anatolii Potapov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个繁忙的客户支持中心,它就像一个巨大而复杂的控制室。在里面,人类操作员不断在电脑间切换,点击按钮,填写表格,并输入消息以解决客户问题。这是一项高风险的工作,一次错误的点击就可能给客户带来麻烦。

本文描述了一种专为这种控制室构建的新型“智能助手”系统。该系统并非试图完全取代人类,而是像一个超级敏锐的副驾驶:它学习如何驾驶汽车,但只有在 100% 确定不会发生碰撞时才会接管方向盘。

以下是其工作原理,分解为简单步骤:

1. “影子”阶段(通过观察学习)

首先,系统什么都不做,只是观察。它记录人类操作员在解决成千上万个客户案例时所进行的每一次点击、每一次按键以及每一次屏幕变化。这就像一名新司机坐在副驾驶座上,观察专业司机在城市中驾驶数周, memorizing 每一个转弯和停车标志。

2. “副驾驶”阶段(建议而非决策)

接下来,系统开始提供建议。它会说:“嘿,根据我所看到的,你接下来应该点击这个按钮。”

  • 人类的角色:操作员可以说“是的,好主意”,让系统执行;也可以说“不,用这种方式来做”。
  • 学习过程:每当人类纠正系统时,系统就会学习。这就像学生在作业上得到红笔批改。仅仅两周后,系统就能非常擅长预测正确的下一步操作。

3. “选择性自动驾驶”阶段(安全接管方向盘)

这是最重要的部分。系统不会盲目接管。它内置了一个**“安全裁判”**(称为“评判器”)。

  • 高置信度:如果系统非常确定(例如“点击‘下一步’按钮”),它会在后台自动执行。
  • 低置信度:如果系统不确定(例如“我是否应该向客户发送这条特定消息?”),它会停止并请求人类帮助。
  • 结果:人类操作员现在可以同时监控多个对话。他们只需在系统暂停并提问时才介入。他们不再负责打字,而只是充当安全网。

如何处理错误

论文指出,该系统的设计初衷是谨慎行事。

  • “停止”标志:如果电脑屏幕以系统未曾见过的奇怪方式发生变化,或者系统对某个决定感到不安,它会立即将控制权交还给人类。
  • “重置”按钮:如果系统犯错,它不会失控。它会停止,让人类修复屏幕,然后从它中断的地方继续。

现实世界的结果

该团队在拥有约 15,000 名客户的真实商业环境中测试了该系统。

  • 速度:系统在没有人类帮助的情况下,处理了**45%**的完整对话(从头到尾)。
  • 节省时间:操作员在单个客户身上需要主动工作的时间减少了39%
  • 质量:支持质量并未下降。客户满意度与之前一样高。

核心启示

论文认为,你并不需要一台试图完美完成所有事情的机器人来使其有用。相反,你需要一台选择性勇敢的机器人。它自动执行无聊、重复且低风险的任务(如点击按钮或填写表格),但它确切地知道何时该说:“我不确定,这个由你来处理。”

这种方法比传统计算机程序(需要人类为每种可能的情景编写僵化的规则)构建得更快,也比试图独自完成所有事情的“狂野”AI 更可靠。它将人类操作员从“驾驶员”转变为“车队经理”,以更少的压力同时监督多个对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →