想象一个繁忙的客户支持中心,它就像一个巨大而复杂的控制室。在里面,人类操作员不断在电脑间切换,点击按钮,填写表格,并输入消息以解决客户问题。这是一项高风险的工作,一次错误的点击就可能给客户带来麻烦。
本文描述了一种专为这种控制室构建的新型“智能助手”系统。该系统并非试图完全取代人类,而是像一个超级敏锐的副驾驶:它学习如何驾驶汽车,但只有在 100% 确定不会发生碰撞时才会接管方向盘。
以下是其工作原理,分解为简单步骤:
1. “影子”阶段(通过观察学习)
首先,系统什么都不做,只是观察。它记录人类操作员在解决成千上万个客户案例时所进行的每一次点击、每一次按键以及每一次屏幕变化。这就像一名新司机坐在副驾驶座上,观察专业司机在城市中驾驶数周, memorizing 每一个转弯和停车标志。
2. “副驾驶”阶段(建议而非决策)
接下来,系统开始提供建议。它会说:“嘿,根据我所看到的,你接下来应该点击这个按钮。”
- 人类的角色:操作员可以说“是的,好主意”,让系统执行;也可以说“不,用这种方式来做”。
- 学习过程:每当人类纠正系统时,系统就会学习。这就像学生在作业上得到红笔批改。仅仅两周后,系统就能非常擅长预测正确的下一步操作。
3. “选择性自动驾驶”阶段(安全接管方向盘)
这是最重要的部分。系统不会盲目接管。它内置了一个**“安全裁判”**(称为“评判器”)。
- 高置信度:如果系统非常确定(例如“点击‘下一步’按钮”),它会在后台自动执行。
- 低置信度:如果系统不确定(例如“我是否应该向客户发送这条特定消息?”),它会停止并请求人类帮助。
- 结果:人类操作员现在可以同时监控多个对话。他们只需在系统暂停并提问时才介入。他们不再负责打字,而只是充当安全网。
如何处理错误
论文指出,该系统的设计初衷是谨慎行事。
- “停止”标志:如果电脑屏幕以系统未曾见过的奇怪方式发生变化,或者系统对某个决定感到不安,它会立即将控制权交还给人类。
- “重置”按钮:如果系统犯错,它不会失控。它会停止,让人类修复屏幕,然后从它中断的地方继续。
现实世界的结果
该团队在拥有约 15,000 名客户的真实商业环境中测试了该系统。
- 速度:系统在没有人类帮助的情况下,处理了**45%**的完整对话(从头到尾)。
- 节省时间:操作员在单个客户身上需要主动工作的时间减少了39%。
- 质量:支持质量并未下降。客户满意度与之前一样高。
核心启示
论文认为,你并不需要一台试图完美完成所有事情的机器人来使其有用。相反,你需要一台选择性勇敢的机器人。它自动执行无聊、重复且低风险的任务(如点击按钮或填写表格),但它确切地知道何时该说:“我不确定,这个由你来处理。”
这种方法比传统计算机程序(需要人类为每种可能的情景编写僵化的规则)构建得更快,也比试图独自完成所有事情的“狂野”AI 更可靠。它将人类操作员从“驾驶员”转变为“车队经理”,以更少的压力同时监督多个对话。
以下是论文《从企业客户支持工作流中的副驾驶反馈中学习选择性大语言模型自主性》的详细技术总结。
1. 问题陈述
在企业客户支持中部署大语言模型(LLM)代理以实现端到端自动化面临重大障碍:
- 错误传播:多步骤 UI 交互中的微小错误会在长周期内累积,导致工作流失败。
- 成本与复杂性:传统的多步控制循环在大规模应用时成本高昂,且频繁的 UI 或流程变更使得脆弱的机器人流程自动化(RPA)或手动脚本流程难以维护。
- 安全与信任:完全自主的代理可能降低支持质量,或在敏感业务流程(如账户变更)中造成不可逆的错误。
- 数据稀缺:与网络浏览基准测试不同,企业工作流缺乏用于训练的大型公开数据集,且领域逻辑高度专业化。
作者提出了一种实现选择性自动化的系统:自动化高置信度步骤,同时将不确定的决策推迟给人工操作员,从而在效率与安全之间取得平衡。
2. 方法论
该系统采用受模仿学习(特别是 DAgger)启发的分阶段部署管道,通过三个阶段训练策略模型和评估模型。
A. 数据表示与序列化
- 模式驱动视图:系统不依赖原始 DOM 或截图(这些对 UI 变更很脆弱),而是提取业务流程管理(BPM)界面的模式驱动 JSON 表示。
- 状态 - 动作轨迹:操作员会话被记录为轨迹 {st,at}。状态 st 包括聊天记录、UI 上下文(客户档案、活跃场景)和全局公告。动作 at 分为四类:消息撰写、导航、选择/表单填写和会话管理。
- 输入格式:UI 快照和动作被合并为按时间顺序交织的对话,包含客户消息、操作员动作和更新后的 UI 状态,作为 LLM 的输入。
B. 分阶段部署管道
- 日志记录阶段:
- 收集完整的操作员交互轨迹。
- 通过在行为克隆(给定状态预测下一个动作)上进行监督微调(SFT),训练初始策略模型(πθ)。
- 副驾驶阶段:
- 部署策略模型以实时向操作员建议动作。
- 反馈循环:操作员要么接受建议,要么修正它。
- 关键与非关键:非关键动作(如 UI 导航)可自动执行;关键动作(如发送消息、关闭聊天)需要人工批准。
- 此阶段专门生成用于关键步骤的标记数据(接受/拒绝)。
- 选择性自动化阶段:
- 利用副驾驶反馈训练评估模型(cϕ),以估算提议的关键动作正确的概率。
- 门控执行:仅当评估模型的分数 cϕ(s,a^)≥τ(其中 τ 是校准阈值)时,系统才执行动作 a^。
- 弃权:如果分数低于 τ,控制权移交给人工操作员,操作员从更新后的 UI 状态继续。
- 校准:调整阈值 τ 以满足业务精度要求(例如,确保 90% 的自动化动作会被人类接受)。
C. 安全与适应性
- 分布外(OOD)处理:系统使用每日验证规则检测新的 UI 元素。如果检测到漂移,则禁用受影响片段的自动化,恢复为副驾驶模式以收集新的监督数据。
- 匿名化:训练数据经过严格的掩码处理(实体替换、会话级区分性)以保护个人身份信息(PII)。
- 持续改进:模型在近期数据的滚动窗口上重新训练,并为不同的问题簇提供特定片段的策略 - 评估模型对。
3. 主要贡献
- 生产级可扩展的分阶段部署:一种新颖的管道,从日志记录过渡到副驾驶再到选择性自动化,利用自然发生的监督(接受/拒绝)而非需要手动规则编写。
- 模式驱动的状态序列化:从基于视觉/截图的代理转向 BPM 界面的结构化 JSON 表示,实现了无需图像处理的稳健监控和可靠的工具调用。
- 评估模型门控的自主性:一种机制,结合经 SFT 训练的策略和基于轨迹反馈训练的评估模型,以管理错误 - 覆盖率权衡,允许高置信度步骤的安全后台执行。
- 工程框架:全面记录了安全措施(弃权、数据漂移处理、回退机制)以及包含消融研究的在线评估协议。
4. 实验结果
该系统在实时生产环境中进行了评估,每个 A/B 测试组约有15,000 名客户。
离线结果
- SFT 的必要性:零样本提示(即使使用 GPT-5 或 Gemini 3 等大型模型)仅实现了约 47% 的工具准确率。在 Qwen2.5-7B 模型上进行特定领域的 SFT 实现了79.15% 的工具准确率,证明针对企业逻辑的专门微调至关重要。
- 数据混合:将历史日志与副驾驶拒绝修正相结合,提高了对困难案例的泛化能力。
- 评估模型性能:经 SFT 训练的评估模型比基于置信度的基线高出**+3.84% 的精确率和+3.03% 的 F1 分数**,验证了从显式人类反馈中学习优于原始模型的不确定性。
在线结果(A/B 测试)
- 效率:与纯人工基线相比,选择性自动化系统将平均代理时间(AAT)降低了 39%(从 227 秒降至 139 秒)。
- 质量:与基线相比,解决正确性得分在统计上保持不变,确认支持质量未下降。
- 自动化率:该系统在无需人工干预的情况下,端到端完全自动化了**45%**的会话。
- 与经典聊天机器人的比较:通过降低 16% 的 AAT,其表现优于基于规则的聊天机器人基线。
- 增量收益:从“强制确认”转向“启用自动化的执行”进一步将 AAT 降低了25%。
5. 意义与结论
本文展示了在高风险企业环境中部署 LLM 代理的实用且可扩展的路径。
- 范式转变:它从“完全自主”(具有风险)和“静态 RPA"(脆弱)转向渐进式、选择性自主。
- 人在回路:系统将操作员视为"AI 编辑”,监督多个并发会话,仅在系统不确定时进行干预。
- 可推广性:该方法适用于任何具有交互日志的结构化界面工作流,为受监管行业的安全、高效自动化提供了蓝图。
这项工作强调,安全并非通过限制模型的能力来实现,而是通过经学习的评估模型和分阶段部署过程来门控其执行,该过程持续适应不断变化的业务逻辑。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。