One Model, Multiple Goals: Adaptive Multi-Objective Learning for E-commerce Dialogue Systems
本文介绍了 MORE,这是一个自适应多目标强化学习框架,它将推理准确性视为一种约束以稳定训练,并动态平衡语言自然度,在字节跳动的实际电商对话系统以及 MultiWOZ 基准测试中,实现了转化率和用户满意度的显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为一家繁忙的在线商店招聘一名新的客户服务代表。你有两个截然不同却同样重要的目标:
- 会计师: 他们必须能够查看客户档案,计算信用额度和利率,并给出 100% 正确的答案。如果他们算错了数字,客户就会损失金钱或失去信任。
- 话痨: 他们说话必须自然,听起来友好,并能让对话流畅进行。如果他们听起来像个僵硬的机器人,客户会感到厌烦并挂断电话。
问题在于,这两个目标经常发生冲突。一个擅长数学的机器人往往听起来像个枯燥、死板的计算机;而一个擅长聊天、能言善辩的机器人则可能会编造数字或在数学计算上出错。
这篇论文介绍了一种名为 MORE 的新 AI 系统,它解决了这一冲突。以下是它的工作原理,我们使用简单的类比来解释:
1. “训练营” vs. “正式比赛”
作者意识到,试图在训练过程中同时教 AI 既做一个完美的会计师又做一个完美的“话痨”,就像试图教一个学生在骑着独轮车的同时玩杂耍。AI 会感到困惑,在过于机械化和过于草率之间来回摆动,最终两头不到位。
解决方案: 他们将训练分为两个截然不同的阶段,就像运动队拥有“练习赛”和“正式比赛日”一样。
- 练习赛(脚手架阶段): 在训练期间,AI 被迫大声地进行复杂的数学和逻辑运算。在回答之前,它必须明确地推导用户的信用额度或利率。这就像学生在数学考试中展示解题步骤一样。这确保了 AI 能够完美地掌握事实。
- 正式比赛日(推理阶段): 当 AI 真正与客户交谈时,它不会展示其解题过程。它跳过了“大声思考”的步骤,直接给出最终的、自然的答案。因为在早期练习得非常扎实,它现在可以瞬间给出正确答案,而不会显得机械呆板。这使得对话变得快速且流畅。
2. “动态教练”(自适应奖励)
通常在训练 AI 时,你会给它一个固定的评分表。例如,“获得 50% 的分数用于准确性,50% 的分数用于友好度。”问题在于,有时你需要 90% 的准确度(比如讨论贷款时),而有时你只需要 90% 的友好度(比如打招呼时)。固定的评分表并不奏效。
解决方案: MORE 使用了一个动态教练。
想象一位在比赛中实时观察的教练。
- 如果客户询问复杂的贷款问题,教练会大喊:“专注于数学!准确性是首要任务!”
- 如果客户只是在闲聊某个产品,教练会大喊:“专注于友好!自然度是首要任务!”
系统会根据特定对话的需求不断调整自己的“评分表”。它利用一种数学技巧(梯度反馈)来判断在特定时刻哪个目标表现不佳,并给予更多的关注。
3. 结果:现实世界的成功
团队在字节跳动的真实电商平台(如抖音 App)上测试了这个系统。他们不仅仅是在计算机模拟中运行,而是让它与真人进行了为期 14 天的对话。
- 商业层面的胜利: 该系统帮助提升了销售额。在主动销售中,它使对话后实际购买产品的转化率提升了 30%。
- 用户层面的胜利: 客户更满意了。他们觉得机器人更理解他们,而且由于机器人无法处理问题而不得不转接人工客服的情况减少了。
- “人类”测试: 在一项对比测试中,该 AI 系统实现了人类客服约 60% 的销售成功率,但它能同时与数百万人交谈,而人类一次只能与一个人交谈。
总结
简而言之,MORE 是一种聪明的训练方法,它教会 AI 成为一名“两面派”专家:在练习时是一个严谨的逻辑学家,以便在正式比赛中成为一名流畅、自然的对话者。通过让 AI 知道何时专注于事实,何时专注于风格,它成功地实现了既准确又友好的目标,而这正是以往的 AI 系统难以同时做到的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。