ShopEase: A Generative AI-Based Multi-Agent Framework for Intelligent Enterprise Customer Support Using Hybrid Retrieval-Augmented Generation
本文介绍了 ShopEase,这是一个用于企业级客户支持的多智能体生成式人工智能框架,它利用本地 LLaMA 3.2 和混合检索技术,并通过对 2,632 个查询的评估表明,稠密 FAISS 检索在准确性上优于稀疏和重排序混合方法,同时避免了与交叉编码器重排序相关的延迟惩罚。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代商业世界中,让客户满意往往意味着快速且准确地回答他们的问题。当一个人在网上购买商品后,如果需要了解关于退款、物流延迟或商品损坏的信息,他们期望得到即时的答复。几十年来,公司一直试图通过聊天机器人(一种旨在模仿人类进行交谈的计算机程序)来实现自动化。这些程序在处理简单的重复性问题时表现良好,但当情况变得复杂时,它们往往会陷入困境。如果客户在询问特定政策的同时还提到了过去的订单或独特的难题,基础程序可能会因为无法记住对话内容或找不到正确的规则手册而迷失方向。为了解决这个问题,研究人员现在正在构建一种更像专家团队而非单一机器人的系统。这些新系统使用了一种被称为“检索增强生成”的方法,这是一种高级说法,意指计算机在开口说话之前会先从数据库中查找事实,从而确保其回答是基于真实的业务规则,而非仅仅是猜测。它们还使用了多个“智能体”(agents),即处理不同任务的小型程序,例如一个负责记住客户身份,另一个负责查找正确的政策,第三个则负责决定是否需要人工介入。
来自印度理工学院卡拉格普尔分校(IIT Kharagpur)的一个研究小组开发了一个名为 ShopEase 的新系统,以测试这种团队协作方法在企业客户支持方面的效果。他们的目标是创建一个能够处理客户查询全过程的框架——从提出问题的那一刻起到给出最终答案,并能在需要时将接力棒交给人类员工。该系统设计有六个相互协作的独特部分。首先,一个“守卫”会对输入的提问进行检查,以确保其安全且清晰。接着,一个智能体负责识别客户的真实意图。其他智能体则从数据库中提取客户的个人历史信息,并回溯之前的对话细节。随后,一个核心检索团队会在数千份政策文档中进行搜索,以找到适用于当前情况的具体规则。如果系统觉得问题过于复杂或具有风险,一个“升级智能体”会将案例移交给人工处理。最后,一个“监督者”负责协调所有步骤,并确保最终的回复在发送给客户之前经过审核。
为了验证这种设计是否真的有效,研究人员在一个包含 2,632 个真实客户问题的庞大数据集上对它进行了测试,这些问题是专门为本次实验预留出来的。这些问题涵盖了六个常见类别:退款、退货、物流问题、取消订单、损坏产品,以及一组不属于任何明确类别的疑问。团队想要观察哪种寻找正确政策文档的方法效果最好。他们尝试了六种不同的搜索策略。有些依赖于精确的词汇匹配,而另一些则使用了理解词义背后的含义的方法,即使具体的词汇不同也能识别。他们还测试了这些方法的组合,并增加了一个步骤,即对搜索结果的前几名进行更仔细的二次检查,以观察这是否能提升最终答案的质量。
结果显示,理解问题的含义远比匹配精确的单词更为重要。完全依赖于寻找具有相似含义文档的系统取得了最高的成功率,它能正确识别出 85.37% 的问题所属的政策类别。这显著优于仅寻找匹配单词的系统,后者的正确率仅为 55.74%。有趣的是,增加那个额外的、细致的检查步骤并没有带来帮助。事实上,它不仅让系统变慢了,却没有提高准确性。研究人员发现,在加入这一额外的处理层后,获取答案所需的时间明显增加,但正确答案的数量并未上升。这表明对于此类任务,快速的、基于语义的搜索比缓慢的多步骤处理过程更有效。
当研究人员深入分析系统的成功与失败之处时,发现了一个明显的模式。该系统在处理物流、取消订单和退货方面表现出色,正确率经常超过 90%。然而,在处理那些无法整齐归入已知类别的疑问时,它却显得非常吃力。当客户提出一个模糊的问题,且该问题不符合任何特定政策时,系统往往会进行猜测并将其强行分配到一个已知类别中,而不是承认自己不知道。这是错误产生的主要来源。此外,系统在区分“退款”和“退货”方面也存在困难,因为这两个概念经常使用相似的语言,从而导致了一些混淆。尽管存在这些小瑕疵,这项研究证明了一个多智能体系统可以成功地将客户历史、对话记忆和政策检索整合进一个统一且协调的工作流中。
研究人员还测试了移除系统中某些部分后会发生什么,以观察每个部件的重要性。他们发现,移除负责记录客户个人详细信息的部件会导致个性化程度出现最大的下降。这证实了了解客户身份与了解规则同样重要。移除处理对话历史的部分也会损害回答的质量,尽管程度不及丢失客户数据那样严重。负责将案例移交给人工的部分对自动化回答质量的影响较小,因为它的主要职责是在机器无法解决问题时介入,而不是去提升机器自身的性能。
最终,ShopEase 系统证明了只要使用正确的工具,基于团队的方法在企业级支持中是非常有效的。研究表明,对于这类工作,理解词义的“稠密检索”(dense retrieval)优于简单的关键词匹配。研究还揭示,增加复杂的重检步骤会拖慢速度却无法增加价值。虽然该系统并不完美,尤其是在处理模糊或超出范围的问题时,但它为未来的客户服务奠定了坚实的基础。研究人员建议,未来的改进应侧于更好地检测何时问题超出了系统的知识范围,并扩大政策库以覆盖更多样化的场景。目前,这项工作为构建智能、快速、准确且能在需要时随时转交给人工处理的支持系统提供了一份清晰的路线图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。