EARS: Explanatory Abstention for Reliable Sub-Agent Modeling in Large-scale Multi-Agent Systems
该论文介绍了 EARS,这是一个通过训练子智能体检测自身局限性并以解释性弃权和理由而非幻觉输出进行响应,从而增强大规模多智能体系统可靠性的框架,进而提高了生产环境中的整体任务成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个为一家巨型在线商店提供服务的、规模宏大且高科技的客户服务中心。在这个中心里,有一位总经理(协调员)和一支专家团队(子代理)。
总经理的工作是倾听客户的需求,并快速决定哪位专家最适合处理该需求。例如,如果客户询问他们的销售数据,经理会将他们发送给“数据分析师”专家。如果他们询问物流问题,则会被发送给“物流”专家。
问题:“过度自信”的专家
该论文指出,这个系统中存在一个常见的故障。这些专家员工通常使用较小、较快的计算机大脑来节省成本。有时,客户提出的问题是:
- 模糊不清的: “我的店表现如何?”(哪家店?什么时间段?)
- 不完整的: “显示我的销售额。”(什么的销售额?昨天的?去年的?)
- 超出范围的: 专家本身并不具备回答该问题的工具。
在旧系统中,当这些专家遇到此类问题时,他们不知道如何表达“我做不到”。相反,他们会尝试进行猜测。他们会编造答案(幻觉)或给出令人困惑、毫无帮助的响应。这使得整个系统看起来非常不可靠。
解决方案:EARS(“解释性停顿”)
研究人员创建了一个名为 EARS(用于可靠子代理建模的解释性弃权)的新框架。
你可以将 EARS 理解为教会专家们一种新的、礼貌且非常具体的方式来表达“我做不到”。他们不再只是保持沉默或胡编乱造,而是接受训练去执行以下操作:
- 停止(弃权)回答。
- 解释他们停止回答的具体原因。
他们不仅仅是说“不”。他们会说:“我无法回答这个问题,因为问题过于模糊,”或者“我无法回答,因为您忘记告诉我日期了,”或者“我无法回答,因为这实际上是物流团队的工作,而不是我的工作。”
这把一次“失败”转化为了发回给总经理的有用信号,随后总经理可以修复该请求或将其发送给正确的人。
他们是如何训练专家的
你不能仅仅告诉计算机“要诚实”并期望它奏效。研究人员使用了一个巧妙的三步训练过程:
- 人类教师: 首先,真实的人类查看了数千场客户对话,并准确地标注了专家失败的具体原因。他们创建了一套规则手册(分类法),用于区分不同的失败类型。
- “评委”小组: 由于对话量太大,人类无法阅读所有内容,因此研究人员训练了一组强大的 AI “评委”来充当老师。他们测试了这些评委,直到它们能够非常出色地识别出失败的具体原因。为了确保万无一失,他们使用了“共识”方法:如果四个不同的 AI 评委对原因达成一致,他们才将其标记为正确。
- 训练循环: 他们利用这些“经评委认可”的示例来重新训练专家。现在,当专家看到一个令人困惑的问题时,它能识别出这种模式,并立即返回一个清晰的解释,而不是一个虚假的答案。
结果
团队在为数百万客户服务的真实、大规模电子商务环境中测试了这一点。
- 使用 EARS 之前: 系统仅能成功处理 68.5% 的请求。其余的请求要么是错误的,要么是令人困惑或毫无帮助的。
- 使用 EARS 之后: 成功率跃升至 78.9%。
简单来说,通过教会专家在卡壳时承认并解释原因,整个团队变得更加可靠。总经理可以更快地修复问题,客户也能得到更好的答案。这篇论文表明,在 AI 代理团队中,知道何时“保持沉默”(并说明原因)与知道该说什么同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。