← 最新论文
💬 NLP

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

本文介绍了 EVA-Bench,这是一个开源的端到端框架,它将动态机器人对机器人对话模拟与综合指标(EVA-A 和 EVA-X)相结合,在 213 个企业级场景中对语音智能体进行全面评估,揭示了当前系统在准确性、可靠性以及针对口音和噪声的鲁棒性方面存在的显著差距。

原作者: Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Mada
发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:你可以拨打客服热线,与一个类人化的声音自然交谈,并在无需按下任何按钮或等待排队的情况下解决问题。这就是现代语音智能体(voice agent)所承诺的未来——这是一种旨在通过口头对话来执行任务的人工智能。与在静态、书面世界中运行的文本聊天机器人不同,语音智能体必须应对转瞬即逝、线性的声音流。它们必须理解口音、忽略背景噪音,并精准掌控响应时机,以免打断通话者或留下尴尬的沉默。这些约束条件创造了独特的失效模式:机器人可能正确理解了请求,却无法清晰地读出确认码,或者它反应太慢,导致用户因沮付而挂断电话。由于这些系统正逐渐普及于航空公司、医院和各类企业,问题不再仅仅是它们能否“说话”,而是它们能否可靠且令人愉悦地解决实际问题。

为了回答这个问题,ServiceNow AI 研究团队构建了一个全新的测试场,称为 EVA-Bench。在此框架出现之前,并没有一种标准化的方式能够既模拟真实的对话,又对质量进行深层次、多维度的测量。现有的测试通常依赖于静态脚本或单轮交互,这忽略了智能体在长对话中如何从错误中恢复的过程。EVA-Bench 通过编排模拟人类通话者与受测语音智能体之间的全自动、多轮音频对话,改变了这一局面。研究人员在三大主要行业中创建了 213 个不同的场景:航空客户服务、医疗人力资源以及企业 IT 支持。这些场景设计得极具挑战性,要求智能体处理复杂的政策,并记住诸如航班号或医疗 ID 等特定细节,同时还要应对电话通话的自然流程。至关重要的是,该系统包含一个验证步骤,用于检查模拟通话者的行为;如果模拟过程出现偏差或表现得不真实,测试会自动重新生成,以确保得分反映的是智能体的性能,而非模拟过程中的故障。

研究人员使用两个主要指标来衡量智能体:一个是准确度,另一个是体验感。准确度评分(他们称之为 EVA-A)检查智能体是否真正完成了任务、是否遵循了规则,以及是否准确读出了数字和名称。体验感评分(EVA-X)则衡量对话对人类而言的感觉如何:智能体的响应时机是否恰当,表达是否足够简洁以至于不会让用户迷失,以及它是否能推动对话进展而不陷入僵局?他们测试了 12 种不同的语音系统,涵盖了从传统的“语音转文本—处理—合成语音”架构,到较新的直接处理音频的端到端系统。结果揭示了一个残酷的现实:没有任何单一系统能在准确度和体验感这两个指标上同时超过 0.5 分。虽然表现最好的系统能在其中一个维度上达到尚可的水平,但没有一个系统能够同时在两者上都表现出色。

一个显著的发现是系统的峰值性能与可靠性能之间的差距。当一个智能体针对同一任务进行多次测试时,它可能在某一次尝试中表现惊艳,但在下一次却会失败。研究人员发现,一个系统在最佳情况下的表现与其持续、可靠的表现之间存在巨大差异。平均而言,一个在单次试验中成功的系统,在面对同一场景的五次连续试验时,会有约 44% 的概率无法全部成功。这表明目前的评估往往高估了这些系统投入实际应用时的成熟度,因为在现实世界中,一致性与能力同样重要。此外,研究显示不同类型的系统其失效方式各异。直接处理音频的系统在对话时机的把握上通常更好,反应迅速且自然,但更容易违反政策或捏造事实。而先将语音转换为文本的传统系统在遵循规则方面表现较好,但在时机控制上往往表现不佳,会导致用户等待过久或被中断。

研究人员还测试了当环境变得困难(例如通话者带有浓重口音,或处于咖啡馆等有嘈杂背景噪音的环境)时,这些系统的表现如何。结果显示,这些声学挑战暴露了深层弱点。依赖先将语音转为文本的系统在面对口音时,其准确度会大幅下降;而直接处理音频的系统在面对噪音时,其对话时机的把控能力会受到更多影响。一种特定的失效模式尤为突出:无法正确读出或听取关键信息(如确认码或执照号码)。即使智能体理解了大致请求,一个数字的读错或听错也会导致整个交互变得毫无意义。研究结论指出,尽管语音智能体正在快速进步,但它们仍面临着准确性与作为愉悦对话伙伴之间的根本权衡。在这些系统能够稳定处理复杂的人类语言,同时保持完美的时机把控和政策遵循之前,它们仍将是一个处于开发阶段的任务,而非一个已完全解决的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →