← 最新论文
💬 NLP

DuplexWorld: Can voice agents help you get through the day?

该论文介绍了 DuplexWorld,这是一个包含六个真实世界领域和 156 个场景的全方位基准测试,旨在从对话、分析和自然度指标方面全面评估语音到语音的语音智能体,并揭示了尽管当前系统应用日益广泛,但其性能仍存在显著差距。

原作者: Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli, Asif Shaik, Abhishek Mukherji, Dinesh Manocha

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli, Asif Shaik, Abhishek Mukherji, Dinesh Manocha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何与人类交谈。长期以来,科学家们通过让这些机器人来回阅读文本来测试它们,就像一场极速进行的电子邮件游戏。但现实生活并非文本;它是混乱的、嘈杂的,并且是实时发生的。这就是语音到语音(Speech-to-Speech, S2S)语音智能体的世界。把它们想象成数字伴侣,它们能听见你的声音,理解你的话语,并像人类打电话那样即时地与你交谈。科学家们提出的核心问题是:这些机器人真的能为我们做实事吗,比如修改银行账户或引导我们穿行于城市,还是它们仅仅是极其擅长“假装在听”?我们之所以关心这一点,是因为如果我们让这些智能体处理日常琐事,我们需要知道它们是否真的能完成任务,而不会迷失方向、忘记我们的名字,或者在我们说话时插嘴。

于是,研究人员创建了一个名为 DUPUXWORLD 的全新“训练场”,用于在现实世界中测试这些语音智能体。研究人员并没有仅仅要求它们在屏幕上解决数学题,而是构建了六个不同的“世界”来模拟我们的日常生活:银行、保险、旅游、医疗、物流,以及一个棘手的新领域——路径规划(在这里,智能体必须引导一名步行者穿过城市)。他们将五种不同的商业语音智能体放入这些世界中,并让它们解决 156 个不同的场景,总计超过 3,800 场对话。这就像一场大规模、高风险的电子游戏,智能体必须同时兼顾倾听、思考和行动。

结果如何?即使是表现“最好”的智能体也仍处于开发阶段。研究人员发现,擅长对话并不意味着擅长执行任务。某个智能体可能听起来非常自然,对话流程也非常完美,但它可能无法真正完成订机票或找到正确银行账户的任务。事实上,表现最好的智能体在第一次尝试时仅成功完成了约 49% 的任务(得分为 0.490)。另一个关键发现是,“听起来好听”是一个陷阱;那些语音质量得分最高的智能体,并不一定是完成任务表现最好的那些。在路径规划世界中,那些花费过多时间进行“探索”或询问过多问题的智能体反而更容易迷路,而那些坚持计划的智能体则能到达目的地。

该论文明确排除了仅仅通过礼貌程度或流畅度来评判这些智能体的想法。数据表明,一个智能体可能是一个从不干实事的“话痨”,如果我们只看对话评分,我们可能会选错机器人。此外,研究人员发现,即使是最好的系统在可靠性方面也面临挑战;如果你要求它们尝试同一个任务三次,它们往往至少会失败一次。这项研究表明,为了真正帮助我们,语音智能体需要不仅在“说话”方面,更要在“实际工作”方面变得更加出色。这提醒我们,虽然这项技术令人印象深刻,但我们还没准备好将日常生活完全交给它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →