← 最新论文
💬 NLP

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

本文提出了一种两阶段增量框架,用于生成上下文感知的前导响应以降低对话延迟,并通过一项真实的机器人实验证明,虽然该方法与固定填充语相比略微延迟了初始填充语的出现,但显著缩短了主响应前的间隔,揭示了在时序优化方面的权衡。

原作者: Yuki Okafuji, Koji Inoue, Yoshiki Ohira

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuki Okafuji, Koji Inoue, Yoshiki Ohira

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:通过上下文感知的前序生成实现低延迟轮次转换

问题陈述
基于大语言模型(LLM)的对话系统,特别是采用级联 ASR–LLM–TTS 流水线的系统,由于生成过程通常在用户语音被完全识别后才开始,因此存在显著的响应延迟。虽然对话填充词(如“嗯哼”、“我知道了”)常被用于掩盖这些延迟,但如果过于通用或重复,随着时间的推移会变得不自然。核心挑战在于平衡响应速度与生成质量:朴素的增量生成可能会降低一致性,而等待完整的语句识别则会产生可感知的延迟。系统需要一种机制,能够在构思实质性回答的同时,利用具有上下文相关性的初步响应来占据对话话语权。

方法论
作者提出了一种两阶段增量响应框架,旨在将响应准备与语音起始解耦。该系统架构由以下组件组成:

  1. 意图就绪检测(Intent Readiness Detection): 一个二分类模型,用于判断从当前语句前缀中是否已能充分预测用户的意图(以先前的系统语句为条件)。

    • 训练: 该模型分两个阶段进行训练:首先是在 LLM 伪标签语料库(约 76.5 万个实例)上进行训练,然后在人工标注语料库(约 3 万个实例)上进行微调。两个数据集都进行了多样化处理,以包含犹豫和自我修正。
    • 架构: 基于带有二分类头的 Japanese ModernBERT 30M 编码器,并利用 Focal Loss 来解决类别不平衡问题。
    • 触发: 当意图就绪得分超过阈值(0.35)时,系统触发短促的前序响应生成。
  2. 两阶段生成:

    • 第一阶段(前序响应): 一旦检测到意图就绪,系统会生成一个短促且具备上下文相关性的前序响应(例如,“汉堡店……”)。系统施加了严格的约束:响应限制在 10 个日语字符以内,不得引入新事实,不得做出确定性陈述,也不得表达强烈的赞同。
    • 第二阶段(主响应): 同时,系统根据完整的用户语句生成完整的、与任务相关的实质性回答。
  3. 轮次转换控制(Turn-Taking Control): 语音活动投影(VAP)模型独立估计用户何时交出话语权。如果当 VAP 预测发生轮次转换时,前序响应已准备就绪,系统会立即交付该响应。一旦完整的 STT 结果可用,主响应随后跟进。

核心贡献

  • 解耦架构: 本文引入了一个将语音起始时机(由 VAP 控制)与响应准备(由意图就绪检测控制)分离的框架。
  • 上下文相关的序言: 不同于固定的填充词,该系统生成的初步响应是以用户新兴意图为条件的,从而弥合了轮次转换预测与实质性回答生成之间的间隙。
  • 安全约束: 系统对前序响应实施严格的长度和语义约束,以减轻在实际部署中早期预测错误和幻觉带来的风险。

实验结果
该框架在一个日本购物中心的路径引导机器人实验中进行了实地评估。研究对比了三种情况:无填充词固定填充词(如“是的”)以及上下文相关序言

  • 初始响应延迟: 与无填充词基准相比,固定填充词和上下文相关序言条件均显著降低了初始响应延迟。然而,固定填充词条件的初始延迟明显短于上下文相关序言条件。
  • 初始与主响应间隙: 与固定填充词条件相比,上下文相关序言条件在初始响应与主响应之间表现出显著更短的间隙。这表明,虽然序言生成所需的时间比固定填充词略长,但它允许主响应相对于交互开始时更早地交付。
  • 触发时机: 在上下文相关序言条件下,意图就绪检测器平均在 5.53 个字符(最终语句长度的 69.2%)处触发,在 58.2% 的案例中于用户说话结束前触发。
  • 对话中断: 约 8% 的前序响应被标注为中断(例如,片段或通用的提问),这主要是由于输出截断或上下文关联性较弱导致的。
  • 主观评分: 探索性的交互后问卷调查(每种情况 30 人)显示,在对话节奏、自然度、恰当性或满意度方面,四种情况之间均不存在统计学上的显著差异。

意义与主张
本文主张,上下文相关的序言响应为现实世界的对话机器人提供了一种实用的折衷方案。虽然它们无法达到固定填充词那样的绝对最低初始延迟,但它们显著减少了实质性回答交付前的延迟,从而在不依赖不自然、重复填充词的情况下,改善了信息流。

作者谦虚地总结道,虽然该方法通过填充轮次后的等待时间增强了响应生成的实用性,但主观评分缺乏显著差异表明,仍需更大规模、更有针对性的研究来确定其对整体用户体验的影响。研究强调,稳定且具备上下文基础的短促序言生成仍是一个关键瓶颈,未来的工作必须致力于提高序言与主响应之间的语义和韵律连续性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →