← 最新论文
⚡ electrical engineering

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

VoiceMem 是一种用于对话系统的创新流式记忆架构,它通过整合并行信息处理与情感处理,以极低的延迟实现了最先进的准确性、个性化和实时性能。

原作者: Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一种对话:对方不仅记得你说了什么,还记得你说话时的语气、你在谈论谁,以及你一周前对这件事的感觉。几十年来,会说话的计算机程序一直像是有失忆症一样;它们能以惊人的速度处理你当前的句子,但一旦对话暂停,语境就会消失。它们缺乏“灵魂”,因为它们缺乏一种具有人类感的记忆。这正是研究人员一直试图弥补的差距:构建一个能够留住事实、追踪你的个性并感知你的情绪,同时还能跟上实时语音快速节奏的系统。挑战在于,人类的对话发生在转瞬之间,说话者之间的停顿通常不到半秒。任何在搜索自身记忆时耗时过长的系统都会破坏流畅度,使交互显得机械且尴尬。

一组研究人员现在推出了一种名为 VoiceMem 的新系统,专门旨在解决这个问题。他们并没有试图强迫一个单一的、庞大的记忆库去做所有事情,而是构建了一个双脑架构,将工作分配给两个专门的部分。其中一部分是“左脑”,它充当高效的事实图书管理员。它将信息组织成清晰的类别,如工作、健康或家庭,并使用智能索引系统来瞬间找到最相关的细节。另一部分是“右脑”,它致力于处理人类元素。它追踪你的性格特征、情绪状态,以及你对特定人物或事件的感觉。这两个大脑并行工作,随着你的说话不断更新,确保系统不仅知道你提到了一个会议,还知道你对该会议感到焦虑,并且是你的老板导致了这种焦虑。

这项工作的真正突破在于其系统的快速与轻量化。在以往的尝试中,搜索一段记忆可能需要两到三秒,这对于自然对话来说实在太长了。然而,VoiceMem 在仅用 134 毫秒的时间内就完成了整个搜索过程。这种速度是通过一个四阶段流式处理过程实现的,该过程在你开始说话的那一刻就开始了。当你还在说话时,系统已经在准备搜索。当你结束句子且计算机检测到短暂停顿时,系统已经检索到了必要的记忆并准备好做出回应。这一切发生得如此迅速,以至于完全契合在对话的自然停顿之中,不会为用户增加额外的延迟。

为了证明该系统的有效性,研究人员将其与现有的记忆工具进行了对比测试,涵盖了从简单的事实核查到复杂的逻辑推理等各种场景。他们发现,即使只被允许查看极少数的记忆——仅五项内容——而非其他系统通常扫描的数百或数千项,这种双脑方法也比以往的方法更准确。在涉及长对话和音频录制的测试中,该系统的表现大幅领先于现有的最佳工具。它成功地回想起关于用户生活的特定细节,理解了他们的偏好,甚至识别出了其他系统所忽略的情绪基调。例如,当用户提到他们在咖啡馆听到的一首歌时,系统可以回想起那个特定的音频事件,这是基于文本的系统永远无法做到的。

研究人员还展示了该系统可以适配不同类型的底层记忆引擎,表明这种新架构具有灵活性,并不受限于特定的技术。他们创建了一个大规模的对话数据集来训练系统,教会它如何在速度与准确性之间取得平衡。结果表明,通过将事实信息与情感语境分离并同时进行处理,赋予人工智能一种既聪明又具同理心的记忆形式是可能的。这项工作不仅改进了计算机记忆的方式,更改变了它们交互的方式,使其能够从简单的问答工具转变为能够理解人类生活完整语境的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →