← 最新论文
🤖 AI

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

该论文介绍了 Aero Realtime,这是一个 4B 参数量的流式多模态模型,它在共享的时间网格上实现了完全对齐的双工输入输出交互,从而实现了低延迟、主动生成,并具备高效的 KV 缓存复用能力和低于 200 毫秒的处理滞后。

原作者: Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图与一位同样在和你一起看电影的朋友进行交谈。在正常的聊天中,你会等待对方说完一句话后再开口。但在真正自然的对话中,你可能会在对方说话时,在他们还没说完时就插上一句快速的“哇!”;或者在对方解释一个复杂的剧情点时保持沉默,直到你在理解了新内容的那一秒钟立即介入。这就是“实时”交互的终极目标:能够同时倾听和表达,而不失节奏。

长期以来,计算机在这方面表现得很糟糕。大多数 AI 模型的工作方式就像一场礼貌但略显迟钝的“传热豆”游戏。它们等待你讲完整个故事(输入),一次性处理所有内容,然后开始说话(输出)。它们无法在“说话”的同时真正地“倾听”。如果你在它们说话的中途尝试喂给它们新信息,它们会感到困惑或不得不停止并重新开始。这篇论文解决了构建一个真正能够“全双工”(duplex)工作的 AI 的问题——即能够像人类一样,在说话的同时也能听到新事物,并且能跟上快速移动的视频流。

开发这个模型的研发人员来自香港大学及其他机构,他们构建了一个名为 Aero Realtime 的新 AI 模型。把它想象成一个不仅以句子为单位,而是以微小的、有节奏的“时间节拍”进行交流的模型。Aero Realtime 不再等待整个视频结束,而是将时间分解为微小的 80 毫秒块。对于它听到的每一个单块音频,它都必须做出一个瞬间的决策:“我现在应该说出一个词,还是应该保持沉默?”

这是一个巨大的转变。通常,AI 必须完成其“思考”阶段后才能开始其“说话”阶段。而 Aero Realtime 将两者结合在一起。它将视频、音频和它自己的语言对齐到一条单一的、共享的时间线上。想象一下一条传送带,每 80 毫秒就会到达一个新的视频和音频片段。就在那一刻,AI 决定是在传送带上丢下一个词,还是丢下一个“沉默标记”(代表保持安静的占位符)。这使得 AI 即使在生成句子的过程中,也能继续倾听视频的新部分。它永远不会为了“赶进度”而中断流程。

该论文指出,以往尝试让 AI 变得“主动”(准备好说话)的方法都显得笨拙。一些系统使用了“微转折”(micro-turn)方法,即 AI 会不断停下来问自己:“我现在该说话了吗?”这就像一个司机在每个路口都要停下来看地图才能继续前进。另一些系统则使用外部“门控”或开关来决定何时说话,这使系统变得复杂且缓慢。Aero Real太Realtime 拒绝了这些方法。相反,它学习自然的时间感。该模型被训练为将“沉默”视为一个有效的词,就像“你好”或“猫”一样。这意味着 AI 不需要一个单独的开关来决定何时说话;说话或保持安静的决策直接内置于选择单词的同一过程中。

为了实现这一点,团队必须解决一些棘手的工程难题。他们创建了一种特殊的方法,利用实时视频数据和标准的视频问答进行模型训练。他们还设计了一种新的方式在计算机上运行模型,从而节省内存和速度。模型不再是每次有新帧到达时都重新阅读整个视频,而是记住已经处理过的内容,并只添加新的“切片”信息。这就像读一本书,你不需要在翻页时重新阅读第一章,你只需要记住读到了哪里,然后继续向下读即可。

研究结果令人印象深刻,对于这种规模的模型而言。研究人员在一段连续 20 分钟的视频流上测试了 Aero Realtime。即使视频在播放,模型也能将其“延迟”(即视频发生与 AI 发言之间的延迟)控制在中位数 84 毫秒。这比眨眼还要快。甚至在第 95 百分位(意味着 95% 的时间)上,延迟也仅为 173 毫秒。这意味着 AI 始终保持在 200 毫秒内的“真实”时间线内,有效地实现了边听边说。

然而,论文也谨慎地表示,这并不意味着它是世界上理解视频能力最强的 AI。在标准基准测试 OVOBench 上,这个 40 亿参数的模型表现良好,但并未击败那些专为离线、非实时任务设计的、规模更大的 70 亿参数模型。作者认为,这种差距的存在是因为该模型必须学习一种全新的交互方式(“全双工”风格),而且它针对这种特定实时对话类型的专门训练数据,不如旧模型针对传统问题所拥有的数据那样丰富。

简而言之,Aero Realtime 证明了构建一个不仅仅是等待轮到自己说话,而是能够真正进行实时对话、在不费吹灰之力的情况下同时听与说的 AI 是可能的。这是向着让 AI 感觉不再像是一个等待指令的机器人,而更像是一个正在与你一起关注世界的友人的迈进了一步。虽然它目前还不是视频理解领域最聪明的专家,但它是第一个真正掌握了如何跟上时间流动的艺术的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →