Coordinated Networking for On-Device Agent-Augmented Real-Time Communication
本文提出了 HFS,这是一个利用应用引导的多流传输方法来有效管理端侧智能体增强型实时通信中实时视频与智能体上下文流量之间网络争用的框架,从而显著提升了视频质量并降低了智能体响应延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正身处一场热闹的数字派对,每个人都试图同时做两件事:进行一场生动、面对面的交谈,并借助一个超级聪明的机器人助手,共同完成一个庞大且复杂的项目。在计算机科学领域,这被称为“实时通信”(Real-Time Communication, RTC),它是驱动 Zoom 或 Teams 等视频通话的技术。通常情况下,这些视频通话只是关于人类交谈的。但一波新的技术浪潮正在引入“AI 智能体”(AI agents)——这些是能够为你阅读文档、寻找事实并撰写草稿的智能程序。科学家们提出的一个大问题是:当你的视频通话正试图传输你的脸部画面,而你的机器人助手又试图传输大量数据来完成工作时,会发生什么?如果它们争夺同一个互联网连接,其中一个很可能会陷入停滞,导致视频卡顿或机器人响应极其缓慢。
这篇论文介绍了一个名为 HAFS(人类-智能体流调度,Human-Agent Flow Scheduling)的巧妙新系统,用以解决这个交通拥堵问题。研究人员发现,当你尝试直接在自己的设备(如笔记本电脑或手机)上运行这些 AI 智能体,而不是在巨大的云端服务器上运行时,你会获得更好的隐私保护和更低的成本,但也会创造出一种新型的网络流量混乱。他们发现,如果没有一名“交通警察”,机器人的数据洪流会占领道路,导致你的视频出现卡顿和模糊,或者让机器人在等待数据到达的过程中处于闲置状态。HAFS 就像一个超级有序的交通控制器,它准确地知道视频需要多少空间才能保持流畅,以及机器人需要多少空间才能快速工作。通过这种精细的平衡,该系统确保了你的视频保持清晰,同时也让你的 AI 助手以创纪录的速度完成任务。
问题所在:数字双车道高速公路
把你的互联网连接想象成一条双车道的公路。在其中一条车道上,你有“人类视频”,它就像是一群高速赛车。这些车需要平稳且持续地移动;如果遇到交通拥堵,视频就会冻结,对话也会中断。在另一条车道上,你有“智能体上下文”(Agent Context),它就像是一支运送巨大箱子的重型货运卡车车队,负责运送信息。这些卡车试图交付数据,以便 AI 能回答诸如“总结这份 1000 页的法律合同”之类的问题。
问题在于,在目前的视频通话系统中,这两条车道并不互通。当货运卡车(AI)接到一个大订单时,它们就会开始尽可能快地行驶,填满整个公路。这会导致赛车(你的视频)被堵在它们后面的交通拥堵中。视频系统看到延迟后会感到恐慌,认为道路出现了故障,因此会将车辆速度降至极慢,使你的视频看起来充满像素点且质量低下。与此同时,AI 卡车仍然卡在拥堵中,等待道路畅通。
研究人员在 Zoom 和 Microsoft Teams 等真实的视频通话平台上测试了这一点。他们发现,当他们尝试在视频通话中同时发送 AI 数据时,视频质量下降了一半以上。更糟糕的是,一旦 AI 完成任务,视频需要超过 30 秒才能恢复到正常速度。这是一个既混乱又低效的过程,无论是人类还是机器人,都无法很好地完成工作。
解决方案:HAFS,聪明的交通警察
为了解决这个问题,团队构建了 HAFS,这是一个像坐在你的视频通话应用内部一样的智能交通警察。HFS 不再让视频和 AI 互相争夺空间,而是观察整条公路,并决定每条车道应该跑多快。
1. “帧级”监视器
HAFS 的第一个职责是密切监视视频车道。它不仅仅看平均速度,还会观察每一帧视频之间的微小间隙(就像翻页书里每一帧之间的间隔)。系统知道视频可以容忍极短的等待,但只能达到特定的限度(约 150 毫秒)。如果 AI 卡车开始将视频赛车推向那个限度边缘,HAFS 会立即命令卡车减速。但如果路上有额外的空间,HAFS 会告诉卡车加速,填满空闲的车道。通过这种方式,视频保持流畅,同时 AI 也能利用所有可用的额外空间而不引发碰撞。
2. “预测性”调度器
第二个职责更加聪明。有时,AI 需要一次发送许多辆卡车来回答一个问题。在旧系统中,这些卡车会像在收费站排队一样一个接一个地等待,这非常缓慢。然而,HAFS 会观察每辆卡车携带的箱子大小,并预估一旦到达后拆解它们需要多长时间。然后,它会以完美的顺序排列这些卡车,使得当一辆卡车到达并开始拆解时,下一辆已经停靠在卸货码头旁了。这被称为“流水线作业”(Pipelining)。这就像一位厨师在第一道菜还在煎的时候,就开始切第二道菜所需的蔬菜,从而确保没有任何环节处于闲置状态。
结果:更快、更清晰的未来
研究人员在包括 MacBook Pro、三星 Galaxy 手机和一台名为 Jetson 的小型计算机在内的真实设备上测试了 HAFS。他们进行了不同类型的 AI 模型和网络速度(从 Wi-Fi 6 到 5G)的模拟实验。
结果令人印象深刻。与传统方法相比,HAFS 使视频质量提升了 1.5 倍。同时,它将 AI 的响应时间缩短了 31%。在某些情况下,由于不再被困在交通拥堵中,AI 完成任务仅需 16 秒,而通常则需要 105 秒。
论文指出,这种方法是让 AI 助手成为我们视频通话常态化组成部分的一种极具前景的方式,且不会破坏使用体验。通过让人类和机器人和谐共处,我们可以拥有高质量的视频通话,同时 AI 始终准备好提供帮助,就在你的本地设备上,既保护了你的隐私,又保证了互联网的顺畅运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。