FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
FlashRT 是一个代理控制框架,它引导编程代理将简单的参考实现自动转化为针对多样化硬件平台的高度优化、实时多模态部署,通过一种涉及中间表示、静态分析和迭代基准测试的新颖程序链范式,实现了显著的延迟降低和吞吐量提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图构建一款超快速、实时的视频游戏,其中的角色可以立即听取你的声音、思考并对你做出反应。为了实现这一点,你需要将几个不同的“大脑”(AI 模型)串联起来:一个负责倾听你的声音,另一个负责思考回复,第三个负责将回复转化为语音,第四个负责驱动面部表情以配合说话。在计算机科学领域,这被称为“多模态应用”。棘手之处不仅在于拥有这些“大脑”,还在于如何让它们协同工作而不互相干扰。如果你把它们全部放在一个微小的处理器上,它们的运行速度会太慢;如果你把它们分散得太开,它们又会因为彼此通信而浪费大量时间。多年来,专家们不得不为每一个新的应用手动构建定制的“交通控制系统”,这个过程缓慢、昂贵且难以重复。
于是,“AI 智能体”(AI agent)的概念应运而生。你可以把它想象成一个超级聪明、不知疲倦的数字实习生,能够阅读代码并重写代码以使其运行得更快。但问题在于:如果你只是要求这个实习生“让它变快”,它往往会感到困惑,尝试一些随机的操作,或者错过最佳技巧,因为这个问题极其复杂。这就像是要求一个人在脑海中重新排列一个巨大的、移动中的拼图,却从未写下任何碎片信息。这就是名为 FlashRT 的新系统发挥作用的地方。它不仅仅是让 AI 去瞎猜,而是给 AI 一个结构化的行动计划、一套工具以及一种测试自己想法的方法,将一场混乱的猜测游戏转变为一项精确的工程壮举。
问题所在:AI 的交通拥堵
该论文的作者注意到,实时应用(如语音助手或实时视频生成器)正变得越来越流行,但运行起来却是一场噩梦。这些应用就像是流水线,不同的机器(模型)承担着不同的任务。有时,你希望整条流水线的整体速度尽可能快(高吞吐量);有时,你希望第一个产品出来的速度尽可能快(低延迟)。
问题的关键在于,这些机器的最佳排列方式会根据你的需求而改变。如果你追求速度,你可能希望将机器拆分到不同的计算机上并行工作;如果你追求低延迟,你可能希望将它们靠得更近,以免在数据传输上浪费时间。现有的系统过于僵化,迫使你在一种固定的排列方式中做选择。其他工具虽然试图实现自动化,但仅适用于简单的单项任务,无法处理这些复杂的、多步骤的流水线。结果就是:开发者被迫为每一个新应用手工打造定制化的解决方案,这无法实现规模化。
解决方案:FlashRT 与“程序链”
研究人员开发了 FlashRT,这是一个利用 AI 编程智能体来自动设计任何多模态应用完美部署方案的系统。但他们并没有直接告诉 AI:“去修复它。”他们意识到,如果你让 AI 直接跳向解决方案,它往往会失败。它可能会找到一个好办法,却忽略了其他的,或者发明一个在理论上看起来很好但在实际运行时会崩溃的方案。
为了解决这个问题,FlashRT 使用了一种被称为**“程序链”(Chain-of-Program)范式**的巧妙策略。想象你是一名正在试图破解谜团的侦探。你不是直接进行逮捕,而是先画出一张犯罪现场的地图,记录下谁在哪里以及他们在做什么。然后,你分析这张地图以寻找线索。最后,你测试你的理论。
FlashRT 对代码也做了同样的处理:
- 地图(中间表示): 首先,AI 智能体会将开发者编写的简单、缓慢的代码翻译成一种结构化的“地图”(称为中间表示或 IR)。这张地图清晰地展示了数据如何在不同的模型之间流动,以及它们在哪里共享内存。这迫使 AI 在尝试修改之前先放慢速度,理解其结构。
- 分析: AI 会观察这张地图以寻找机会。例如,它可能会发现模型 A 不需要完全等待模型 B 完成,只要模型 B 产生了一小部分数据,模型 A 就可以开始工作。这就像厨师在水烧开之前就开始切菜,而不是等水开了才去碰菜刀。
- 试驾(验证循环): 这是最关键的部分。AI 不仅仅是在猜测;它会构建一个“测试套件”。它模拟一个真实用户与应用交互的过程,输入虚假数据并测量输出返回的具体速度。如果 AI 的新设计变慢了或者产生了错误的答案,它会立即察觉。然后它会尝试另一种策略,再次测试,并不断迭代,直到找到最佳配置。
结果:加速未来
团队在几个现实世界的应用上测试了 FlashRT,包括面对面对话智能体、视频背景编辑器和视频世界模型。结果令人印象深刻。
在 NVIDIA B200 GPU 上,FlashRT 能够将一个基础且缓慢的实现转化为高速部署,将获取首次响应的时间(延迟)降低了高达 70 倍。它还将系统处理连续流的速度(吞吐量)提升了 2.8 倍。
更有趣的是,他们在 AMD MI355X GPU 上也进行了测试,这是一种专家尚未进行大量优化的不同类型的硬件。FlashRT 不仅能正常工作,而且表现出色。它不仅匹配了延迟方面的改进,实际上还将吞吐量提升了 3.6 倍。在针对 Qwen3-Omni 模型的一个特定测试中,与人类专家构建的系统相比,FlashRT 将响应时间缩短了 65%。
为什么这很重要
这篇论文表明,我们不需要等待人类专家为每一个新的 AI 应用进行手动调优。通过赋予 AI 智能体一种结构化的思考方式(地图)和一种测试想法的方法(验证循环),我们可以自动生成高效的系统,使其能够适应不同的硬件和不同的目标。
作者谨慎地指出,虽然这是一个巨大的进步,但它并不是解决一切问题的万灵药。他们尚未将 AI 的能力整合到模型内部的微观、底层数学运算优化中,且目前仅测试了一种特定类型的 AI 智能体。然而,核心结论是明确的:有了正确的引导,AI 智能体可以学会设计复杂的实时系统,其速度和灵活性都将超越我们今天能够通过手工构建实现的水平。这是一种从“手工打造”未来向“引导”未来的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。