← 最新论文
🤖 AI

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

本文通过证明专门的动态规划可以显著增加 GPU 并发工作量,以及将路径决策保留在设备端可以避免昂贵的宿主端往返并在保持正确性的同时提高效率,从而确立了优化 LLM-agent 控制中 GPU 执行的两大关键门槛:截止日期可行的队列供应和观测放置。

原作者: Josef Liyanjun Chen

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Josef Liyanjun Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个规模宏大、高速运转的火车站,成千上万的小型自动化机器人不断抵达,提出问题并等待指令。在人工智能的世界里,这些机器人被称为“智能体”(agents),它们使用巨大的类脑计算机(称为 GPU)进行思考,然后运行小型工具来完成任务。但问题在于:每当机器人完成一次思考,它都必须跑回中央控制室(CPU)去询问:“我下一步该做什么?”这种往返过程就像一名运动员从赛道冲向教练帐篷,领取新指令,然后再冲回赛道。如果机器人又小又快,但去帐篷的路程却很慢,整个系统就会陷入交通拥堵。科学家们长期以来一直在思考:我们能否让教练留在赛道上陪着运动员?我们能否把机器人组合在一起,让它们能同时获取下一步指令,而无需离开赛道?这就是“智能体控制”的难题,它决定了是一场流畅、超高速的比赛,还是一场混乱、慢动作的拥堵。

这篇题为《Ready Cohorts》的论文正是在解决这个交通拥堵问题,它提出了两个简单但棘手的疑问:首先,是否会有足够多的机器人同时出现,从而让集体行动变得值得?其次,如果确实如此,将决策过程保留在赛道内部(即 GPU 上)是否真的能节省时间,还是仅仅是一个行不通的花哨技巧?

研究人员设计了两个不同的实验来寻找答案。在第一部分中,他们观察了一段大规模的机器人运动历史(一个包含 851 个会话的“轨迹”),以查看可以将多少机器人组合在一起。他们将一种标准方法(类似于无论有多少人都会在固定时间点出发的公交车)与一种更聪明的“精确”方法(即只等待足够长的时间以抓取完美的群体)进行了比较。他们发现,智能方法实际上可以抓取 43.00% 的机器人,而固定窗口方法仅能抓取 30.19%。这是一个巨大的差异!这意味着,通过灵活调整时间,你可以回收大约 81.83% 的流失机会。然而,他们也发现了一个硬性限制:如果对群体规模的要求过高(具体来说,如果需要 256 个机器人才能组成一个组),系统往往无法在短时间窗口内找到足够的机器人,尤其是在活跃机器人总数较低的情况下。在这些情况下,“分组”的想法就会崩溃,机器人只能孤军奋战。

在第二部分研究中,团队测试了“留在赛道上”这个想法。他们建立了一个模拟环境,其中一个机器人做出一个二元决策(例如“左转”或“右转”)。他们对比了两种处理方式:一种是将决策发回给主机计算机(教练帐篷),然后再发回给机器人;另一种是将决策保留在赛道原地(GPU)。结果非常明确:将决策保留在赛道上总是更快。在四种不同的计算机硬件配置下,“留在赛道上”的方法比发送决策往返的方法快了 1.19 倍2.39 倍。例如,在一种特定的设置中,快速方法耗时约 258 微秒,而慢速方法则耗时 467 微秒

然而,论文非常谨慎,没有过度夸大其词。他们明确排除了几种设想。他们测试了一种“嵌套”方法,即尝试在不发送决策的情况下在赛道上启动下一步,但并未真正移除决策步骤。这种方法失败了;在每一次测试中它都更慢。这证明了提速并不在于在赛道上启动得更快,而恰恰在于不需要将那个微小的决策传回教练的帐篷。

那么,底线是什么?论文表明,我们可以加速这些 AI 智能体,但必须满足两个条件。第一,我们需要有足够多的机器人同时到达以形成一个群体(即“群体供应”)。第二,我们必须将决策过程保留在工作发生的地方,避免那段返回中央计算机的漫长旅程。如果这两个条件中有一个未满足,那些华丽的 GPU 技巧就不会起作用,系统最好还是坚持使用旧的、可靠的方式。作者总结道,虽然潜力是存在的,但构建一个结合了这两个想法的现实世界系统是下一个重大挑战,并且需要用真实的交通流量而非仅仅是模拟环境来进行测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →