← 最新论文
💻 computer science

Accelerating Heterogeneous Agent Collaboration in Dynamic Edge Networks

本文介绍了 PRADA,这是一个利用离线训练的过程奖励模型将推理质量蒸馏到轻量级本地筛选策略中,并采用服务端拉格朗日调度器来动态管理资源竞争的框架,从而在保持异构边缘-LLM协作中准确度的同时显著降低了延迟。

原作者: Tianji He, Yulin Shao, Fen Hou

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianji He, Yulin Shao, Fen Hou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座巨大且繁忙的城市,每个人都在试图解开一个庞大而棘手的谜题。在这座城市的中心,矗立着一座高耸、超级聪明的图书馆(即“服务器”),它掌握着几乎所有问题的答案,但由于规模过于宏大且运行缓慢,获取其中的一本书需要很长时间,并会导致道路拥堵。与此同时,城市里的每个人都拥有一本小巧、快速的笔记本(即“边缘设备”),可以瞬间解决简单的谜题,但有时会在真正困难的部分卡壳。科学家们面临的核心问题是:我们如何让每个人在处理简单步骤时使用自己的快速笔记本,而只在遇到困难部分时才跑去那座大图书馆,且不造成交通拥堵?这就是“边缘网络”中“异构智能体协作”(Heterogeneous Agent Collaboration)的挑战——这是一种高级说法,意指如何让小型、快速的计算机与大型、缓慢的超级计算机在道路拥挤且不可预测的情况下高效协作。

于是,PRADA 框架出现了,这是研究人员天际(Tianji He)、邵玉林(Yulin Shao)和侯芬(Fen Hou)提出的一种旨在解决这场交通拥堵的新策略。可以将 PRADA 想象成一位聪明的交通控制器,它使用了一个秘密技巧:它并不要求那座超级聪明的图书馆实时检查每一个谜题的每一个步骤(因为这会耗费极长时间并导致巨大的延迟),而是仅在一段安静的“非高峰时段”训练期间使用图书馆的大脑。在这段训练期间,图书馆会教导一个微型、超快速的“教练”(一个轻量级策略网络),让它学会如何识别哪些谜题步骤对于本地笔记本来说太难了。一旦训练完成,图书馆就会回去休息。现在,当用户开始一个谜题时,他们的本地教练会立即做出决定:“这一步很简单,我自己来,”或者“这一步很棘手,我要把它发给大图书馆。”

论文在一个动态环境中模拟了这个系统,在这个环境中,用户不断地到达和离开,而“道路”(网络带宽)和“图书馆办公桌”(服务器处理能力)都是有限的。研究人员发现 PRADA 非常有效。它在保持超级聪明图书馆的准确性(保留了大部分推理质量)的同时,大幅缩减了获取答案所需的时间。在他们的模拟实验中,该系统展现出了一个迷人的“阈值效应”。想象一下,服务器的容量是办公桌的数量,比如 9 张。当他们少于 9 张办公桌时,系统一团糟,任务在长队中等待。但一旦他们达到了这个神奇的数字 9,等待的队伍就消失了,而且增加更多的办公桌也几乎不再带来帮助。同样,他们发现了一个特定的道路宽度(带宽),使得数据传输变得足够快;超过这个点后,即使增加更宽的道路也不会让系统更快,因为瓶颈已经转移到了图书馆的处理速度上。

论文明确反对将“过程奖励模型”(PRM)——一种预测推理步骤是否正确的工具——作为在线实时检查器的做法。他们证明,如果你尝试为每个用户的每一步都运行这个沉重的检查器,由于其巨大的成本和延迟,系统将会陷入停滞。相反,PRADA 证明了你可以将检查器的智慧提炼到一个微型、轻量级的教练模型中,并在用户设备上本地运行。这种方法在不同的推理任务(如数学问题和复杂问题)中都得到了测试,结果表明,这种两阶段方法(本地筛选结合集中式调度)是处理繁忙、动态网络中的混乱情况的一种稳健方式,且无需针对每种新的谜题类型对系统进行单独调优。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →