← 最新论文
🤖 AI

INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

INFRAMIND 是一个基于强化学习的框架,通过根据实时基础设施状况动态调整拓扑规划、模型路由和请求调度,来优化多智能体大语言模型(LLM)编排,从而在高并发负载下显著提高准确性、降低延迟并维持严格的服务水平目标(SLO)。

原作者: Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营一家繁忙的餐厅厨房。你拥有一支不同技能水平的厨师团队(即 AI 模型):有些是名厨,能完美烹饪复杂的菜肴但耗时较长;而另一些是快速的档口厨师,能够快速处理简单的订单。

在目前大多数 AI 系统运作的方式中(论文中所称的“基础设施盲视”/ Infrastructure Blindness),经理仅根据顾客想要什么来分配订单,而忽略了厨房当前的状况

问题所在:“盲目”的经理

如果一位顾客点了一份复杂的牛排,经理会盲目地将订单发送给最擅长做牛排的名厨。但经理没有看到名厨已经正埋头于另外 100 个订单之中,导致排队严重。与此同时,一位完全可以胜任这份牛排任务、且能力尚可的档口厨师却正闲着没事干。

这导致了两个大问题:

  1. 瓶颈问题: 名厨的排队序列变得极长,导致顾客为了等一份原本 5 分钟就能做好的牛排而等待了 30 分钟。
  2. 人才浪费: 档口厨师处于闲置状态,尽管他们本可以提供帮助,但经理从未检查过他们是否空闲。

在 AI 世界中,当多个 AI 智能体协同工作时,这种情况就会发生。如果一个 AI 被卡在“队列”(等待处理)中,整个推理链条的速度就会变慢,系统也会浪费昂贵的计算资源。

解决方案:INFRAMIND(“聪明”的经理)

该论文介绍了一种名为 INFRAMIND 的新系统,它像一位时刻观察厨房实时状态的超级聪明经理。它以三种不同的方式做出关键决策:

1. 规划者(菜单设计师)

  • 旧方式: 仅根据订单决定食谱结构。“这是一道复杂的菜,所以我们需要一个包含名厨参与的 5 步计划。”
  • INFRAMD: 先观察厨房情况。“名厨现在非常忙。让我们简化计划。我们将使用一个更短、更简单的食谱,由档口厨师快速完成。”
  • 类比: 如果厨房很混乱,经理会将菜单从 10 道菜的品鉴套餐切换为快速美味的三明治。如果厨房很清闲,他们就会全力呈现精致的 10 道菜大餐。

2. 执行者(订单传送员)

  • 旧方式: 将每个请求都发送给“最强”的模型,而不考虑它们有多忙。
  • INFRAMIND: 在每一步都会检查排队情况。“名厨的队列已满,但档口厨师的队列是空的。让我们把这一步交给档口厨师。此外,既然我们通过跳过长队节省了时间,那我们就让档口厨师多思考一会儿(使用‘深度思考’/ DeepThink),以确保答案质量依然很高。”
  • 类比: 与其强迫顾客在 VIP 处排长队,经理会引导他们前往一个有合格员工在等待的快速通道,确保他们在无需等待的情况下获得优质结果。

3. 调度器(优先级列表)

  • 旧方式: 先到先得。如果一个 5 分钟内到期的顾客在 1 小时后到期的顾客之后到达,慢的那个会先被服务。
  • INFRAMIND: 使用“最早截止时间优先”规则。它会查看顾客的时间限制。“这位顾客需要在 2 分钟内拿到食物!即使他们来得晚,也要把他们移到队伍最前面。”
  • 类比: 这就像急诊室的分诊制度。需求最紧急的人会被优先救治,而不是最早到达的人。

结果:为什么这很重要

论文在五种不同的困难任务(如数学、编程和逻辑谜题)以及不同的流量水平(从清闲的厨房到高峰时段)下测试了该系统。

  • 低流量时: INFRAMIND 比旧系统更准确,因为它知道自己有额外的时间,可以利用“名厨”进行深度思考。同时,它也快了高达 7 倍
  • 高流量时(高峰时段): 这是旧系统失效的地方。它们不断向同一批忙碌的厨师发送订单,导致排队过长,最终导致系统崩溃(99% 的请求无法按时完成)。然而,INFRAMIND 却能保持厨房运转顺畅。即使其他系统的成功率跌至 50% 以下,它仍能维持 99.9% 的成功率

核心结论

INFRAMIND 解决了当前 AI 系统的“盲视”问题。它不仅询问“哪个 AI 最聪明?”,还会询问“哪个 AI 现在最聪明有空?”通过观察实时流量和队列,它能自动平衡速度与质量,确保 AI 系统即使在重载情况下也不会陷入交通拥堵。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →