← 最新论文
🤖 AI

Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning

本文提出了 OPTI-Q,这是一个受数据库启发的基于代价的优化框架,它利用统计目录(PERFDB)来生成并选择最优的多大语言模型(multi-LLM)执行计划,在遵循用户定义的成本、延迟和能耗约束的同时,显著提升了回答质量。

原作者: Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:Opti-Q:一种基于约束的多 LLM 问题规划框架

1. 问题陈述

将大语言模型(LLM)部署于问答(QA)任务面临着显著挑战,包括非确定性、异构资源剖面(财务成本、延迟、能耗)以及在不同问题类型上的性能差异。虽然近期的研究表明,协调式的多 LLM 协作可以优于单一的“最佳”模型,但朴素的执行策略(例如,始终查询所有模型或使用固定级联)往往会导致资源利用效率低下、成本更高以及答案质量并非最优。

目前的编排框架(如 LangChain、DSPy)通常依赖于开发者编写的工作流或在执行时做出的即时且短视的决策,而没有考虑下游后果。目前缺乏能够将多 LLM 编排视为基于成本的多目标查询规划问题的系统,即在根据用户指定的约束(预算、延迟、能量)和期望答案质量(QoA)进行执行之前,先选择最优的执行计划(串行、并行或混合模式)。

2. 方法论:OPTI-Q 框架

OPTI-Q 是一个受数据库启发的、基于成本的优化器,它为多 LLM 问答实现了一种“先规划后执行”的范式。它将该问题建模为一个多目标优化(MOO)任务,目标是找到平衡 QoA 与财务成本、延迟和能量的帕累托最优(Pareto-optimal)计划。

A. 建模与形式化

  • 问题模型: 一个问题 QQ 由提示词、主题和用户约束(Fmax,Lmax,Emax,QoAminF_{max}, L_{max}, E_{max}, QoA_{min})以及一个用于目标优先级排序的权重向量 WW 定义。
  • 计划模型: 计划被表示为有向无环图(DAG),其中节点是 LLM 调用(物理算子),边代表数据流。
    • 串行算子(Sequential Operators): 将中间答案作为后续模型的上下文传递。
    • 并行算子(Parallel Operators): 并行运行多个模型。
    • 融合算子(Blending Operators): 使用专门的“融合器(blender)”模型合并来自并行分支的输出。
  • 优化目标: 在满足用户约束的情况下,最大化 [QoA(π),Financial(π),Latency(π),Energy(π)][QoA(\pi), -Financial(\pi), -Latency(\pi), -Energy(\pi)]

B. 核心组件

  1. PERFDB(统计目录):

    • 一个通过基准测试和执行轨迹进行离线及增量填充的性能数据库。
    • 存储单个 LLM 及组合子计划的统计数据(QoA、成本、延迟、能量),并以执行上下文(主题、算子类型、模型)为键进行索引。
    • 实现执行前估计,即无需运行计划即可预估其指标。它通过存储方差估计和置信区间来处理随机性。
  2. 成本效益估计:

    • Token 估计: 基于模型特定的分词器和历史输出长度来预测输入/输出 token 数,从而估计成本。
    • QoA 估计: 使用基于主题的 PERFDB 查找。对于组合计划,它应用从历史轨迹中得出的乘性相对效应因子(用于串行步骤)和平均相对变化因子(用于融合)来估计完整计划的质量。
    • 资源估计: 计算财务成本(固定 + 每 token 变量)、能量(与 token 数成正比)和延迟(随 token 量线性变化,并行分支取最大时间)。
  3. 计划生成与搜索:

    • 编码: 计划被紧凑地编码为连通图(邻接矩阵)和模型分配向量。
    • 搜索空间: 可能的计划空间是组合性的,且属于 NP-hard 优化问题。
    • 优化引擎: OPTI-Q 支持具有三种策略的“可插拔”引擎:
      • 动态规划(DP): 用于小规模实例的精确求解器;使用剪枝技术来管理状态空间爆炸。
      • 爬山算法(HC): 用于快速局部搜索的轻量级贪婪启发式算法。
      • NSGA-II: 作为默认算法,用于大型计划空间的多目标进化算法,用以逼近帕累托前沿(Pareto frontier)。
    • 选择: 优化器生成一组非支配的可行计划。最终计划根据应用于归一化目标的权重 WW 进行选择。

C. 实现

  • 系统: 集成了优化器与执行引擎的模块化框架。
  • 模型: 使用通过 Ollama 在本地运行的五个开源模型(Gemma-3:27B, LLaMA3-ChatQA, Qwen2.5, Phi-4, Mistral)进行测试。
  • 融合: 使用 Gemma-3:27B 作为指定的融合器,其表现优于 GenFuser 等专门组件。
  • 提示词: 采用带有特定上下文和融合提示词的零样本(Zero-Shot)提示技术来引导模型行为。

3. 主要贡献

  1. 成本/效益形式化: 将多 LLM 问答规划形式化为一个受约束的多目标优化问题,明确平衡了 QoA、成本、延迟和能量。
  2. 统计驱动的优化器: 一个能够枚举并剪枝串行/并行/混合工作流的系统,利用历史统计目录(PERFDB)在执行前估计质量和资源成本。
  3. 集成系统: 一个能够实时在开源 LLM 之间进行动态路由、选择最优执行图的工作原型。

4. 实验结果

该框架在 MMLU-Pro(多项选择)和 SimpleQA(开放式问题)基准测试中,针对四种最先进的基准模型(ThriftLLM, LLM-Ensemble, FrugalGPT, LLM-Blender)进行了评估。

  • 性能提升: 在用户指定的预算下,在相同单问题成本的前提下,OPTI-Q 在 SimpleQA 上的平均 QoA 提升了 ≈58%,在 MMLU-Pro 上提升了 ≈41%(相比于最强的预算感知基准模型)。
  • 可扩展性: NSGA-II 提供了最佳的扩展性-质量权衡,在规划时间处于低数十秒量级时(例如 k=5k=5 个操作时为 21 秒),仍能保持接近参考值的帕累托前沿质量。
  • 对数据稀缺的鲁棒性: 在“冷启动”场景(Level 0 PERFDB 覆盖度)下,OPTI-Q 仍然优于基准模型。随着历史数据的增加(Level 1–4),QoA 显著提高(例如 MMLU-Pro 提升了 +66.7%),且资源估计误差大幅下降。
  • 预算遵循度: 系统保持了较高的预算遵循度(88–96%),超支主要由成本而非延迟驱动。
  • 与商业 API 的比较: 在 SimpleQA 上,OPTI-Q 实现了比商业模型(如 Claude Opus 4.6, GPT 5.4)更高的 QoA,同时成本显著更低(在计算外部服务器成本时,分别低 37.8 倍和 14.5 倍)。在 MMLU-Pro 上,它以极低的成本实现了具有竞争力的质量(0.82 对比 Gemini 3.5 Flash 的 0.871)。

5. 重要性与主张

本文声称,基于数据库风格的规划比动态、短视的编排或固定集成能带来更好的质量-资源权衡

  • 范式转变: 本文证明了将 LLM 编排视为声明式查询规划问题(而非程序化脚本任务),可以实现动态的、针对特定问题的自适应,从而在约束条件下最大化效用。
  • 实际可行性: 结果表明,结构化的、统计驱动的规划为自适应 LLM 编排提供了实用的基础,使系统能够在不依赖昂贵、高能力的商业 API 的情况下,平衡性能与效率。
  • 未来潜力: 作者认为,这种“先规划后执行”的抽象可以从问答扩展到更丰富的检索增强生成(RAG)和智能体(Agentic)工作流,前提是可以通过统计目录对新的算子进行类似的成本效益特征化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →