← 最新论文
🤖 machine learning

COOPA: A Modular LLM Agent Architecture for Operations Research Problems

COOPA 是一种模块化 LLM 智能体架构,通过基于置信度的迭代建模、元素级溯源解释以及多求解器路由,增强了运筹学决策支持,并在多种基准测试中实现了最先进的准确性与可解释性。

原作者: Chuanhao Li, Xiaoan Xu, Dirk Bergemann, Ethan X. Fang, Yehua Wei, Zhuoran Yang

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Chuanhao Li, Xiaoan Xu, Dirk Bergemann, Ethan X. Fang, Yehua Wei, Zhuoran Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图根据客户一段模糊的描述来制造一台复杂的机器,比如一辆定制汽车。在动手建造之前,你需要弄清楚精确的零件、发动机规格以及安全规则。

运筹学 (Operations Research, OR) 是用于处理这类高风险决策(例如规划送货卡车路线或安排工厂工人排班)的数学领域。问题在于,手动完成这些工作需要具备博士水平的专家。

最近,我们尝试使用 大语言模型 (LLMs) ——即那些能写诗或编写代码的同类 AI ——来帮我们做这些数学运算。但论文指出,目前的 AI 尝试就像雇佣了一名非常自信但略显糊涂的实习生:它们经常把基础数学算错,不解释出错的原因,且只能使用一种特定类型的工具。

于是有了 COOPA (COoperative OPerations Agent,协作运营智能体)。你可以将 COOPA 视为不仅仅是一个单一的工人,而是一个旨在正确构建这些数学模型的专业施工队。它是通过以下三种主要工具来实现目标的:

1. “第二意见”团队 (基于置信度的迭代建模)

目前的 AI 通常尝试解决一个问题,写出代码,然后祈祷它能运行。如果数学逻辑错了,即使代码能跑通,得出的结果也会是错误的。

COOPA 则不同。想象一下,你要求三位不同的建筑师为你的汽车绘制蓝图。

  • 步骤 A: 他们都画出各自的版本。
  • 步骤 B: 一个“安全检查员”(AI 本身)会对每份蓝图进行审查。它不仅仅是说“好”或“坏”,而是针对四个特定部分给出置信度评分(0–100):零件清单(参数)、运动部件(变量)、目标(目标函数)以及安全规则(约束条件)。
  • 步骤 C: 系统会选择那个拥有最高“最差情况”得分的蓝图。

类比: 如果建筑师 A 有完美的发动机但安全规则很糟糕(评分:90, 90, 90, 30),而建筑师 B 的发动机稍弱但安全规则完美(评分:85, 85, 85, 95),COOPA 会选择建筑师 B。因为它知道,一个薄弱环节就会导致整个链条的崩溃。这个过程会重复几次,让 AI 在开始制造机器之前就能修正自己的错误。

2. “纸质审计追踪” (来源可追溯性)

当目前的 AI 给你一个答案时,它往往是一个“黑盒”。你得到了一个数字,却不知道它从何而来。如果你问:“为什么你把工人 A 分配到工位 5?”AI 可能只会回答:“因为我这么认为。”

COOPA 表现得像一名细致入微的法务会计

  • 每当它写下一个变量或一条规则时,它都会附上一张“便利贴”,引用原始问题描述中支撑该内容的准确句子。
  • 益处: 如果最终答案错了,人类专家可以立即查看这些“便利贴”,发现 AI 误读了某句话,并进行修正。它将一个谜团变成了一个透明的审计流程。

3. “专业工具库” (多求解器调度)

想象你有一个工具箱。如果你需要钉钉子,就用锤子;如果你需要切割木头,就用锯子。

  • 目前的 AI 系统通常试图用一把瑞士军刀搞定一切。它们强行将每个数学问题都转化为一种特定的格式(如线性方程),即使该问题实际上是一个需要不同方法的复杂谜题。
  • COOPA 拥有一个包含四种不同专业专家的工具库
    • 数学家: 处理标准的代数和线性方程。
    • 组合数学专家: 处理路径规划和调度谜题(如旅行商问题)。
    • 元启发式算法专家: 处理复杂的非线性问题,这些问题需要进化算法(如寻找汽车零件的最佳形状)。
    • 通用型专家: 处理自定义模拟。

COOPA 会观察问题,识别出它属于哪种“谜题”,然后将其交给对应的专家。这意味着它不会强行将方榫头塞进圆孔里。

结果:效果如何?

作者使用三种不同的数学问题集和八种不同的“大脑”模型(从 GPT-5 到开源模型)对 COOPA 进行了测试。

  • 得分: COOPA 获胜次数最多,在测试的 8 个 AI 模型中,有 6 个模型取得了最高的平均准确率。
  • 提升: 在最强的模型上,它将准确率提升了高达 6.7 个百分点
  • 秘诀: 论文发现,“第二意见团队”(生成并选择最佳蓝图的迭代过程)是成功的关键。如果没有它,COOPA 的表现与其它系统不相上下;有了它,它便成为了明显的赢家。

局限性

论文承认,运行 COOPA 比其他方法更慢、更贵。因为它要求 AI 进行思考、重新思考并对其工作进行三次评估,所以会消耗更多的计算资源。然而,作者认为,对于涉及供应链或公共政策等高风险决策的任务,为了确保数学计算正确而支付额外的成本是值得的。

简而言之:COOPA 是一个通过让 AI 实现“思考两次、展示过程并使用正确工具”来使其更擅长数学的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →