← 最新论文
🤖 AI

LLMs as Orchestrators: Constraint-Compliant Multi-Agent Optimization for Recommendation Systems

本文介绍了 DualAgent-Rec,这是一个由大语言模型协调的双智能体框架,它通过自适应地编排专门的利用智能体和探索智能体,在电子商务推荐系统中实现了 100% 的约束满足率并提升了多目标性能。

原作者: Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一家规模巨大的在线商店。你的目标是向顾客展示 10 件他们一定会喜爱的产品。但你的工作非常棘手:你需要同时平衡三件事:

  1. 准确性(Accuracy): 向他们展示他们真正想要的东西。
  2. 多样性(Diversity): 不要只给他们看 10 双红色的鞋子;要展示鞋子、帽子和包包。
  3. 硬性规则(Hard Rules): 你必须遵守严格的业务法律。例如,“你不能只展示来自一个卖家的商品”、“你必须包含至少一件新品”以及“你不能过度偏向某一类别的商品”。

在过去,计算机系统尝试通过将“硬性规则”视为“软性建议”来解决这个问题。它们会说:“尽量遵守规则,但如果你发现了一个虽然违反了规则但非常棒的产品,也没关系。”但在现实世界中,这简直是一场灾难。如果系统哪怕仅有一次违反了规则,企业就可能损失金钱或信任。

论文 《LLMs as Orchestrators》(作为编排者的大语言模型) 介绍了一种名为 DualAgent-Rec 的新系统来解决这个问题。以下是它的工作原理,我们使用简单的类比来解释:

1. 两支专业化团队(双智能体/Dual Agents)

与其让一个大团队同时尝试做所有事情,该系统将工作拆分为两个专门的小组,就像一个有两个不同施工队的建筑工地:

  • “开发型”团队(精炼者/The Refiners): 这个团队就像一位名厨,只烹饪那些已知美味且安全的菜肴。他们的任务是获取那些符合规则的最佳推荐,并将其打磨得尽善尽美。他们非常谨慎,绝不会违反规则。
  • “探索型”团队(冒险者/The Adventurers): 这个团队就像一群疯狂的发明家。他们被允许尝试疯狂的组合并暂时打破规则。他们可能会提出一个来自同一卖家的商品过多的列表,但通过这种方式,他们可能会意外地发现一颗隐藏的瑰宝,或者发现一种“精炼者”永远不会想到的产品混合新方法。

2. LLM 指挥家(编排者/The Orchestrator)

在过去,这两个团队是由一个僵化的时间表来管理的(例如:“70% 的时间给精炼者,30% 的时间给冒险者”)。

本论文引入了一个 大语言模型 (LLM) 来担任 指挥家经理

  • 指挥家实时观察这两个团队。
  • 如果“冒险者”发现了很棒的新点子,而“精炼者”陷入了停滞,指挥家会说:“给冒险者更多的时间!”
  • 如果“精炼者”做得很好,而“冒险者”只是在不断犯错,指挥家会说:“把更多精力集中在精炼者身上以完成工作。”
  • 指挥家不仅仅是遵循剧本;它会思考进度并动态决定给每个团队分配多少能量。

3. “软化”安全网(自适应松弛/Adaptive Relaxation)

想象一下你正试图把一个方榫头塞进一个圆孔里。如果你立即强行塞入,它是塞不进去的。
该系统使用了名为 自适应松弛(Adaptive Relaxation) 的技巧。

  • 初期阶段: 系统假装规则稍微变得“软”了一些。它允许“冒险者”尝试一些“接近正确”的方案。这有助于他们在不被立即卡住的情况下更自由地探索。
  • 后期阶段: 随着系统接近最终答案,规则会慢慢地“硬化”回其原始的严格形式。
  • 结果: 当系统结束时,每一份推荐列表都 100% 符合硬性规则,但由于系统在开始阶段被允许有一定的灵活性,它找到了更好的解决方案。

他们发现了什么?

研究人员在包含美容、电子产品和服装的海量亚马逊评论数据集上进行了测试。

  • 100% 规则合规性: 与有时会违反规则的其他系统不同,该系统完美地遵守了每一项业务约束。
  • 更好的平衡: 它在展示准确商品与多样化商品之间,找到了比以往方法更好的平衡点。
  • LLM 起到了作用: 带有“指挥家”(LLM)的系统表现略优于使用固定时间表的系统,这证明了 AI 经理可以在如何分配工作方面做出更聪明的决策。

核心结论

这篇论文表明,我们不仅可以将 AI 用于 挑选 产品,还可以用它来 管理挑选产品的过程。通过将工作拆分为“安全团队”和“冒险团队”,并让一个 AI 经理决定如何平衡它们,同时逐步收紧规则,我们可以创建出既高质量又严格符合业务法律的推荐列表。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →