← 最新论文
🤖 AI

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

本文介绍了 CAPO,一种约束感知提示词优化方法,该方法利用具有自适应约束权重的原对偶方法,在确保遵循安全性和格式等操作约束的同时,有效优化大语言模型(LLM)智能体系统的提示词以提升任务性能,并提出了一种动态变体(DCAPO),通过训练一个专门的重写器,在不修改底层任务智能体的情况下,在不同领域实现可行且高性能的提示词。

原作者: Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型正越来越多地被部署用于执行任务,而不仅仅是聊天。这些数字智能体被赋予了一套指令,即系统提示词(system prompt),告诉它们如何使用工具、解决问题以及与用户交互。想象一下一位旅行代理人,他可以预订机票、查询保险并取消预约,但前提是必须严格遵守公司的规章制度。开发人员面临的挑战在于,一个模型可能非常擅长解决某项任务,却仍然无法满足现实工作中特定的操作要求。它可能会使用过多的工具、在不该寻求人工帮助时请求协助、生成的回复过长,或者无意中违反了安全政策。对于一家公司而言,要部署这样的智能体,不能仅仅接受一个“基本还行”的模型;它必须确保智能体在完成工作的过程中,能够严格遵守每一项要求。

核心难点在于,这些要求往往会相互冲突。如果一个提示词让智能体变得非常精准,也可能导致它变得冗长或容易过度调用工具。传统上,开发人员试图通过手动调整每条规则的重要性来解决这个问题,这本质上是在猜测哪些约束更为重要。然而,这种方法是非常脆弱的。一个适用于某种特定任务或特定模型的设置,在情况发生变化时往往会失效。如果规则是预先固定的,系统可能会通过破坏另一条规则来满足某项要求,从而导致智能体无法投入使用。研究人员面临的问题是,他们能否构建一个系统,能够自动寻找完美的平衡点,随着学习过程中的成败,实时调整每条规则的权重。

一组研究人员引入了一种名为 CAPO 的新方法,全称是约束感知提示优化(Constraint-Aware Prompt Optimization),用以应对这一问题。CAPO 并不靠猜测规则的平衡点,而是将优化过程视为一场“谈判”,让规则本身“开口说话”。该系统从一组候选提示词开始,并针对一系列任务进行测试。随着智能体的运行,它们会生成关于表现如何以及——至关重要的是——在特定约束(如工具调用次数或回复长度)方面违反了多少规则的数据。如果一个提示词违反了某条规则,系统会在下一轮测试中自动增加该特定规则的“惩罚值”。如果一个提示词在某条规则下仍有余量,则该规则的惩罚值会降低。这种动态调整机制使系统能够专注于当前阻碍智能体部署的具体问题,而不是从一开始就将所有规则视为同等重要。

研究人员在包括航空公司客户服务、零售支持和电信在内的多个不同领域测试了这种方法。在这些测试中,智能体必须在遵守严格限制(如向人工客服求助的次数、使用的工具数量以及系统指令的长度)的同时完成任务。结果显而易见:CAPO 始终能找到既满足所有约束又保持高任务性能的提示词。相比之下,使用固定权重或静态规则的其他方法,无法同时找到适用于所有要求的解决方案。例如,在航空领域,虽然其他方法只能在六个不同的测试场景中满足规则一次,但 CAPO 在每一个场景中都找到了可行的方案。该方法表现出了足够的鲁棒性,不仅能适配不同规模的语言模型,甚至还能从使用工具的智能体扩展到处理聊天场景中的安全和格式约束。

为了使过程更加高效,研究人员开发了第二个版本,称为 DCAPO。虽然第一个版本使用一个独立的、冻结的语言模型来重写提示词,但 DCAPO 会训练一个专门的重写器,使其能够从过程中学习。这个重写器会观察智能体的行为以及来自约束条件的反馈,从而在不改变底层任务智能体的情况下,随着时间的推移学习生成更好的提示词。在实验中,这种经过学习的重写器能够在所有测试领域中产生可行的提示词,其准确度达到了甚至超过了表现最好的基准方法。研究还包含了数学分析,以证明该系统如何处理由于样本数量有限和文本变化是离散的所带来的问题,证实了这些局限性引入的误差并不会阻止系统收敛到一个良好的解。

这项工作的意义在于,它能够将部署要求转化为引导搜索过程的力量。通过让规则的实际违规程度来决定哪些失败需要引起关注,系统避免了“修好一个问题却制造出另一个问题”的陷阱。研究人员发现,这种自适应方法是必不可少的,因为最关键的约束条件会根据具体的任务和使用的模型而变化。在航空场景中最重要的因素,在零售场景中可能并不重要;而一个足够强大的模型,可能仍需要不同的引导才能保持在预算范围内。这项研究表明,通过基于实时反馈不断调整优化的重点,寻找兼具效能与合规性的运行点是完全可能的。这表明我们对提示工程的理解正在发生转变:它不再是一个静态的设置,而是一个动态的过程,其中需求本身可以引导系统走向一个准备好进入现实世界的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →