← 최신 논문
🤖 AI

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

이 논문은 LLM 에이전트 시스템 프롬프트를 작업 성능을 최적화하는 동시에 안전 및 포맷팅과 같은 운영 제약 조건을 준수하도록 효과적으로 최적화하기 위해 적응형 제약 가중치를 갖는 원-듀얼(primal-dual) 접근 방식을 사용하는 제약 인식 프롬프트 최적화 방법인 CAPO와, 기본 작업 에이전트를 수정하지 않고도 다양한 도메인에 걸쳐 실행 가능하고 고성능인 프롬프트를 달성하기 위해 특화된 리라이터(rewriter)를 학습시키는 동적 변체인 DCAPO를 소개한다.

원저자: Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 단순히 대화를 나누는 것을 넘어 행동하는 데 점점 더 많이 배치되고 있습니다. 이러한 디지털 에이전트에게는 도구 사용법, 문제 해결 방식, 사용자 상호작용 방식 등을 지시하는 '시스템 프롬프트'라고 불리는 일련의 지침이 주어집니다. 항공권을 예약하고, 보험을 확인하고, 예약을 취소할 수 있지만, 반드시 회사의 엄격한 규칙을 따라야만 하는 여행 상담원을 상상해 보십시오. 개발자들의 과제는 모델이 특정 과업을 해결하는 데는 매우 뛰어나더라도, 실제 업무의 구체적인 운영 요구사항을 충족하는 데는 실패할 수 있다는 점입니다. 모델이 너무 많은 도구를 사용하거나, 도움을 요청하지 않아도 될 때 인간에게 도움을 요청하거나, 응답을 너무 길게 작성하거나, 실수로 안전 정책을 위반할 수도 있습니다. 기업이 이러한 에이전트를 배포하기 위해서는 단순히 "대체로" 잘 작동하는 모델을 받아들이는 것만으로는 부족하며, 업무를 완수하면서도 모든 요구사항에 대해 엄격한 경계 내에 머물도록 보장해야 합니다.

핵심적인 어려움은 이러한 요구사항들이 종종 서로 상충한다는 점에 있습니다. 에이전트를 매우 정확하게 만드는 프롬프트는 응답을 장황하게 만들거나 도구를 너무 많이 사용하게 만들 수도 있습니다. 전통적으로 개발자들은 각 규칙의 중요도를 수동으로 조정함으로써 이 문제를 해결하려 노력해 왔는데, 이는 본질적으로 어떤 제약 조건이 가장 중요한지 추측하는 과정입니다. 그러나 이러한 접근 방식은 취약합니다. 한 가지 유형의 작업이나 특정 모델에 적합했던 설정이 상황이 변하면 실패하는 경우가 많기 때문입니다. 만약 규칙이 사전에 고정되어 있다면, 시스템은 하나의 요구사항을 충족하기 위해 다른 하나를 깨뜨림으로써 에이전트를 사용할 수 없는 상태로 만들 수 있습니다. 연구자들이 직면한 질문은, 무엇이 작동하고 작동하지 않는지를 학습함에 따라 실시간으로 각 규칙의 가중치를 조정하여 완벽한 균형을 자동으로 찾아내는 시스템을 구축할 수 있는가 하는 점이었습니다.

연구팀은 이 문제를 해결하기 위해 CAPO(Constraint-Aware Prompt Optimization, 제약 인지 프롬프트 최적화)라는 새로운 방법을 도입했습니다. 규칙의 적절한 균형을 추측하는 대신, CAPO는 규칙 자체가 목소리를 내는 협상처럼 최적화 과정을 처리합니다. 시스템은 후보 프롬프트 모음을 가지고 시작하여 이를 일련의 과업들에 대해 테스트합니다. 에이전트가 실행됨에 따라, 시스템은 얼마나 잘 수행했는지, 그리고 결정적으로 도구 호출 횟수나 응답 길이와 같은 특정 제약 조건을 얼마나 위반했는지에 대한 데이터를 생성합니다. 만약 프롬프트가 규칙을 위반하면, 시스템은 다음 테스트 라운드에서 해당 규칙에 대한 '벌점(penalty)'을 자동으로 높입니다. 반대로 프롬프트가 규칙 내에 여유가 있다면, 해당 규칙에 대한 벌점은 낮아집니다. 이러한 동적 조정을 통해 시스템은 모든 규칙을 처음부터 똑같이 중요하게 다루는 대신, 현재 에이전트의 배포를 가로막고 있는 구체적인 문제에 집중하여 탐색할 수 있습니다.

연구진은 항공 고객 서비스, 소매 지원, 통신 등 여러 다른 영역에 걸쳐 이 접근 방식을 테스트했습니다. 이 테스트에서 에이전트들은 인간 상담사 호출 횟수, 도구 사용 횟수, 시스템 지침의 길이에 대한 엄격한 제한을 준수하면서 과업을 완료해야 했습니다. 결과는 명확했습니다. CAPO는 높은 과업 성능을 유지하면서도 단 하나의 제약 조건도 놓치지 않고 모두 만족하는 프로프트를 일관되게 찾아냈습니다. 반면, 고정된 가중치나 정적인 규칙을 사용하는 다른 방법들은 모든 요구사항을 동시에 만족하는 해결책을 찾는 데 실패했습니다. 예를 들어, 항공 도메인에서 다른 방법들은 6개의 서로 다른 테스트 시나리오 중 단 하나에서만 규칙을 만족시킨 반면, CAPO는 모든 시나리오에서 실행 가능한 솔루션을 찾아냈습니다. 이 방법은 다양한 크기의 언어 모델에서도 작동할 만큼 견고했으며, 도구 사용 에이전트를 넘어 챗봇 시나리오의 안전 및 형식 제약까지 처리할 수 있었습니다.

과정을 더욱 효율적으로 만들기 위해 연구진은 DCAPO라는 두 번째 버전을 개발했습니다. 첫 번째 버전이 별도의 고정된 언어 모델을 사용하여 프롬프트를 재작성하는 반면, DCAPO는 프로세스 자체로부터 학습하는 특화된 재작성기(rewriter)를 훈련시킵니다. 이 재작성기는 에이전트의 행동과 제약 조건으로부터의 피드백을 관찰하며, 근본적인 과업 에이전트를 변경하지 않고도 시간이 지남에 따라 더 나은 프롬프트를 생성하는 법을 학습합니다. 실험에서 이 학습된 재작성기는 테스트된 모든 도메인에서 실행 가능한 프롬프트를 생성해 냈으며, 가장 우수한 베이스라인 방법들과 대등하거나 그 이상의 정확도를 보여주었습니다. 또한 연구에는 제한된 수의 사례와 이산적인 텍text 변화를 다루는 과정에서 발생하는 수학적 분석이 포함되었으며, 이는 이러한 한계로 인해 발생하는 오류가 시스템이 좋은 솔루션으로 수렴하는 것을 방해하지 않음을 확인시켜 주었습니다.

이 연구의 의의는 배포 요구사항을 탐색 과정을 안내하는 원동력으로 전환할 수 있다는 점에 있습니다. 규칙 위반 정도를 측정하여 어떤 실패에 주의를 기울일지 결정함으로써, 시스템은 하나의 문제를 해결하다가 다른 문제를 만드는 함정을 피할 수 있습니다. 연구진은 이러한 적응형 접근 방식이 필수적이라는 것을 발견했는데, 이는 가장 중요한 제약 조건이 특정 작업과 사용되는 모델에 따라 달라지기 때문입니다. 항공 시나리오에서 가장 중요한 것이 소매 설정에서는 무의미할 수 있으며, 문제를 해결할 능력이 충분한 모델이라 할지라도 예산 내에 머물기 위해서는 다른 가이드가 필요할 수 있습니다. 이 연구는 실시간 피드백을 바탕으로 최적화의 초점을 지속적으로 조정함으로써, 효과적이면서도 규정을 준수하는 운영 지점을 찾을 수 있음을 입증합니다. 이는 우리가 프롬프트 엔지니어링을 생각하는 방식의 변화를 시사합니다. 즉, 프롬프트 엔지니어링은 정적인 설정이 아니라, 요구사항 자체가 시스템을 현실 세계에 준비된 솔루션으로 이끌 수 있는 역동적인 과정이 될 수 있다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →