FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines
FAPO는 프롬프트와 체인 구조 모두를 반복적으로 평가, 진단 및 개선함으로써 다단계 LLM 파이프라인을 최적화하는 완전 자율형 프레임워크로, GEPA 베이스라인을 능가하며 일반 및 보안 중심 벤치마크 전반에서 최첨단 성능을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
여러 대의 로봇이 협력하여 복잡한 퍼즐을 푸는 팀을 상상해 보세요. 각 로봇은 특정한 업무를 맡고 있습니다. 한 로봇은 단서를 찾고, 다른 로봇은 그 단서에 대해 고민하며, 세 번째 로봇은 최종 답안을 작성합니다. 때때로 팀 전체가 실패하기도 하지만, 정확히 어떤 로봇이 실수했는지 알아내기는 어렵습니다. 첫 번째 로봇이 단서를 놓친 걸까요? 두 번째 로봇이 혼란에 빠진 걸까요? 아니면 세 번째 로봇이 답안을 잘못된 형식으로 작성한 걸까요?
이것이 바로 멀티스텝 LLM 파이프라인(복잡한 AI 작업 체인)이 직면한 문제입니다. 전통적인 방식은 '대장' 로봇에게 주는 지시문(프롬프트)을 다시 쓰는 방식으로 팀 전체를 고치려 합니다. 하지만 만약 문제가 팀에 단계가 누락되었거나 로봇들이 서로 엉뚱한 사람과 대화하고 있는 것이라면, 단순히 지시문을 바꾸는 것만으로는 도움이 되지 않습니다.
여기에 FAPO(완전 자율 프롬프트 최적화)가 있습니다. FAPO를 초스마트 자율 프로젝트 매니저(Claude Code라는 AI에 의해 구동됨)라고 생각해보세요. FAPO는 단순히 지시문을 다시 쓰는 것에 그치지 않고, 팀이 작업하는 과정을 지켜보며 정확히 어디에서 병목 현상이 발생하는지 찾아내고 이를 해결합니다.
FAPO가 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.
1. 탐정 단계 (검사)
단순히 추측하는 대신, FAPO는 팀이 연습용 퍼즐을 푸는 과정을 지켜봅니다. 모든 움직임, 발견된 모든 단서, 그리고 모든 사고 과정을 기록합니다. 만약 팀이 정답을 맞히지 못하면, FAPO는 탐정처럼 행동합니다:
- "우리가 올바른 단서를 찾지 못해서 실패했는가?" (검색 실패)
- "단서는 찾았지만 그것을 오해했는가?" (추론 실패)
- "단식은 이해했지만 답안을 잘못된 형식으로 작성했는가?" (형식 실패)
2. "먼저 고쳐보기" 규칙 (프롬프트 편집)
FAPO는 엄격한 규칙을 따릅니다: 작게 시작하라.
만약 탐정이 팀에게 더 명확한 지시가 필요하다는 것을 발견하면, FAPO는 프롬프트(지시문)를 다시 씁니다. 이는 로봇들에게 "헤이, 파란 상자가 아니라 빨간 상자를 찾아봐"라고 말하는 것과 같습니다. FAPO는 이것이 가장 쉬운 해결책이기 때문에 이 방법을 먼저 시도합니다.
3. "재설계" 단계 (구조적 변경)
만약 FAPO가 지시문을 계속해서 다시 써보는데도, 팀이 (예를 들어 수학을 재검토할 네 번째 로봇이 필요한 것처럼) 결정적인 단계가 누락되어 여전히 실패한다면, FAPO는 팀 구조를 변경할 권한을 얻습니다.
- 팀에 새로운 로봇을 추가할 수 있습니다.
- 로봇들이 서로 대화하는 순서를 바꿀 수 있습니다.
- 팀이 최종 답안을 작성하기 전에 특정 규칙을 따르도록 강제하는 "안전 점검" 단계를 추가할 수 있습니다.
이것이 핵심적인 차이점입니다: FAPO는 단지 단어(프롬프트)를 바꾸는 것만으로는 충분하지 않다는 것이 증명될 때만 파이프라인의 구조를 변경합니다.
4. 안전 검사관 (가드레일)
FAPO가 어떤 변경을 수행하기 전에, "안전 검사관"(또 다른 AI 에이전트)이 계획을 검토합니다. 이는 FAPO가 실수로 중요한 규칙을 삭제하거나, 개인 데이터를 유출하거나, 점수 산정 시스템을 망가뜨리지 않도록 보장합니다. 이는 마치 건축 현장 작업자들이 공사를 시작하기 전에 건축 검사관이 리모델링 계획을 확인하는 것과 같습니다.
결과: 얼마나 잘 작동했는가?
논문에서는 F-APO를 GEPA(지시문만 다시 쓰는 매우 뛰어난 편집기 같은 도구)와 비교하여 수학 문제부터 보안 작업에 이르기까지 여섯 가지 유형의 과제를 테스트했습니다.
- 점수판: FAPO가 18번 중 15번 승리했습니다.
- 큰 성과: 가장 어려운 작업들(복잡한 이야기의 사실 확인이나 엄격한 형식 준수 등)에서, FAPO는 단순히 지시문을 수정하는 데 그치지 않고 팀에 새로운 구조가 필요하다는 것을 깨달았습니다. 이런 경우, FAPO의 점수는 경쟁 도구보다 훨씬 큰 폭(최대 +33.8 퍼센트 포인트)으로 상승했습니다.
- 보안 작업: FAPO는 또한 AI 모델이 보안 취약점(예: 소프트웨어 버그를 그 원인과 매핑하는 작업)을 식별하는 능력을 개선하여, 심각하고 높은 수준의 업무에서도 작동함을 입증했습니다.
단 하나의 예외
FAPO가 승리하지 못한 수학 경시 대회(AIME)가 한 곳 있었습니다. 저자들은 이것이 수학 문제들이 너무 어려웠거나 샘플 크기가 작아서, AI가 실제로 수학을 더 잘 배우기보다는 연습 문제에 "혼란"을 느끼거나 "과적합(over-fitting)"되었을 가능성이 있다고 제안합니다.
요요약
FAPO는 단순히 일꾼들에게 "더 잘해봐"라고 소리치는 똑똑한 매니저가 아닙니다. 대신, 워크플로우를 관찰하고, 프로세스가 어디서 깨지는지 정확히 진단하며, 먼저 지시문을 고치고, 그것이 실패할 경우에만 팀이 더 효과적으로 작동하도록 전체 워크플로우를 재설계합니다. FAPO는 엉망이고 실패하는 AI 단계들의 체인을 신뢰할 수 있고 고성능을 내는 기계로 탈바꿈시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.