Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents
이 논문은 검증기 인증 정제 궤적(verifier-certified refinement trajectories)을 활용하여 엔드 투 엔드 PDDL 플래닝을 위한 작고 비용 효율적인 정책을 학습함으로써, 최전선에 있는 LLM들과 대등한 성공률을 달성하는 동시에 오케스트레이션 비용을 10배 이상 절감하는 하이브리드 에이전트 학습 오케스트레이터인 HALO를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
큰 문제: "번역가"의 병목 현상
복잡한 가구를 만들고 싶다고 상상해 보세요. 당신에게는 평범한 영어로 된 대략적인 스케치와 아이디어 목록이 있습니다(자연어). 하지만 실제로 가구를 만드는 기계(클래식 플래너)는 PDDL이라는 매우 엄격하고 로봇 같은 코드만을 이해할 수 있습니다.
만약 일반적인 AI(대규모 언어 모델 또는 LLM)에게 그 코드를 작성하라고 시키면, 종종 실수를 저지릅니다. 존재하지 않는 부품을 만들어내거나, 나사를 목록에서 빠뜨리거나, 기계가 읽을 수 없는 지침을 작성하기도 합니다.
이를 해결하기 위해 연구진은 "수리 팀"을 만들었습니다. 이들은 매니저(오케스트레이터)를 두고, 매니저가 망가진 코드를 살펴본 뒤 특정 오류를 고칠 수 있도록 전문가(에이전트) 팀을 고용합니다. 한 전문가는 문법을 고치고, 다른 전문가는 논리를 수정하며, 또 다른 전문가는 부품들이 서로 잘 맞는지 확인합니다.
문제점: 기존 시스템에서는 매니저가 매우 비싸고 고성능인 AI(예: GPT-5 또는 Gemini)였습니다. 팀이 실수를 바로잡아야 할 때마다, 당신은 매니저에게 문제를 고민하고 다음 전문가를 선택하는 데 드는 막대한 비용을 지불해야 했습니다. 만약 프로젝트를 해결하는 데 10단계가 필요했다면, 당신은 매니저에게 10번의 비용을 지불해야 했습니다. 이 때문에 이 과정은 작은 연구실이나 로컬 컴퓨터에서 수행하기에는 너무 비쌌습니다.
해결책: HALO (인턴 매니저)
이 논문의 저자인 Rajesh Mangannavar와 그의 팀은 다음과 같이 질문했습니다. "모든 단계마다 정말로 초고가형 매니저가 필요할까요? 저렴하고 로컬에서 돌아가는 인턴에게 그 일을 시킬 수는 없을까요?"
그들은 HALO(Hybrid Agent-Learned Orchestrator)를 만들었습니다. HALO가 작동하는 방식은 세 가지 핵심 기술을 사용합니다.
1. "승리한" 플레이북으로부터 배우기
보통 AI를 훈련시키는 것은 어렵습니다. 왜냐하면 모든 단계에 대한 "정답"을 알 수 없기 때문입니다. 하지만 이 시스템에는 최종 가구를 검사하는 심판(검증기)이 있습니다.
- 최종 계획이 성공적이라면, 심판은 "잘했어!"라고 말합니다.
- 팀은 깨달았습니다. 심판이 "잘했어!"라고 말할 때마다, 그들이 사용했던 매니저와 전문가들의 순서는 곧 승리하는 전략이었다는 것을요.
그들은 수천 개의 이러한 "승리한 플레이북"을 가져와서, 값비싼 매니저의 목소리는 제거하고, 오직 기록만을 남겼습니다. 즉, *"코드가 X처럼 보였을 때, 승리한 팀은 전문가 Y를 선택했다"*라는 기록입니다. 그들은 이 데이터를 사용하여 작은 규모의 저렴한 AI(HALO)가 이러한 승리하는 결정들을 모방하도록 훈련시켰습니다.
2. "규칙집" 지름길
HALO는 단순한 뇌가 아니라, 치트 시트(컨닝 페이퍼)를 가진 뇌입니다. 저자들은 어떤 결정들은 너무나 당연해서 인간조차도 생각할 필요가 없다는 사실을 깨달았습니다.
- 예시: 코드가 비어 있다면, 규칙은 "긴급 에이전트를 호출하라"입니다.
- 예시: 코드에 철자 오류가 있다면, 규칙은 "구문 에이전트를 호출하라"입니다.
- 예시: 계획이 완벽하다면, 규칙은 "중단하라"입니다.
HALO는 이 간단한 규칙들을 먼저 확인합니다. 규칙이 적용되면, 자신의 "뇌"(AI 모델)를 사용하지 않고 즉시 행동합니다. 이는 시간과 비용을 절약해 줍니다. 문제가 정말로 혼란스러울 때만 HALO는 결정을 내리기 위해 훈련된 AI를 사용합니다.
3. 더 커진 도구함
팀은 또한 전문가의 범위를 확장했습니다. 기존 13명에 8명의 전문가를 추가하여 총 21명으로 늘렸습니다. 이 중 일부 새로운 전문가들은 "결정론적(deterministic)"인 전문가들로, 값비싼 AI 모델이 아니라 즉시 실행되며 비용이 전혀 들지 않는 단순한 컴퓨터 스크립트입니다. 이를 통해 HALO는 문제를 더 빠르게 해결할 수 있는 더 많은 도구를 갖게 되었습니다.
결과: 더 빠르고, 더 저렴하며, 성능은 동일하게
팀은 11가지 유형의 플래닝 문제(물류, 로봇 이동, 스케줄링 등)에 대해 HALO를 고가의 고성능 AI 매니저와 비교 테스트했습니다.
- 성공률: HALO는 값비싼 AI만큼 우수하거나, 때로는 그보다 더 나은 성능을 보였습니다. 문제를 해결하는 비율이 동일했습니다.
- 속도: HALO는 쉬운 문제에는 단순한 규칙을 사용하고 어려운 문제에는 작은 로컬 모델을 사용하기 때문에 훨씬 빠르게 결정을 내립니다.
- 비용: 이것이 가장 큰 승리입니다.
- 기존 방식(GPT-5 사용)은 작업당 약 $0.18이 들었습니다.
- HALO는 작업당 약 $0.004가 듭니다.
- 이는 약 45배 더 저렴합니다. 마치 매 끼니마다 유명 셰프를 고용하는 것에서, 간단한 요리에는 레시피 북을 사용하는 숙련된 지역 요리사를 고용하는 것으로 바뀐 것과 같습니다.
핵심 요약
이 논문은 전문가 팀을 관리하기 위해 반드시 "초지능" AI가 필요한 것은 아니라는 점을 증명합니다. 계획이 성공했는지 알려주는 엄격한 심판(검증기)이 있다면, 작은 규모의 저렴한 AI를 훈련시켜 그 성공으로부터 배울 수 있습니다.
이를 통해 복잡한 플래닝 시스템을 매번 비싼 클라우드 API 비용을 지불할 필요 없이, 실험실의 단일 컴퓨터(또는 노트북)에서도 실행할 수 있게 됩니다. 이는 사치스러운 서비스를 누구나 로컬에서 실행할 수 있는 기술로 바꾸어 놓았습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.