← 최신 논문
🤖 AI

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

Agentic-DPO는 전문가 궤적을 상태 조건부 행동 선호도로 변환하여 LLM 에이전트가 단순한 모방을 넘어 최적의 의사결정을 학습할 수 있도록 하는 경량 오프라인 정책 최적화 방법으로, 환경 롤아웃이나 보상 모델을 필요로 하지 않으면서도 온라인 강화 학습에 필적하는 성능을 달성합니다.

원저자: Yixiong Chen, Alan Yuille

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yixiong Chen, Alan Yuille

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 집사에게 지저분한 방을 청소하는 법을 가르치고 있다고 상상해 보세요. **지도 미세 조정(Supervised Fine-Tuning, SFT)**이라 불리는 기존 방식은, 로봇에게 인간이 청소하는 영상을 보여주며 "보는 대로 똑같이 따라 해"라고 말하는 것과 같습니다. 로봇은 양말을 집어 들고, 빨래 바구니에 넣고, 빗자루를 잡는 식의 동작 순서를 모방하는 법을 배웁니다. 하지만 여기에는 함정이 있습니다. 로봇은 왜 그런 동작들이 선택되었는지 그 이유를 실제로 배우지는 못한다는 점입니다. 만약 양말이 사실은 쓰레기였다 하더라도, 로봇은 단지 영상을 복사하고 있을 뿐이기에 그 실수를 인지하고 생각하는 것이 아니라 그냥 양말을 집어 들 것입니다.

이 논문은 이를 해결하기 위해 Agentic-DPO라는 더 가벼운 새로운 방법을 소개합니다. 단순히 복사하는 대신, 이 방법은 훈련 데이터를 로봇이 자신의 잠재적인 실수를 스스로 포착할 수 있는 "선택형 모험(Choose Your Own Adventure)" 게임으로 바꿉니다.

핵심 아이디어: "그냥 복사하지 말고, 비교하라"

저자들은 전문가의 경로를 단순히 암기해야 할 하나의 텍스트 선으로 취급하는 대신, 모든 단계를 하나의 결정 지점으로 보아야 한다고 제안합니다. 어느 순간이든 로봇은 전문가의 올바른 동작을 선택할 수도 있고, 혹은 "그럴듯한 실수"를 선택할 수도 있습니다.

Agentic-DPO는 다음과 같이 작동합니다:

  1. 설정: 전문가의 이력 중 특정 순간(상태)을 로봇에게 보여줍니다.
  2. 테스트: 로봇에게 묻습니다. "지금 당신이라면 무엇을 하겠습니까?"
  3. 비교: 만약 로봇이 전문가와 다른 행동을 제안한다면, 하나의 쌍을 만듭니다: "전문가의 동작 (좋음)" 대 "로봇의 추측 (나쁨)".
  4. 교훈: 로봇이 자신의 실수보다 전문가의 동작을 선호하도록 가르칩니다.

이는 거대한 변화입니다. 논문은 기존 방식들이 단순히 복사하거나(SFT), 혹은 강화 학습(Reinforcement Learning)을 통해 실제 환경에서 게임을 반복해서 플레이하며 배우려 했다고 지적합니다. 하지만 강화 학습은 느리고 비용이 많이 들며 복잡한 채점 시스템이 필요합니다. Agentic-DPO는 게임을 실제로 플레이하거나 매 동작마다 인간 심판을 고용하지 않고도 실수를 통해 배울 수 있는 이점을 얻을 수 있다고 제안합니다.

"마법의 기술": 규칙을 명확하게 유지하기

로봇을 가르칠 때 까다로운 문제가 하나 있습니다. 로봇이 의미가 아니라 표현 방식에 혼동을 느낄 수 있다는 점입니다. 예를 들어, 로봇에게 "도구를 호출하라"고 요청할 때 이것이 call_tool()로 쓰일 수도 있고, {"tool": "call"}로 쓰일 수도 있습니다. 만약 로봇이 전문가의 텍스트 형식을 그대로 선호하도록 학습한다면, 형식이 바뀌었을 때 실패하게 됩니다.

이를 해결하기 위해 저자들은 **정책 보존 증강(Policy-Preserving Augmentation, PPA)**이라는 영리한 기법을 도입했습니다. 수학 문제를 푸는 학생을 가르친다고 상상해 보세요. 당신은 같은 문제를 영어로, 스페인어로, 때로는 만화책 스타일로 보여주지만, *풀이 과정(수학)*은 동일하게 유지합니다. PPA는 로봇에게 이와 똑같은 작업을 수행합니다. 핵심 결정은 동일하게 유지하면서 전문가의 행동을 다양한 "방언"이나 형식으로 다시 쓰는 것입니다. 이를 통해 로봇이 특정 단어를 배우는 것이 아니라 선택의 논리를 배우도록 강제합니다.

숫자가 말해주는 것들

저자들은 로봇이 도구, 사용자, 웹사이트와 상호작용하는 세 가지 서로 다른 "놀이터"에서 이 아이디어를 테스트했습니다:

  • StableToolBench: 도구 사용을 테스트하는 곳.
  • τ-bench (tau-bench): 로봇이 고객과 대화하는 소매 시뮬레이션.
  • Mind2Web: 로봇이 실제 웹사이트를 탐색하는 작업.

결과는 Agentic-DPO가 다양한 크기의 모델에 대해 표준적인 "복사" 방식(SFT)을 일관되게 능가했음을 보여줍니다:

  • τ-bench 소매 작업에서, 90억 개의 파라미터를 가진 모델은 표준 복사 방식의 성공률 **21.7%**에서 Agentic-DPO를 통해 **41.4%**로 뛰어올랐습니다.
  • StableToolBench에서, 더 작은 20억 개의 파라미터를 가진 모델은 **57.1%**에서 **90.9%**로 향상되었습니다.
  • Mind2Web에서, 단계별 평균 성공률은 **45.6%**에서 **64.4%**로 증가했습니다.

흥로하게도, 논문은 Agentic-DPO가 훨씬 더 많은 비용이 드는 GRPO 방식(로봇이 학습을 위해 수천 번 실제로 게임을 플레이해야 하는 방식)만큼 성능이 좋았음을 언급합니다. 그런데 Agentic-DPO는 훈련 단계 동안 실제 환경과 전혀 상호작용하지 않고도 이 성과를 냈습니다.

이 방법이 해결하지 "못하는" 것

이 방법이 해결할 수 없다고 명시한 부분도 중요합니다. 논문은 이 방법이 전문가가 보지 못한 새로운 상황을 발견할 수는 없다고 명시적으로 밝힙니다. 이 방법은 오직 전문가가 존재하는 기존의 상태들로부터만 배우기 때문에, 전문가가 한 번도 들어가지 않은 방을 탐험할 수는 없습니다. 이는 일종의 트레이드오프(trade-off)입니다. 즉, 알려진 결정 지점들에 대해서는 매우 잘 작동하는 저렴하고 빠른 훈련 방법을 얻는 대신, 정해진 길을 벗어나 새로운 해결책을 찾아내는 능력은 포기하는 것입니다.

결론

저자들은 전문가의 시연을 매 단계마다 "맞음 vs 틀림"의 선택지로 바꾸고, 논리에 집중하도록 "형식 셔플링(format-shuffling)" 기술(PPA)을 사용함으로써, 이전보다 훨씬 저렴하게 더 똑똑한 에이전트를 훈련할 수 있다고 제안합니다. 이는 로봇을 단순한 앵무새에서, 끝없는 시뮬레이션을 돌리기 위해 수백만 달러의 컴퓨터 자원을 들이지 않고도 자신이 왜 틀릴 수 있는지에 대해 실제로 고민하는 학생으로 업그레이드하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →