← 최신 논문
💻 computer science

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents

이 논문은 자율적인 여행 계획 에이전트가 정확하고 실행 가능한 여정을 생성하는 데 있어 프런티어 거대 언어 모델 및 기존 프레임워크를 능가할 수 있도록 견고한 여행 샌드박스, 계층적 보상 모델링, 그리고 회신 증강 학습을 활용하는 엔드 투 엔드 에이전트 강화 학습 프레임워크인 DeepTravel을 소개한다.

원저자: Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽한 휴가 계획을 세우려 한다고 상상해 보세요. 특정 도시로 비행기를 타고 가서, 멋진 호텔에 머물고, 만리장성 같은 멋진 장소들을 방문하면서도 예산 내에서 해결하고 싶습니다. 과거에 이 일을 하려던 컴퓨터들은 마치 구겨진 지도를 든 불안한 관광객과 같았습니다. 그들은 엄격하게 미리 작성된 지침(이른-바 "프롬프트")을 따랐고, 만약 항공권 가격이 변하거나 호텔이 만실이 되면 길을 잃거나 가짜 일정을 제시하곤 했습니다. 그들은 실제로 "생각"하거나 상황에 맞춰 즉각적으로 적응할 수 없었습니다.

여기에, 단순히 대본을 따르는 것이 아니라 실수를 통해 배우고, 이를 수정하며, 다시 시도함으로써 여행하는 법을 익히는 새로운 종류의 여행 상담사, DeepTravel이 등장했습니다.

기존 방식의 문제점

저자들은 기존 방식이 너무 경직되어 있다고 주장합니다. 기존 방식은 "수작업으로 만든 프롬프트"에 의존하는데, 이는 로봇에게 규칙 목록을 주는 것과 같습니다. 만약 로봇이 갑작스러운 기차 취소와 같이 명시적으로 교육받지 않은 상황에 직면하면, 종종 실패하게 됩니다. 논문은 이러한 고정된, 미리 작성된 워크플로우가 진정한 자율 여행 플래너를 구축하는 최선의 방법이 아니라는 점을 명시적으로 배제합니다. 그것들은 적응하기에 너무 느리고, 문제가 발생했을 때 너무 취약합니다.

해결책: "여행 샌드박스"와 "스마트 코치"

컴퓨터가 현실 세계의 혼란 속에서도 혼란을 겪지 않고 여행 계획을 세우는 법을 가르치기 위해, 연구진은 **강건한 여행 샌드박스(Robust Travel Sandbox)**를 구축했습니다.

이 샌드박스를 현실 세계를 모방한 거대하고 매우 빠른 비디오 게임 시뮬레이션이라고 생각해보세요. 현실 세계에서는 컴퓨터에게 항공권 가격을 확인하라고 요청하면 웹사이트가 느려지거나 가격이 매초 변할 수 있습니다. 이는 학습하는 컴퓨터에게 악몽과 같습니다. 하지만 이 샌드박스에서 컴퓨터는 "타임머신"과 "마법의 캐시"를 가집 제어할 수 있습니다. 컴퓨터는 실제 상황을 흉내 내지만 결코 충돌하거나 예상치 못하게 변하지 않는 저장된 라이브러리에서 항공, 기차, 호텔 데이터를 찾아볼 수 있습니다. 이를 통해 에이전트는 실제 세계의 결함 때문에 막히는 일 없이 수백만 번 연습할 수 있습니다.

에이전트가 샌드박스에 들어갔다면, 이제 잘하고 있는지 알려줄 코치가 필요합니다. 논문은 2단계로 구성된 심판 역할을 하는 계층적 보상 모델링(Hierarchical Reward Modeling) 시스템을 소개합니다.

  1. 거시적 심판 (궤적 수준 - Trajectory-Level): 먼저, 이 심판은 전체 여행이 말이 되는지 확인합니다. 에이전트가 존재하지 않는 도시로 가려고 했나요? 박물관이 문을 열기도 전에 박물관을 방문하려고 했나요? 거시적인 그림이 틀렸다면, 에이전트는 즉시 "0점"을 받습니다.
  2. 미시적 심판 (턴 수준 - Turn-Level): 거시적인 그림이 괜찮다면, 이 심판은 세부 사항으로 줌인합니다. 에이전트가 말했던 대로 호텔을 실제로 예약했나요? 방금 찾아본 정확한 기차 시간표를 사용했나요? 이는 에이전트가 단순히 사실을 지어내는 것(환각 현상)을 방지합니다.

실패로부터 배우기: "리플레이" 기술

가장 흥 미로운 부분은 에이전트가 배우는 방식입니다. 연구진은 **리플레이 증강 강화 학습(Replay-Augmented Reinforcement Learning)**이라는 방법을 사용했습니다.

자전거 타기를 배우고 있다고 상상해 보세요. 넘어졌을 때 그냥 포기하는 것이 아니라, 어디서 균형을 잃었는지 정확히 기억하고 다시 시도합니다. DeepTravel도 똑같이 합니다. 에이전트가 여행 계획을 올바르게 세우는 데 실패하면, 시스템은 그 "실패 경험"을 특별한 버퍼에 저장합니다. 나중에 에이전트는 이 실패한 시도들을 "리플레이"하도록 강요받으며, 어떻게 수정할 수 있을지 고민하게 됩니다. 이는 실수를 강력한 학습 도구로 바꿉니다.

논문은 이 방법이 320억 개의 파라미터를 가진 작은 규모의 저렴한 컴퓨터 두뇌조차도, 이전에 최고였던 거대하고 비싼 슈퍼컴퓨터(6710억 개의 파라미터를 가진 DeepSeek-R1 등)보다 더 나은 여행 플래너가 될 수 있음을 보여줍니다.

결과: 현실 세계의 증명

연구팀은 단순히 시뮬레이션에서만 테스트한 것이 아니라, 이를 DiDi Enterprise Solutions 앱(기업용 차량 호출 및 여행 앱)에 배치했습니다. 그들은 실제 사용자들을 대상으로 3개월 동안 테스트를 진행했습니다.

결과는 다음과 같습니다:

  • 정확도: DeepTravel 에이전트는 실제 세계에서 유효한 여행 일정을 생성하는 데 **82%**의 정확도를 달달성했습니다.
  • 거인들을 이기다: 오프라인 테스트에서, 더 작은 DeepTravel 모델(32B)은 이전까지 최고였던 OpenAI o1/o3DeepSeek-R1과 같은 프런티어 모델들을 크게 앞질렀습니다. 예를 들어, 제약 조건이 없는 어려운 과제에서 DeepTravel-32B는 **69.34%**의 통과율을 기록한 반면, 거대한 DeepSeek-R1은 **45.55%**에 그쳤습니다.
  • 인간 vs 기계: 인간이 결과를 검토했을 때, 컴퓨터의 채점 결과와 약 82% 일치했습니다. 인간의 오류를 조정한 후, 컴퓨터의 채점은 인간의 "골드 스탠다드(기준)"와 비교하여 약 **89%**의 정확도를 보였습니다.

아직 할 수 없는 것 (한계점)

논문은 에이전트가 여전히 어려움을 겪는 부분에 대해서도 솔직하게 밝히고 있습니다. 여행의 구조를 잡고 기본적인 요청을 이해하는 데는 뛰어나지만, 복잡한 개인화된 선호도(76.62% 점수)에는 여전히 어려움을 겪으며, 가끔 사실적 환각(사실을 잘못 전달하는 경우 15.58%)을 일으키기도 합니다 (비록 이는 훈련 전 기본 모델의 오류율인 50%에 비하면 엄청난 개선입니다).

핵심 요약

DeepTravel은 위대한 여행 플래너가 되기 위해 반드시 거대하고 비싼 두뇌가 필요한 것은 아님을 증명합니다. 안전한 샌드박스에서 연습할 수 있는 스마트한 방법, 작업 내용을 확인할 엄격한 코치, 그리고 실패로부터 배울 수 있는 의지만 있으면 됩니다. 이 "에이전트 기반 강화 학습" 접근 방식을 통해, 저자들은 더 작고 효율적인 모델이 실제 여행 계획에 있어 가장 크고 유명한 AI 모델들을 실제로 능가할 수 있음을 보여주었습니다. 이는 모든 것을 완벽하게 해결하는 마법 지팡이는 아니지만, 여행 계획을 진정으로 자율적으로 만드는 데 있어 거대한 도약입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →