TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning
이 논문은 LLM 에이전트가 실행 가능한 제약 조건 준수 일정을 생성하는 능력을 평가하기 위해 결정론적 평가기와 대규모 합성 여행 데이터셋을 특징으로 하는 엄격하고 완전하게 재현 가능한 벤치마크인 TREK을 소개하며, 최첨단 모델들조차 다중 제약 계획 수립 및 명시되지 않은 사용자 요구 충족에 있어 상당한 어려움을 겪는다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 휴가 계획을 짜는 법을 가르치고 있다고 상상해 보세요. 인공지능 세계에서 이런 로봇들은 "LLM 에이전트"라고 불립니다. 이들은 당신의 엉망진창인 메시지를 읽고, 당신이 무엇을 원하는지 이해하며, 인터넷을 돌아다니며 항공권을 예약하고, 호텔을 찾고, 관광 일정을 짜는 디지털 여행사 같은 존재들입니다. 하지만 여기에는 함정이 있습니다. 로봇이 완벽한 여행에 대해 말할 수 있다고 해서, 그것이 실제로 여행을 구축할 수 있다는 뜻은 아니라는 점입니다. 실제 휴가 계획은 정교한 퍼즐과 같습니다. 모든 항공편은 실제로 존재해야 하고, 호텔은 영업 중이어야 하며, 도시 간 이동 시간을 고려할 때 하루가 충분히 길어야 하고, 총비용은 당신의 지갑 사정에 맞아야 합니다. 만약 로봇이 가짜 편명을 만들어내거나 박물관이 오후 5시에 닫는다는 사실을 잊어버린다면, 전체 계획은 무너지고 맙니다. 오랫동안 우리는 이 로봇들을 테스트하기 위해 여행에 관한 이야기를 쓰게 해왔지만, 그들의 계획이 실제로 실행 가능한지 확인할 엄격한 방법은 없었습니다.
여기서 TREK(Travel Reasoning and Evaluation Kit)이라는 새로운 연구가 등장합니다. TREK을 여행 계획 로봇을 위한 거대하고 긴장감 넘치는 "비행 시뮬레이터"라고 생각하세요. 연구진은 로봇들이 추측하게 두는 대신, 375개 도시에 걸친 212,530개의 항공, 호텔, 명소 기록을 담은 완벽하게 일관된 가상의 세계를 구축했습니다. 그런 다음 15종의 AI 에이전트에게 800개의 여행 과제를 부여했습니다. 어떤 과제는 가능했고, 어떤 과제는 (공항이 없는 도시로 비행기를 가려는 것과 같이) 불가능했습니다. 로봇들은 계획을 세우기 위해 특별한 도구 세트를 사용해야 했으며, 이후 컴퓨터 기반의 엄격한 심판(관대함을 베풀 인간이나 AI "판사"는 없음)이 모든 세부 사항을 검사했습니다. 목표는 로봇이 단순히 멋진 이야기를 만드는 것이 아니라, 휠체어 접근성이나 반려동물 동반 가능 여부와 같은 여행자의 숨겨진 요구사항을 준수하면서도 완벽하게 실행 가능하고 오류가 없는 일정을 만들어낼 수 있는지 확인하는 것이었습니다.
결과는 다소 냉혹한 현실을 보여주었습니다. 이 특정 2027년 연구에서 가장 강력한 모델인 GPT-5.6조차도 가능한 여행 중 완벽하게 사용 가능한 계획을 만들어낸 비율은 단 **46.2%**에 불과했습니다. 평균적인 로봇은 훨씬 더 못 미쳤는데, 중앙값 성공률은 고작 **6.6%**였으며, 일부는 **0.0%**를 기록하며 완전히 실패했습니다. 연구 결과, 로봇들은 "지루한" 작업에는 꽤 능숙했습니다. 즉, 가짜 항공편을 만들어내는 일(환각 현상)이 드물었고, 여행이 불가능한 상황인지도 보통 잘 판단해냈습니다. 하지만 그들은 여행자에 대한 "이해" 부분에서 거대한 벽에 부딪혔습니다. 가장 큰 병목 구간은 "암묵적 요구사항", 즉 "나는 미식가이니 미슐랭 스타 레스토랑 근처에 머물고 싶다"라거나 "나는 장애가 있는 여행자이므로 경사로가 있는 호텔이 필요하다"와 같은 말하지 않은 욕구들을 충족시키는 것이었습니다. 최고의 로봇들조차 이러한 숨겨진 요구사항을 충족하지 못하는 경우가 절반 이상이었습니다.
연구진은 로봇에게 더 많은 "생각"할 시간을 주거나 더 많은 컴퓨터 자원을 사용하게 하면 도움이 될지 테스트했습니다. 놀랍게도 그렇지 않았습니다. 비교 가능한 한 쌍의 모델 중에서, 더 많이 "추론"하는 데 시간을 쓴 모델이 오히려 지시를 그대로 따르는 모델보다 성적이 더 좋았습니다. 또한, 더 많은 토큰 비용을 쓰는 것이 더 나은 계획을 보장하지도 않았습니다. 가장 약한 로봇들 중 일부가 가장 비싼 비용을 썼던 반면, 가장 뛰어난 로봇은 놀라울 정도로 효율적이었습니다. 이 연구는 AI 에이전트들이 규칙을 따르는 능력은 향상되고 있지만, 실제 여행의 복잡하고 인간적인 제약 조건들을 동시에 완벽하게 조절하는 데는 여전히 어려움을 겪고 있다고 결론짓습니다. 여행에 대해 말하는 로봇과 완벽한 것을 예약할 수 있는 로봇 사이의 간극은 여전히 넓게 열려 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.