← 최신 논문
🤖 AI

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

본 논문은 동기화된 지식 베이스를 구축하여 사실적 신뢰성을 정량화하고 자율적 검색의 인지 부하와 지시 유지 간의 중요한 트레이드오프를 드러냄으로써 비정형 멀티모달 웹 코퍼스에 기반한 여행 계획 에이전트를 평가하는 검증 가능한 벤치마크인 VeriTrip 을 소개합니다.

원저자: Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여행 계획을 완벽하게 세우기 위해 여행 에이전트를 고용한다고 상상해 보세요. 과거에는 이 에이전트에게 항공 일정이나 호텔 목록과 같은 깔끔하고 미리 인쇄된 옵션 메뉴를 제시하고, 그중에서 최선의 선택을 하도록 요청했습니다. 에이전트는 훌륭한 계획을 수립하기 위해 단순히 수학과 논리에 능숙하기만 하면 되었습니다.

하지만 현실 세계에는 그런 깔끔한 메뉴가 없습니다. 오직 수천 개의 여행 블로그, 소셜 미디어의 흐릿한 사진, 상충되는 리뷰, 그리고 구식 웹사이트로 이루어진 혼란스럽고 지저분한 인터넷만 있을 뿐입니다.

VeriTrip은 이러한 현실 세계의 혼란을 처리할 수 있는지 확인하기 위해 설계된 AI 여행 에이전트를 위한 새로운 "테스트 드라이브"입니다. 여기서는 이 논문이 간단한 비유를 사용하여 설명하는 방식을 소개합니다.

1. 문제: "청정실" 대 "정글"

대부분의 이전 AI 에이전트 테스트는 모든 사실이 완벽한 필체로 벽에 적혀 있는 깔끔하고 흰 방에 에이전트를 넣는 것과 같았습니다. AI 는 그저 벽을 읽고 계획을 작성하기만 하면 되었습니다.

저자들은 이것이 AI 가 실제로 똑똑한지 테스트하지 못한다고 말합니다. 현실은 정글입니다.

  • 노이즈: 인터넷은 가짜 광고, 혼란스러운 오타, 그리고 어떤 식당이 좋은지 나쁜지에 대해 논쟁하는 사람들로 가득 찬 "노이즈"로 가득 차 있습니다.
  • 시각 퍼즐: 때로는 사용자가 랜드마크 (예: 동상) 의 흐릿하고 잘린 사진을 보내며 "여기에 가고 싶습니다"라고 말합니다. AI 는 이름표 없이 정확히 어떤 동상인지 파악해야 합니다.
  • 환각의 함정: AI 가 답을 찾지 못하면 학습 데이터에서 무언가를 "기억"한다는 이유로 임의의 답을 만들어낼 수 있습니다. 여행 분야에서는 항공편 번호를 임의로 만들어내는 것이 재앙이 될 수 있습니다.

2. 해결책: "VeriTrip" 테스트

연구자들은 이러한 에이전트들을 테스트하기 위해 VeriTrip이라는 특수한 샌드박스를 구축했습니다. 이를 인터넷의 얼어붙은 스냅샷이라고 생각하세요.

  • 도서관 (MRB): 그들은 실제 여행 사이트에서 8,000 개 이상의 문서와 4,000 개의 이미지를 수집했습니다. 이것이 AI 가 검색할 수 있는 "도서관"입니다. 실제 웹과 마찬가지로 지저분하고 정리되지 않았습니다.
  • 정답 키 (VKB): AI 에게는 숨겨진 "골드 스탠다드" 정답 키가 있습니다. 여기에는 그 지저분한 도서관에서 추출된 진실된 사실들이 담겨 있습니다.
  • 테스트: AI 는 사용자 요청 (예: "3 일 동안 창샤로 여행 계획을 세우고, 예산은 500 달러이며, 여기는 청동 유물의 흐릿한 사진입니다") 을 받습니다. AI 는 다음을 수행해야 합니다:
    1. 흐릿한 사진을 보고 그것이 무엇인지 파악합니다.
    2. 지저분한 도서관을 검색하여 올바른 사실을 찾습니다.
    3. 계획을 수립합니다.
    4. 주의할 점: 연구자들은 숨겨진 정답 키와 비교하여 항공편 번호, 호텔 이름, 가격 등 모든 세부 사항을 확인합니다. AI 가 사실을 임의로 만들어냈다면 해당 부분에 대해 0 점으로 처리됩니다.

3. 발견된 결과: "뇌 과부하"라는 놀라운 사실

연구자들은 이용 가능한 가장 똑똑한 AI 모델 (GPT-4o, Claude, Gemini 등) 을 테스트했습니다. 다음과 같은 일이 발생했습니다.

  • "게으른" 작업 대 "힘든" 작업: 쉬운 작업에서 AI 들은 "게으름"을 피웠습니다. 충분히 검색하지 않고 기억하는 것에 기반하여 추측만 했습니다. 이로 인해 실수가 발생했습니다. 반면 어려운 작업에서는 더 많이 검색하도록 강요받았고, 이는 실제로 정확도를 높였습니다.
  • 트레이드오프 (재주 부리기): 이것이 가장 흥미로운 발견입니다.
    • AI 가 흐릿한 사진 퍼즐을 해결하기 위해 "눈"을 사용해야 할 때, 사실을 찾는 능력은 향상되었습니다 (가짜 이름을 만들어내지 않게 되었습니다).
    • 하지만, 사진 퍼즐을 해결하는 데 "뇌력"이 너무 많이 소모되었기 때문에 사용자의 다른 선호도를 잊어버렸습니다. 올바른 호텔을 찾을 수는 있지만, 사용자가 채식주의 식사를 원하거나 특정 예산을 원했다는 사실을 잊을 수 있습니다.
    • 비유: 이는 어려운 수학 문제를 풀는 데 너무 집중하여 시험지 이름란에 이름을 쓰지 않는 학생과 같습니다. 수학은 맞췄지만, 전체 과제는 실패한 것입니다.

4. 결론: "보는 것"은 "계획하는 것"이 아니다

이 논문은 현재의 AI 에이전트들은 두 가지 별개의 일에는 능숙하지만, 이를 결합하는 데는 서툴다고 결론 내립니다.

  1. 보기: 그들은 사진을 보고 올바른 장소를 찾을 수 있습니다.
  2. 계획하기: 그들은 일정을 조직할 수 있습니다.

하지만 혼란스러운 환경에서 동시에 두 가지 일을 수행해야 할 때 그들은 어려움을 겪습니다. 그들은 종종 사실은 정확하지만 계획은 틀리거나, 계획은 정확하지만 사실은 임의로 만들어낸 경우가 많습니다.

간단히 말해: VeriTrip 은 혼란스러운 세상에서 사실을 찾아내는 방법과 사용자의 구체적인 소망을 놓치지 않는 방법을 동시에 가르쳐야 진정한 신뢰할 수 있는 AI 여행 에이전트를 만들 수 있음을 보여줍니다. 현재로서는 AI 가 공을 떨어뜨리고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →