← 최신 논문
🤖 AI

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace 벤치마크는 대규모 언어 모델에게 위키피디아 하이퍼링크를 탐색하도록 과제를 부여함으로써 이들의 계획 및 추론 능력을 평가하며, 최첨단 모델들이 쉬운 단계에서는 초인적인 성능을 달성하는 반면 장기적 계획 수립 및 실패로부터의 회복 능력의 한계로 인해 어려운 단계에서는 여전히 상당한 어려움을 겪는다는 것을 밝혀냈다.

원저자: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 "위키피디아 토끼굴(Wikipedia Rabbit Hole)" 게임을 하고 있다고 상상해 보세요. 당신은 바나나 페이지에서 시작하여, 문서 내부의 파란색 하이퍼링크만을 클릭하여 페라리 페이지에 도달하는 것이 목표입니다. 당신은 지도를 사용할 수 없고, 인터넷 전체를 볼 수도 없으며, 제한된 횟수(단계) 내에 도달해야 합니다. 만약 잘못된 링크를 너무 많이 클릭하면, 루프(반복)에 빠지거나 단계를 다 써버려 게임에서 패배하게 됩니다.

이것이 바로 인공지능(AI)이 실제 세상을 얼마나 잘 탐색하는지 알아보기 위해 연구진이 만든 새로운 테스트인 LLM-WikiRace의 핵심입니다.

다음은 이 논문의 발견 내용을 쉬운 비유를 들어 정리한 것입니다.

1. 테스트: 지도 없는 미로

대부분의 AI 테스트는 컴퓨터에게 수학 문제를 풀거나 코드를 작성하도록 요청합니다. 이 테스트는 다릅니다. 이 테스트는 AI에게 인간의 지식으로 만들어진 거대하고 보이지 않는 미로를 탐색하도록 요구합니다.

  • 설정: AI는 현재 페이지, 목표 페이지, 그리고 다음에 클릭할 수 있는 50개의 가능한 링크 목록을 봅니다.
  • 도전 과제: AI는 어떤 링크가 목표에 더 가까워지는지 추측해야 합니다. AI는 (GPS처럼) "최단 경로"를 볼 수 없습니다. 대신 세상이 어떻게 돌아가는지에 대한 내부적인 기억을 사용하여 계획을 세워야 합니다.

2. 결과: 걷기는 잘하지만, 달리기는 못한다

연구진은 많은 유명한 AI 모델(Gemini, GPT-5, Claude 등)을 테스트했습니다.

  • 쉬운 단계: 목표가 가까울 때(클릭 3~4번 거리), 상위 AI들은 숙련된 등산객과 같습니다. 그들은 약 **90%에서 96%**의 확률로 성공합니다. 그들은 지식이 풍부합니다.
  • 어려운 단계: 목표가 멀리 있을 때(클릭 7~8번 거리), AI들은 길을 잃습니다. 가장 똑똑한 모델인 Gemini 3.1조차도 이 게임에서 성공률은 **29%**에 불과했습니다.
  • 시사점: 이 논문은 이러한 AI들이 머릿속에 방대한 사실의 도서관을 가지고 있지만, 그 도서관을 사용하여 장기적인 계획을 세우는 데는 어려움을 겪는다고 주장합니다. 그들은 무엇이 무엇인지 아는 것에는 뛰어나지만, 경로가 길어질 때 A에서 B로 가는 방법을 알아내는 데는 서툽니다.

3. "계획의 격차(Planning Gap)": 아는 것과 하는 것의 차이

연구진은 **"계획의 격차"**라고 불리는 흥미로운 현상을 발견했습니다.

  • 두 명의 학생이 시험을 보고 있다고 상상해 보세요. 두 학생 모두 정확히 같은 양의 역사적 사실(세계 지식)을 알고 있습니다.
  • 학생 A (표준 AI)는 단순히 사실들을 암기합니다.
  • 학생 B ( "추론" AI)는 문제를 단계별로 생각하도록 훈련받았습니다.
  • 결과: 학생 B는 알고 있는 사실이 동일함에도 불구하고 학생 A보다 최대 20% 더 높은 점수를 받았습니다.
  • 교훈: 지식을 갖는 것만으로는 충분하지 않습니다. 그 지식을 승리 전략으로 바꾸기 위해서는 특별한 "추론 엔진"이 필요합니다.

4. 치명적인 결함: 루프에 갇히다

가장 놀라운 발견은 AI가 실패하는 방식이었습니다.

  • 루프(반복): AI가 실수를 하면, "좋아, 이 경로는 작동하지 않으니 다른 방법을 찾아보자"라고 말하는 대신, 종종 똑같은 링크를 계속해서 반복해서 클릭합니다.
  • 비유: 이는 숲속에서 원을 그리며 걷고 있는 사람과 같습니다. 그들은 "아, 여기 와봤던 곳인데"라고 깨닫지만, 방향을 돌리는 대신 계속해서 같은 원을 돌며 시간을 허비하다가 결국 끝납니다.
  • 데이터: 가장 어려운 게임에서 상위 모델들은 **86%**의 확률로 루프에 갇혔습니다. 일단 루프에 빠지면, 그들은 거의 탈출하지 못했습니다. 그들은 "재계획(replanning)"에 서툽니다.

5. 훈련은 도움이 되지만, 아주 조금뿐이다

연구진은 작은 AI 모델에게 연습 라운드(미세 조정)를 제공하여 이 게임을 하는 법을 "가르쳐" 보았습니다.

  • 결과: 이 모델은 쉬운 게임에서는 훨씬 나아졌습니다(성공률이 22%에서 67%로 상승).
  • 한계: 하지만 이 훈련은 어려운 게임에는 아무런 도움도 되지 않았습니다. 모델은 가장 어려운 단계에서 여전히 0%의 성공률을 보였습니다.
  • 결론: 단순히 연습을 통해 AI에게 이러한 어려운 문제를 해결하도록 "가르칠" 수는 없습니다. 장기적으로 계획을 세우는 근본적인 능력 자체가 결여되어 있는 것으로 보입니다.

요 요약

LLM-WikiRace는 단순하지만 가혹한 테스트입니다. 이 테스트는 오늘날의 초지능 AI들이 머릿속에 거대한 백과사전을 가지고 있음에도 불구하고, 여로가 길어질 때 이를 탐색하는 데는 여전히 형편없다는 것을 보여줍니다. 그들은 출구가 바로 문 옆에 있다면 찾을 수 있지만, 미로를 통과해야 한다면 혼란에 빠지고, 실수를 반복하며, 포기하는 경향이 있습니다.

논문은 AI가 진정으로 복잡한 과업을 마스터하기 위해서는 단순히 더 많은 사실을 아는 것이 아니라, 앞을 내다보고 계획하는 능력과 상황이 잘못되었을 때 생각을 바꾸는 능력을 훨씬 더 발전시켜야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →