LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling
기존의 인간이 작성한 검색 벤치마크의 난이도 한계를 극복하기 위해, 본 논문은 11개 도메인에 걸친 544개의 복잡하고 장기적인 질문을 특징으로 하며 현재의 최첨단 검색 에이전트들의 정확도를 34.74%까지 떨어뜨리며 이들에게 상당한 도전 과제를 제시하는 자동화된 지식 그래프 기반 벤치마크인 LoHoSearch를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
LoHoSearch 논문 설명: 쉬운 모드의 함정과 새로운 도전
거대한 문제: "쉬운 모드"의 함정
보물찾기 게임을 상상해 보세요. 목표는 숨겨진 특정 보물을 찾는 것입니다. 지난 1년 동안 연구자들은 BrowseComp라는 게임을 사용하여 AI "검색 에이전트"(인터넷을 탐색하는 로봇)를 테스트해 왔습니다.
처음에는 게임이 어려웠습니다. 하지만 인간이 질문을 설계하다 보니, 의도치 않게 질문들이 너무 쉬워지는 문제가 발생했습니다. 인간은 보통 유명한 것들(예: "에펠탑"이나 "테일러 스위프트")을 선택하고 이를 명확한 단서와 연결하는 경향이 있습니다. 이는 마치 "보물"이라고 적힌 문 뒤에 보물을 숨겨두는 것과 같습니다.
단서가 너무 명확했기 때문에, 최고의 AI 로봇들은 빠르게 퍼즐의 90%를 해결하는 법을 익혔습니다. 이로 인해 게임은 똑똑한 로봇과 정말 똑똑한 로봇을 구분할 수 있는 능력을 상실했습니다. 난이도가 '천장'에 부딪힌 것입니다. 인간 설계자들은 인터넷 전체의 지도를 완벽하게 파악하여, 주어진 단서에 부합하는 다른 "보물"이 얼마나 더 존재할 수 있는지 알 수 없었기에 이 천장을 뚫을 수 없었습니다.
해결책: "슈퍼 맵" 구축하기
이 논문의 저자들은 인간의 추측에 의존하는 것을 멈추기로 했습니다. 대신, 그들은 **지식 그래프(Knowledge Graph)**를 기반으로 한 거대하고 자동화된 시스템을 구축했습니다.
이 지식 그래프를 인터넷 전체(특히 위키피디아)의 거대한 디지털 지도라고 생각하세요. 여기에는 700만 개 이상의 엔티티(사람, 장소, 사물 등)와 그들 사이의 연결 관계가 담겨 있습니다.
컴퓨터는 인간이 질문을 고르는 대신, 이 지도를 사용하여 다음을 수행합니다:
- "어려운" 경로 찾기: 가능한 답이 하나나 둘이 아니라, 수천 개나 존재하는 연결 고리를 찾아냅니다.
- 복잡한 미로 만들기: 로봇이 정답을 찾기 전까지 수많은 막다른 길을 거쳐야만 하는 질문을 생성합니다.
- 정답 검증: 오직 단 하나의 특정 답만이 단서에 부합한다는 것을 수학적으로 증명하여, 퍼즐이 공정함을 보장합니다.
새로운 게임: LoHoSearch
그 결과 탄생한 것이 LoHoSearch(Long-Horizon Search)라는 새로운 벤치마크입니다. 이 게임은 음악, 스포츠, 영화 등 11가지 서로 다른 주제에 걸쳐 544개의 까다로운 질문을 담고 있습니다.
새로운 게임은 규칙을 다음과 같이 바꿉니다:
- 탐색 공간이 거대해졌습니다: 기존 게임에서 단서가 "누가 이 노래를 불렀나요?"였다면 유명한 가수는 5명 정도였을 것입니다. 하지만 LoHoSearch에서 단서는 "특정 연도, 특정 장르의 이 생소한 노래를 누가 불렀는가?"가 될 수 있으며, 이 경우 후보가 되는 가수는 수백 명에 달합니다. 로봇은 이들을 모두 확인해야 합니다 합니다.
- 미로가 뒤틀렸습니다: 질문은 단순히 직선 형태가 아닙니다. 서로를 다시 참조하며 순환하는 단서들이 얽혀 있는 복잡한 그물망과 같습니다. 단순히 추측해서는 안 되며, 깊이 있게 사고해야 합니다.
결과: 로봇들이 벽에 부딪히다
연구진은 세계에서 가장 똑똑한 AI 모델들을 이 새로운 게임으로 테스트했습니다. 결과는 충격적이었습니다.
- 기존 게임: 상위 모델들의 점수는 90% 이상이었습니다.
- 새로운 게임: 최고 성능의 모델(GPT-5.5)조차도 겨우 **34.7%**를 기록했습니다.
마치 로봇들이 체스의 '그랜드마스터'에서 갑자기 훨씬 더 어려운 새로운 게임의 규칙을 배우느라 허우적거리는 상황과 같습니다.
현재의 기술들이 통하지 않는 이유
로봇이 어려운 퍼즐에 막히면, 보통 **"컨텍스트 관리(Context Management)"**라는 전략을 사용합니다. 탐정이 100페이지 분량의 노트를 작성하고 있다고 상상해 보세요. 노트가 너무 가득 차면, 탐정은 새로운 내용을 적을 공간을 만들기 위해 노트를 요약하거나 오래된 페이지를 버리려고 시도합니다.
연구진은 LoHoSearch에서 이러한 전략들을 테스트했습니다.
- 기존의 쉬운 게임에서는 이러한 기술들이 로봇의 성능을 14% 향상시켰습니다.
- 하지만 새로운 어려운 게임에서는 이 기술들이 단 **6.8%**의 도움만 주었습니다.
이는 문제가 단순히 무언가를 기억하는 능력이 아니라는 것을 보여줍니다. 문제는 "미로"가 너무 복잡하고 "탐색 공간"이 너무 커서, 로봇의 현재 두뇌로는 요구되는 긴 추론의 사슬을 감당할 수 없다는 점입니다.
핵심 요약
LoHoSearch는 우리가 단순히 인간이 쓴 조금 더 어려운 질문을 만드는 것만으로는 부족하다는 것을 증명합니다. AI가 정말로 똑똑해지고 있는지 테스트하려면, 수학적으로 난이도가 보장된 퍼즐을 만들기 위해 컴퓨터가 생성한 지도를 사용해야 합니다.
이 새로운 벤치마크는 AI의 현재 한계를 드러내는 "스트레스 테스트" 역할을 합니다. AI가 쉬운 답을 찾는 데는 뛰어나지만, 단 하나의 숨겨진 진실을 찾기 위해 거대하고 복잡한 정보의 그물망을 헤쳐 나가야 할 때는 여전히 상당한 어려움을 겪고 있다는 사실을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.