← 최신 논문
🤖 AI

LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

본 논문은 현재 LLM 기반 검색 에이전트들이 실제 웹 검색보다는 내재된 지식에 의존하는 경우가 많음을 밝히고, 이를 바탕으로 진정한 증거 기반 발견 능력을 효과적으로 평가하기 위해 최신의 덜 주목받는 사실을 활용한 동적 벤치마크인 LiveBrowseComp 를 제안합니다.

원저자: HuiMing Fan, Xiao Wang, Zheng Chu, Qianyu Wang, Zhuoyao Wang, Ming Liu, Bing Qin, XingYu

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: HuiMing Fan, Xiao Wang, Zheng Chu, Qianyu Wang, Zhuoyao Wang, Ming Liu, Bing Qin, XingYu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 논문 "LiveBrowseComp: 검색 에이전트가 실제로 검색하는 것일까, 아니면 이미 알고 있는 내용만 확인하는 것일까?"에 대한 설명을 쉬운 언어와 창의적인 비유로 정리한 것입니다.

핵심 질문: 탐험하는 것일까, 아니면 숙제만 확인하는 것일까?

상상해 보세요. 특정한 희귀한 사실을 찾아달라고 초지능 형사 (AI 에이전트) 를 고용했습니다. 그에게 도서관 카드 (인터넷 접속 권한) 를 건네주며 "정답을 찾아오라"고 지시합니다.

이 논문은 의심스러운 질문을 던집니다. 이 형사가 정말로 도서관을 뒤져 새로운 정보를 찾아내는 것일까, 아니면 이미 외운 책을 펼쳐 머릿속에서 정답을 찾아낸 뒤, 도서관 카드를 이용해 단지 "봐라, 내가 옳다고 했지?"라고 말하기만 하는 것일까?

저자들은 이 행동을 **내재적 지식 의존성 (Intrinsic Knowledge Dependence, IKD)**이라고 부릅니다. 이는 연습 문제의 정답을 이미 외운 학생과 같습니다. 실제 시험을 볼 때 공부할 필요가 없으며, 기억하는 대로 적어내되 '오픈 북' 규칙을 활용해 자신의 기억이 정확한지 확인하기만 할 뿐입니다.

현재 테스트의 문제점 (정적 벤치마크)

현재 우리는 이러한 AI 형사들을 '정적 벤치마크 (Static Benchmarks, 예: BrowseComp)'로 테스트합니다. 이는 오래되고 먼지 낀 퀴즈와 같습니다.

  • 문제점: 이러한 퀴즈는 이미 오래전부터 존재했기 때문에, AI 모델들이 훈련 과정에서 이미 질문들을 '읽었을' 가능성이 높습니다.
  • 결과: AI 가 높은 점수를 받지만, 이는 검색 능력이 뛰어나서가 아니라 기억 능력이 뛰어나기 때문입니다. AI 는 기억에서 정답을 추측한 뒤, 인터넷을 이용해 단지 자신감을 얻기만 할 뿐입니다.

세 가지 '거짓말 탐지기' 테스트

연구자들은 자신의 의심을 증명하기 위해 기존 AI 모델들을 대상으로 세 가지 간단한 실험을 수행했습니다.

  1. '도구 없음' 테스트: 인터넷을 차단했습니다.
    • 결과: AI 들은 여전히 정답의 약 **44%**를 맞췄습니다. 이는 AI 가 검색 도구가 아닌 내부 기억에 의존하고 있음을 증명했습니다.
  2. '고장 난 도서관' 테스트: AI 가 인터넷을 사용할 수는 있게 했지만, 정답이 담긴 모든 페이지를 몰래 제거했습니다. AI 는 관련 없는 쓰레기 정보만 볼 수 있었습니다.
    • 결과: AI 들의 점수는 급락했습니다. 쓰레기 정보를 무시하고 기억에 의존하지 않고, 혼란을 겪으며 틀린 답을 내놓았습니다. 이는 AI 가 진실을 발견하기 위해 검색을 사용하는 것이 아니라, 이미 추측한 내용을 확인하기 위해 검색을 사용했음을 보여줍니다.
  3. '단서 추적' 테스트: AI 의 검색 기록을 관찰했습니다.
    • 결과: AI 가 검색한 질문 중 50% 이상이 웹에서 실제로 찾은 내용에 기반한 것이 아니라, AI 자신의 추측에 기반한 것으로 나타났습니다. 이는 자신의 꼬리를 물고 도는 것과 같습니다.

해결책: 'LiveBrowseComp' 도입

이 문제를 해결하기 위해 연구자들은 LiveBrowseComp라는 새로운 테스트를 개발했습니다.

비유:
만약 이전 테스트가 AI 가 TV 를 통해 이미 봤을 수도 있는 작년의 '제퍼디!' 에피소드였다면, 새로운 테스트는 지금 바로 진행 중인 생방송 뉴스와 같습니다.

  • 신선함: 질문들은 지난 90 일 이내에 발표된 사실들을 기반으로 합니다. AI 가 '탄생' (훈련) 할 때 존재하지 않았던 내용들이므로 AI 가 이를 외울 수 없습니다.
  • 희소성: 사실들은 "수퍼볼 우승자는 누구인가?"와 같은 유명한 헤드라인이 아닙니다. "3 주 전 페루의 작은 마을에서 발생한 지진의 구체적인 규모는 얼마였는가?"나 "어제 출시된 니치 비디오 게임의 이름은 무엇인가?"와 같은 '롱테일' 사실들입니다.
  • 목표: AI 가 기억에서 추측하는 것이 아니라, 실제로 정보를 사냥하도록 강제하는 것입니다.

새로운 테스트를 실행했을 때의 결과

결과는 충격적이었습니다.

  1. 기억의 실패: AI 가 인터넷을 사용하지 않고 (Closed-Book) 이러한 새로운 질문에 답하려 할 때, 점수는 2% 미만으로 떨어졌습니다. 그들은 이러한 최신 사실에 대해 거의 아무것도 알지 못했습니다.
  2. 검색 점수 하락: 인터넷 사용이 허용되었을 때도, AI 의 점수는 이전 테스트에 비해 25~40 점 하락했습니다.
  3. 순위 변화: 이전 테스트에서 '우승자'였던 AI 모델들 (기억력이 뛰어났기 때문) 은 새로운 테스트에서 갑자기 평균 이하 또는 하위권으로 떨어졌습니다. 반면, 실제로 검색하는 능력이 뛰어난 모델들이 최상위권으로 올라섰습니다.

인간과의 비교

연구자들은 실제 인간들에게도 이러한 질문들을 풀도록 요청했습니다.

  • 발견: 인간들은 '옛' 질문과 '새' 질문을 푸는 데 거의 동일한 시간이 걸렸습니다.
  • 의미: 새로운 질문들이 더 '어렵거나' 더 '똑똑한' 것이 아닙니다. 단지 새로울 뿐입니다. AI 가 어려움을 겪은 유일한 이유는 기억이라는 편법을 사용할 수 없었기 때문입니다.

결론

이 논문은 현재의 AI 평가가 검색이 아닌 기억을 보상하기 때문에 결함이 있다고 결론 내립니다.

  • 구 방식: "정답을 추측한 뒤, 이를 뒷받침할 웹사이트를 찾을 수 있는가?" (AI 는 A 학점 획득).
  • 신 방식 (LiveBrowseComp): "본 적이 없는 정답을 찾아낼 수 있는가?" (AI 는 F 학점 획득).

저자들은 AI 가 진정한 '검색 에이전트'인지 여부를 진정으로 테스트하려면, AI 가 이미 알지 못하는 것들을 대상으로 테스트하여, 단순 확인이 아닌 발견이라는 어려운 작업을 수행하도록 해야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →