← 최신 논문
💬 NLP

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

이 논문은 한국적 맥락에 기반하여 수동으로 검증된 문제와 합성 문제를 포함한 400개의 문제로 구성된 새로운 웹 브라우징 에이전트 벤치마크인 K-BrowseComp을 소개하며, 이는 최첨단 모델 및 한국 특화 대규모 언어 모델들조차 이러한 과업에서 0%에서 45.67% 사이의 정확도를 기록하며 상당한 어려움을 겪는다는 것을 드러낸다.

원저자: Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 세상의 거의 모든 책을 읽은, 매우 똑똑하고 빠른 사서가 있다고 상상해 보세요. 당신이 간단한 질문을 던지면 그는 즉시 대답합니다. 하지만 당신이 특정 동네를 돌아다니며, 특정 문을 두드리고, 몇 가지 다른 장부를 확인하며, 그 지역에만 존재하는 단서들을 조합해야 하는 까다로운 질문을 던진다면 어떻게 될까요?

이것이 바로 이 논문, K-BROWSECOMP가 다루고자 하는 내용입니다.

문제점: "로컬 네이버후드(Local Neighborhood)"의 격차

오랫동안 우리는 AI에게 논리 퍼즐을 풀거나 지시를 따르게 함으로써 성능을 테스트해 왔습니다. AI는 그런 작업에는 매우 능숙해졌습니다. 하지만 현실 세계는 단순히 논리에 관한 것이 아니라, **맥락(Context)**에 관한 것입니다.

저자들은 AI가 "글로벌" 인터넷(주로 영어)에는 뛰어나지만, 한국 인터넷을 탐색해야 할 때는 어려움을 겪는다고 주장합니다. 이는 마치 유능한 요리사에게 그들이 말하지 못하는 언어로 쓰인 레시피와 특정 마을 시장에서만 구할 수 있는 재료를 주는 것과 같습니다. 요리사가 요리법은 알지 몰라도, 특정 재료를 찾으려다 길을 잃거나 현지의 지침을 오해할 수 있는 것과 같습니다.

현재로서는 AI가 이러한 특정한 로컬 한국 웹 검색을 얼마나 잘 처리할 수 있는지 확인할 표준화된 "테스트"가 없었습니다. 기존의 테스트들은 너무 쉬웠거나, AI가 답을 찾기 위해 실제로 웹을 '브라우징'할 것을 요구하지 않았습니다.

해결책: 새로운 "장애물 코스"

연구진은 K-BROWSECOMP라는 새로운 벤치마크를 구축했습니다. 이것을 AI 에이전트(웹을 브라우징하는 로봇)를 위한 특화된 장애물 코스라고 생각하세요.

  • 코스: 400개의 까다로운 질문들로 구성되어 있습니다.
  • 규칙: 답을 맞히기 위해 AI는 단순히 추측하거나 암기한 것에 의존할 수 없습니다. AI는 반드시 다음 과정을 거쳐야 합니다:
    1. 한국 웹으로 이동한다.
    2. 특정하고 찾기 어려운 사실(예: "특정 시인의 10번째 책 중 13번째 시의 제목은 무엇인가?")을 검색한다.
    3. 서로 다른 웹사이트의 단서들을 연결한다.
    4. 단 하나의 정확한 답을 제시한다.

그들은 테스트를 두 부분으로 나누었습니다:

  1. 검증 세트 (300문제): 실제 사람이 작성하고 검토하여, 정답이 확실하고 단서들이 공개된 한국 웹사이트에 존재하는지 확인했습니다.
  2. 합성 세트 (100문제): 이것은 영리한 부분입니다. 연구진은 다른 AI들이 실패하는 지점을 관찰하여, 더 어렵고 새로운 질문을 생성하기 위해 AI를 사용했습니다. 이는 마치 비디오 게임 디자이너가 플레이어가 특정 레벨에서 막히는 것을 보고, 그들을 똑같은 방식으로 가두기 위해 새로운 레벨을 설계하는 것과 같습니다.

결과: AI가 길을 잃다

결과는 놀라웠습니다. 세계 최고의 AI 모델들(AI의 "슈퍼스타들")조차도 크게 고전했습니다.

  • 글로벌 거물들: 가장 뛰어난 모델들(GPT-5.5 등)은 검증된 질문의 약 **45%**만을 맞혔습니다. 이는 그들이 절반 이상의 경우에 실패했음을 의미합니다.
  • 로컬 영웅들: 한국 문화의 전문가여야 할 한국형 AI 모델들은 훨씬 더 낮은 성적을 기록하며, 0%에서 10% 사이의 점수를 받았습니다.
  • 합성 트랩: AI가 생성한 "함정" 질문들에서, 최고 모델은 단 **26%**만을 맞혔습니다.

왜 실패했을까? ("교통 체증" 비유)

논문은 단순히 "실패했다"라고 말하는 데 그치지 않습니다. 그들이 어떻게 실패했는지 설명합니다. AI가 사건을 해결하려는 탐정이라고 상상해 보세요.

  1. 단서를 찾았으나 맥락을 놓침: AI는 종종 올바른 웹사이트(올바른 단서)를 찾지만, 자신이 찾던 특정 규칙을 잊어버립니다. 이는 올바른 집을 찾아갔지만, 그 집의 우편함에서 특정 편지를 확인하는 것을 잊어버리는 것과 같습니다.
  2. 잘못된 문을 선택함: AI는 후보 목록(예: K-팝 그룹 리스트)을 찾지만, 모든 규칙에 부합하는지 확인하지 않고 그저 그럴싸해 보이는 첫 번째 항목을 선택합니다.
  3. "모르겠음"의 순간: 때때로 AI는 정보를 찾았음에도 불구하고 최종 답안을 작성하는 과정에서 혼란을 느껴, 그냥 포기하거나 추측해 버립니다.

연구진은 문제가 AI가 정보를 찾지 못하는 것이 아니라는 것을 발견했습니다. 문제는 검색하는 동안 모든 다양한 정보의 조각들을 추적하고 유지하는 것에 있었습니다. 이는 마치 누군가가 퍼즐 조각을 계속 섞어대는 동안 퍼즐을 푸는 것과 같습니다. 올바른 조각을 찾기는 하지만, 그것들을 올바른 순서로 맞출 수가 없는 것입니다.

시사점

이 논문은 경종을 울립니다. AI가 똑똑하고 많은 사실을 알고 있다고 해서, 반드시 특정 로컬 환경에서 유능한 어시스턴트처럼 행동할 수 있다는 뜻은 아님을 보여줍니다.

연구진은 개발자들이 단순히 검색하는 것을 넘어, 한국의 디지털 세상에서 어떻게 탐색하고, 기억하고, 점들을 연결할 수 있는지 이해하는 더 나은 "한국형 웹 에이전트"를 구축할 수 있도록 이 테스트와 코드를 무료로 공개했습니다.

요약하자면: 우리는 AI가 달려야 할 어려운 미로를 한국적 맥락 속에서 만들었습니다. 가장 빠른 주자들도 길을 보지 못해서가 아니라, 방향 감각을 유지하지 못해 길을 잃었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →