← 최신 논문
💬 NLP

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

본 논문은 1 만 건의 선별된 SFT 데이터셋을 통해 심층 연구 에이전트를 검색 중심에서 구성 중심 추론으로 전환시키는 데이터 합성 파이프라인인 WebAggregator 를 소개하며, 이를 통해 32B 모델이 벤치마크에서 최상위 시스템보다 우수한 성능을 발휘하고, 차세대 연구 에이전트의 주요 병목 현상이 검색이 아닌 구성적 추론임을 입증합니다.

원저자: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

게시일 2026-04-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

WebAggregator 논문에 대한 설명을 간단한 언어와 창의적인 비유를 사용하여 제시합니다.

큰 문제: "구글러" 대 "탐정"

연구 조교를 고용한다고 상상해 보세요.

  • 구식 방법 (현재의 AI 에이전트): "2024 년 수상자는 누구인가요?"라고 물으면, 그들은 즉시 브라우저를 열어 구글에 질문을 입력하고 목록을 찾아 최상위 이름을 가리킵니다. 이는 정보 탐색입니다. 빠르지만, 들은 것을 반복하는 앵무새와 같습니다. 만약 세 개의 서로 다른 웹사이트에서 세 가지 다른 사실을 연결하여 퍼즐을 풀어야 하는 답이 필요하다면, 앵무새는 혼란에 빠집니다.
  • 새로운 목표 (심층 연구): "200 만 제곱킬로미터보다 큰 모든 국가 중에서 2010 년부터 2020 년까지 경제 변동성이 가장 컸던 나라는 어디인가요?"라고 묻는다면, 에이전트는 단순히 답을 '찾을' 수 없습니다. 다음과 같은 작업을 수행해야 합니다:
    1. 큰 국가들의 목록을 찾습니다.
    2. 각 국가의 경제 데이터를 찾습니다.
    3. '변동성'을 계산하기 위해 복잡한 수학을 수행합니다.
    4. 결과를 비교합니다.
      이는 구성적 추론입니다. 단순히 헤드라인을 읽는 것이 아니라, 미스터리를 해결하기 위해 단서들을 맞춰 나가는 탐정과 같습니다.

이 논문은 현재의 AI 에이전트들이 '구글러'로서는 뛰어나지만 '탐정'으로서로는 형편없다고 주장합니다. 그들은 올바른 링크를 찾는 데 너무 의존하고, 찾은 내용을 깊이 있게 사고하는 데는 부족합니다.

해결책: WebAggregator ("훈련 체육관")

이를 해결하기 위해 연구자들은 WebAggregator라는 시스템을 구축했습니다. 이는 새로운 AI 가 아니라, '구글러'를 '탐정'으로 바꾸기 위해 설계된 전문 훈련 캠프로 생각하세요.

이 시스템은 어려운 시험을 만드는 두 명의 팀원처럼 두 가지 주요 단계로 작동합니다:

  1. 적극적인 탐험가 (수집가):
    거대한 도서관에 단 한 권의 책과 함께 보내진 로봇을 상상해 보세요. 그 로봇의 임무는 그 책을 열고, 다른 책에 대한 참조를 찾아 그 책으로 이동한 뒤, 사진을 찾고, 파일을 다운로드하고, 숨겨진 버튼을 클릭하는 것입니다. 이는 웹 전체에서 흩어지고 엉망진창인 방대한 정보 더미를 수집합니다.

    • 논문에서: 이 에이전트는 실제 웹사이트를 방문하고, 파일을 다운로드하며, 복잡한 페이지를 탐색하여 원시 데이터를 수집합니다.
  2. 구성적 논리 제안자 (퍼즐 마스터):
    수집가가 데이터 더미를 모으면, 퍼즐 마스터는 그것을 보고 "좋아, 이 엉망진창을 바탕으로 한 페이지만 보면 답할 수 없는 질문을 만들어 보자"라고 말합니다.

    • 그들은 수학, 필터링, 비교, 시간 여행 (시간적 추론) 을 요구하도록 질문을 강제하는 엄격한 규칙 세트 (12 가지 논리 유형) 를 사용합니다.
    • 예시: "중국의 GDP 는 얼마인가요?"라고 묻는 대신, "지난 10 년간 중국의 GDP 성장률과 도시화율 간의 표준 편차를 계산하라"고 묻습니다.

결과: 새로운 데이터셋과 더 똑똑한 AI

이 팀은 이 시스템을 사용하여 약 10,000 개의 극도로 어려운 질문으로 구성된 WebAggregatorQA라는 데이터셋을 만들었습니다. 그런 다음 이 질문들을 사용하여 새로운 AI 모델 (WebAggregator) 을 훈련시켰습니다.

이 새로운 모델을 테스트했을 때 일어난 일은 다음과 같습니다:

  • 검색의 함정: 연구자들은 GPT-4.1 과 Claude-3.7 과 같은 최상위 AI 모델들을 이러한 어려운 질문으로 테스트했습니다. 문제를 해결하는 데 필요한 모든 올바른 웹사이트와 문서를 모델들에게 제공했음에도 불구하고, 모델들은 여전히 실패했습니다.

    • 비유: 학생에게 정답이 하이라이트된 교과서를 주었지만, 계산 방법을 이해하지 못해 여전히 수학 문제를 풀지 못하는 것과 같습니다.
    • 발견: 병목 현상은 정보를 찾는 것이 아니라, 그것을 추론하는 데 있습니다.
  • 변화: WebAggregator 데이터셋으로 모델을 훈련시켰을 때, 에이전트들의 행동이 바뀌었습니다:

    • 전: 버튼을 클릭하고 링크를 열며 허둥지둥했습니다 (높은 도구 사용, 낮은 사고).
    • 후: 버튼 클릭은 줄였지만 점들을 연결하기 위해 더 많은 시간을 '사고' (내부 추론) 에 할애했습니다.
    • 성능: 새로운 WebAggregator-32B 모델은 이러한 어려운 추론 작업에서 기존 최상위 모델들을 능가했으며, 이는 '탐정 작업'에 대한 훈련이 AI 를 더 똑똑하게 만든다는 것을 증명했습니다.

결론

이 논문은 AI 가 과학적 발견이 가능한 진정한 '심층 연구' 에이전트가 되려면, 웹 검색 능력이 얼마나 뛰어난지에 집중하는 것을 멈춰야 한다고 결론 내립니다. 대신, 논리적 결론을 도출하기 위해 산재한 정보 조각들을 어떻게 연결하는지에 집중해야 합니다.

간단히 말해: 이 논문은 AI 에이전트들이 실제 웹 데이터를 사용하여 복잡한 퍼즐을 풀도록 연습하는 체육관을 만들었습니다. 그 결과, 허둥지둥 웹 서핑을 하는 에이전트보다 사고력 있고 논리적인 연구자 같은 에이전트가 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →