← 최신 논문
💬 NLP

ZeroSearch: Incentivize the Search Capability of LLMs without Searching

ZeroSearch 는 경량 커리큘럼 기반의 시뮬레이션 검색 모듈을 활용하여 대규모 언어 모델의 검색 능력을 효과적으로 장려하고 향상시킴으로써 실제 검색 엔진 훈련의 높은 비용과 불안정한 데이터 품질 문제를 극복하는 새로운 강화 학습 프레임워크입니다.

원저자: Hao Sun, Zile Qiao, Jiayan Guo, Xuanbo Fan, Yingyan Hou, Yong Jiang, Pengjun Xie, Yan Zhang, Fei Huang, Jingren Zhou

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hao Sun, Zile Qiao, Jiayan Guo, Xuanbo Fan, Yingyan Hou, Yong Jiang, Pengjun Xie, Yan Zhang, Fei Huang, Jingren Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 천재이지만 경험이 부족한 학생 (AI) 에게 도서관에서 단서를 찾아 복잡한 미스터리를 해결하는 법을 가르치고 있습니다. 보통 이 기술을 가르치려면 학생이 질문을 할 때마다 실제 도서관으로 보내야 합니다.

실제 도서관의 문제점:

  1. 예측 불가능한 책들: 때로는 사서가 완벽하고 유용한 책을 건네지만, 다른 때는 찢어지거나 구식이거나 완전히 잘못된 팜플렛을 건네기도 합니다. 이로 인해 학생은 일관되게 학습하기 어렵습니다.
  2. 비싼 입장료: 학생이 도서관을 방문할 때마다 엄청난 비용이 듭니다. 학생이 요령을 익히기 위해 수천 번의 여행을 해야 한다면 예산은 즉시 폭주합니다.

해결책: ZEROSEARCH(가상 도서관)
통이 실험실 (Tongyi Lab) 의 연구원들은 ZEROSEARCH라는 교묘한 훈련 방법을 개발했습니다. 학생을 실제 도서관으로 보내는 대신, 또 다른 AI 를 이용해 교실 안에 시뮬레이션 도서관을 구축한 것입니다.

다음은 단계별 작동 방식입니다:

1. "연기"하는 사서

먼저 연구원들은 표준 AI 에게 빠르고 가벼운 훈련 세션 (마치 단기 과정처럼) 을 시켜, 이 AI 가 사서 역할을 하도록 가르칩니다.

  • 마술 같은 트릭: 연구원들은 이 "사서 AI"에게 어떤 종류의 책을 건네줄지 정확히 지시할 수 있습니다.
  • "유용한 책을 주세요"라고 말하면 AI 는 완벽하고 정확한 문서를 생성합니다.
  • "잡음 (혼란스럽거나 잘못된) 이 많은 책을 주세요"라고 말하면 AI 는 쓰레기를 생성합니다.
  • 이것이 중요한 이유: 실제 도서관에서는 사서가 무엇을 찾아낼지 통제할 수 없지만, 여기서는 교사가 "단서"의 품질을 완전히 통제할 수 있습니다.

2. "점진적 난이도" 게임 (커리큘럼 학습)

연구원들은 학생을 즉시 깊은 물에 빠뜨리지 않습니다. 대신 커리큘럼 롤아웃 (curriculum rollout) 전략을 사용하는데, 이는 레벨이 올라갈수록 어려워지는 비디오 게임과 같습니다:

  • 레벨 1 (쉬움): 사서 AI 는 완벽한 유용한 책만 건넵니다. 학생은 "질문하면 답을 얻고 퍼즐을 푼다"는 기본 규칙을 배웁니다.
  • 레벨 2 (중간): 사서는 혼란스럽거나 약간 잘못된 책을 섞어주기 시작합니다. 학생은 나쁜 정보를 걸러내는 법을 배워야 합니다.
  • 레벨 3 (어려움): 사서는 대부분 쓰레기를 건넵니다. 학생은 이제 어떤 작은 정보 조각이 실제로 진실인지 파악하는 탐정이 되어야 합니다.

훈련이 끝날 때쯤이면 학생은 나쁜 정보를 걸러내는 데 매우 능숙해져 실제 도서관을 완벽하게 다룰 수 있게 됩니다.

3. 결과: 더 저렴하고 더 똑똑함

이 논문은 다양한 크기의 AI "학생"(30 억 파라미터 모델부터 140 억 파라미터 모델까지) 으로 이 방법을 테스트했습니다.

  • 비용: 실제 도서관 (구글) 을 호출하지 않았기 때문에 막대한 비용을 절감했습니다. "가상 도서관"은 자체 서버에서 실행되므로 수천 건의 실제 검색 API 호출 비용을 지불하는 것보다 훨씬 저렴합니다.
  • 성능:
    • 이 방법으로 훈련된 작은 AI 는 실제 검색 엔진으로 훈련된 것과 동일한 성능을 발휘했습니다.
    • 중간 크기 AI(7B) 는 실제 검색 엔진과 맞먹는 성능을 보였습니다.
    • 대형 AI(14B) 는 실제로 실제 검색 엔진을 초월했습니다!
  • 일반화: 이는 "원본"(Base) 이든 "지시 따르도록 훈련된"(Instruct) 이든 다양한 유형의 AI 모델에 대해 작동했습니다.

핵심 요약
ZEROSEARCH는 훈련 중에 실제로 웹에 접근하지 않고도 AI 에게 웹 검색 방법을 가르치는 방법입니다. 쉽게 시작해 점점 어려워지는 통제 가능한 "가짜" 검색 엔진을 사용하여 AI 는 더 뛰어난 탐정이 되는 법을 배우고, API 수수료로 막대한 비용을 절약하며, 혼란스럽고 예측 불가능한 실제 인터넷에서 훈련받았을 때보다 더 나은 성능을 발휘하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →