← 최신 논문
💬 NLP

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1 는 복잡한 외부 감독이나 보조 모듈에 의존하지 않고 QA 벤치마크에서 최첨단 성능을 달성하기 위해 순수한 GRPO 와 오프라인 자기 증류만을 사용하여 검색 증강 추론 에이전트를 향상시키는 자기 진화 방법입니다.

원저자: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 서툰 학생 (AI) 이 까다로운 퀴즈 문제를 풀려고 노력한다고 상상해 보세요. 이 학생은 정답을 찾기 위해 도서관 (검색 엔진) 을 활용해 사실을 찾아볼 수 있지만, 언제 찾아보고 무엇을 물어볼지 직접 결정해야 합니다.

대부분의 기존 방법은 이 학생이 에세이를 완전히 끝낼 때까지 기다린 뒤 가르칩니다. 최종 답이 맞으면 교사는 금색 별을 주고, 틀리면 빨간 X 를 찍습니다. 문제는 무엇일까요? 학생은 어떤 구체적인 단계에서 실수했는지 알지 못합니다. 잘못된 질문을 했을까요? 잘못된 단락을 읽었을까요? 산만해졌을까요? 그들은 그저 전체 시도가 실패했다는 사실만 알 뿐입니다.

Search-E1은 이 학생을 가르치는 새롭고 더 간단한 방법입니다. 이는 초지능 인간 교사나 화려한 추가 로봇, 특별한 보상 시스템이 필요하지 않습니다. 대신 **"자기 진화 (Self-Evolution)"**라는 기법을 두 단계의 춤으로 활용합니다.

1 단계: "모두 시도해 보기" 단계 (GRPO)

먼저 학생에게 같은 질문을 다섯 번 내립니다.

  • 한 번의 시도에서는 도서관을 헤매며 터무니없는 질문을 하고 실패할 수 있습니다.
  • 다른 시도에서는 완벽한 질문을 던져 올바른 책을 찾아내고 빠르게 정답을 얻을 수 있습니다.

시스템은 이 다섯 번의 시도를 살펴보고 "좋아, 정답을 맞춘 그 시도가 이번 라운드의 '금표준 (Gold Standard)'이다"라고 말합니다. 하지만 앞서 언급했듯, 이는 학생에게 "그 에세이 전체를 잘 썼네"라고만 알려줄 뿐, "그 특정 질문을 잘 던졌네"라고 알려주지는 않습니다.

2 단계: "되감고 배우기" 단계 (오프라인 자기 증류)

이제 마법이 일어납니다. 시스템은 실패한 시도 (학생) 와 성공한 시도 (교사) 를 가져옵니다.

여기에 영리한 트릭이 있습니다:

  1. 시스템은 학생에게 원래 질문을 줍니다.
  2. 시스템은 교사에게 같은 질문을 주지만, 동시에 치트 시트를 건네줍니다. 바로 다른 시도에서 학생이 취했던 전체 성공 경로입니다.
  3. 교사는 치트 시트를 읽고 말합니다. "내가 지금 이 질문에 답하고, 올바른 경로를 알고 있다면, 바로 다음에 이렇게 말할 것이다."
  4. 그 후 학생은 교사의 말을 듣고, 단계별로 그 말에 맞춰보도록 강요받습니다.

학생은 단순히 "맞았다/틀렸다"는 말을 듣는 것이 아닙니다. 토큰 단위 (단어 단위) 로 어떻게 더 잘 생각해야 하는지 정확히 보여줍니다. "아, 알겠다! 내가 '대통령은 누구인가?'라고 물었을 때, 교사는 '1990 년의 대통령은 누구였는가?'라고 물었구나. 그게 차이점이야!"

이것이 특별한 이유는 무엇일까요?

  • 외부 교사 불필요: 보통 이런 수준의 세부 사항을 얻으려면 모든 단계를 채점하기 위해 초지능 AI(예: 720 억 파라미터 모델) 가 필요합니다. Search-E1 은 학생의 자신의 성공적인 시도들을 교사처럼 활용합니다. 마치 교수가 채점해 줄 때까지 기다리는 대신, A 를 받은 학생이 자신의 시험지를 스스로 공부하는 것과 같습니다.
  • 추가 장비 불필요: 다른 방법들은 어떤 단계가 좋았는지 파악하기 위해 복잡한 도구를 추가합니다. Search-E1 은 표준적인 "시도하고 다시 시도하기" 루프만 사용하며, 그 사이에 "자신의 성공을 공부하기" 단계를 추가할 뿐입니다.
  • 결과: 이 방법을 일곱 가지 다른 퀴즈 도전 과제에서 테스트했을 때, Search-E1 을 사용한 학생은 더 복잡한 방법을 사용한 다른 학생들보다 훨씬 높은 점수를 받았습니다. 특히 여러 개의 정보를 연결해야 하는 "멀티홉 (multi-hop)" 질문에서 탁월했는데, 이런 질문들은 실수할 수 있는 단계가 많기 때문이며, 이 방법은 깨진 구체적인 단계들을 바로잡아주기 때문입니다.

요약하자면: Search-E1 은 AI 가 실패하게 한 뒤, 마치 완벽한 교과서처럼 자신의 성공적인 시도들을 스스로 연구하게 함으로써 더 똑똑해지도록 가르칩니다. 외부의 도움 없이 매 순간 무엇을 말해야 할지 정확히 배우는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →