Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning
Search-E1 는 복잡한 외부 감독이나 보조 모듈에 의존하지 않고 QA 벤치마크에서 최첨단 성능을 달성하기 위해 순수한 GRPO 와 오프라인 자기 증류만을 사용하여 검색 증강 추론 에이전트를 향상시키는 자기 진화 방법입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하지만 약간 서툰 학생 (AI) 이 까다로운 퀴즈 문제를 풀려고 노력한다고 상상해 보세요. 이 학생은 정답을 찾기 위해 도서관 (검색 엔진) 을 활용해 사실을 찾아볼 수 있지만, 언제 찾아보고 무엇을 물어볼지 직접 결정해야 합니다.
대부분의 기존 방법은 이 학생이 에세이를 완전히 끝낼 때까지 기다린 뒤 가르칩니다. 최종 답이 맞으면 교사는 금색 별을 주고, 틀리면 빨간 X 를 찍습니다. 문제는 무엇일까요? 학생은 어떤 구체적인 단계에서 실수했는지 알지 못합니다. 잘못된 질문을 했을까요? 잘못된 단락을 읽었을까요? 산만해졌을까요? 그들은 그저 전체 시도가 실패했다는 사실만 알 뿐입니다.
Search-E1은 이 학생을 가르치는 새롭고 더 간단한 방법입니다. 이는 초지능 인간 교사나 화려한 추가 로봇, 특별한 보상 시스템이 필요하지 않습니다. 대신 **"자기 진화 (Self-Evolution)"**라는 기법을 두 단계의 춤으로 활용합니다.
1 단계: "모두 시도해 보기" 단계 (GRPO)
먼저 학생에게 같은 질문을 다섯 번 내립니다.
- 한 번의 시도에서는 도서관을 헤매며 터무니없는 질문을 하고 실패할 수 있습니다.
- 다른 시도에서는 완벽한 질문을 던져 올바른 책을 찾아내고 빠르게 정답을 얻을 수 있습니다.
시스템은 이 다섯 번의 시도를 살펴보고 "좋아, 정답을 맞춘 그 시도가 이번 라운드의 '금표준 (Gold Standard)'이다"라고 말합니다. 하지만 앞서 언급했듯, 이는 학생에게 "그 에세이 전체를 잘 썼네"라고만 알려줄 뿐, "그 특정 질문을 잘 던졌네"라고 알려주지는 않습니다.
2 단계: "되감고 배우기" 단계 (오프라인 자기 증류)
이제 마법이 일어납니다. 시스템은 실패한 시도 (학생) 와 성공한 시도 (교사) 를 가져옵니다.
여기에 영리한 트릭이 있습니다:
- 시스템은 학생에게 원래 질문을 줍니다.
- 시스템은 교사에게 같은 질문을 주지만, 동시에 치트 시트를 건네줍니다. 바로 다른 시도에서 학생이 취했던 전체 성공 경로입니다.
- 교사는 치트 시트를 읽고 말합니다. "내가 지금 이 질문에 답하고, 올바른 경로를 알고 있다면, 바로 다음에 이렇게 말할 것이다."
- 그 후 학생은 교사의 말을 듣고, 단계별로 그 말에 맞춰보도록 강요받습니다.
학생은 단순히 "맞았다/틀렸다"는 말을 듣는 것이 아닙니다. 토큰 단위 (단어 단위) 로 어떻게 더 잘 생각해야 하는지 정확히 보여줍니다. "아, 알겠다! 내가 '대통령은 누구인가?'라고 물었을 때, 교사는 '1990 년의 대통령은 누구였는가?'라고 물었구나. 그게 차이점이야!"
이것이 특별한 이유는 무엇일까요?
- 외부 교사 불필요: 보통 이런 수준의 세부 사항을 얻으려면 모든 단계를 채점하기 위해 초지능 AI(예: 720 억 파라미터 모델) 가 필요합니다. Search-E1 은 학생의 자신의 성공적인 시도들을 교사처럼 활용합니다. 마치 교수가 채점해 줄 때까지 기다리는 대신, A 를 받은 학생이 자신의 시험지를 스스로 공부하는 것과 같습니다.
- 추가 장비 불필요: 다른 방법들은 어떤 단계가 좋았는지 파악하기 위해 복잡한 도구를 추가합니다. Search-E1 은 표준적인 "시도하고 다시 시도하기" 루프만 사용하며, 그 사이에 "자신의 성공을 공부하기" 단계를 추가할 뿐입니다.
- 결과: 이 방법을 일곱 가지 다른 퀴즈 도전 과제에서 테스트했을 때, Search-E1 을 사용한 학생은 더 복잡한 방법을 사용한 다른 학생들보다 훨씬 높은 점수를 받았습니다. 특히 여러 개의 정보를 연결해야 하는 "멀티홉 (multi-hop)" 질문에서 탁월했는데, 이런 질문들은 실수할 수 있는 단계가 많기 때문이며, 이 방법은 깨진 구체적인 단계들을 바로잡아주기 때문입니다.
요약하자면: Search-E1 은 AI 가 실패하게 한 뒤, 마치 완벽한 교과서처럼 자신의 성공적인 시도들을 스스로 연구하게 함으로써 더 똑똑해지도록 가르칩니다. 외부의 도움 없이 매 순간 무엇을 말해야 할지 정확히 배우는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.