← 최신 논문
💬 NLP

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search는 외부 교사나 추가 주석이 필요 없이 결과 보상 강화 학습의 신용 할당 한계를 극복하도록 하여, 학생 모델을 hindsight 조건부 교사를 모방하도록 훈련시킴으로써 검색 증강 추론 에이전트가 내부적으로 단계별 감독 신호를 생성할 수 있게 하는 온-정책 hindsight 자기 증류 프레임워크를 도입합니다.

원저자: Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 미스터리를 푸는 법을 학생에게 가르친다고 상상해 보세요. 학생은 검색할 수 있는 도서관(인터넷)을 가지고 있지만, 사서에게 무엇을 물어봐야 할지 모릅니다.

현재 AI 연구 상태에서는 대부분의 훈련 방법이 최종 답변만을 평가하는 교사와 같습니다.

  • 문제: 학생이 정답을 맞히면 교사는 "잘했어!"라고 말합니다. 하지만 학생이 나쁜 질문을 던졌을 때 운 좋게 정답을 맞혔다면, 교사는 여전히 "잘했어!"라고 말합니다. 학생은 자신의 특정 질문이 실제로는 끔찍했다는 것을 결코 배우지 못합니다. 그들은 단지 결과가 좋았다는 것만 알 뿐입니다. 이를 '결과 보상 (Outcome Reward)'이라고 합니다.
  • 옛날 해결책: 일부 연구자들은 이 문제를 해결하기 위해 학생을 지켜보며 "그건 좋은 질문이야" 또는 "그건 나쁜 질문이야"라고 말해 줄 수 있는 초지능적이고 비싼 '마스터 탐정 (거대한 외부 AI)'을 고용하려고 시도했습니다. 이는 작동하지만, 모든 단일 훈련 세션마다 그 거대한 마스터 탐정이 필요하기 때문에 비용이 엄청나게 많이 들고 매우 느립니다.

SD-Search는 비싼 마스터 탐정 없이 학생을 가르치는 새롭고 영리한 방법입니다. 간단한 비유를 통해 작동 원리를 살펴보겠습니다.

'시간 여행' 교실

학생이 시험을 치르고 있다고 상상해 보세요.

  1. 학생 ('현재'의 자아): 학생은 책상에 앉아 문제를 보고 있습니다. 그들은 지금 당장 무엇을 검색해야 할지 결정해야 하지만, 맞히거나 틀릴지 전혀 알 수 없습니다. 그들은 그 순간 알고 있는 것을 바탕으로 추측합니다.
  2. 교사 ('미래'의 자아): 이제 같은 학생을 상상해 보되, 이번에는 마법의 시간 여행 일기장을 가지고 있다고 가정해 보세요. 이 일기장에는 동일한 문제에 대한 여러 시도의 결과가 담겨 있습니다. "시도 A 에서는 '아버지는 누구인가?'라고 물어보고 정답을 맞혔다. 시도 B 에서는 '하늘의 색깔은 무엇인가?'라고 물어보고 틀렸다"라고 적혀 있습니다.

SD-Search는 이 마법 일기장을 사용하여 학생의 '교사' 버전을 만듭니다.

  • 교사는 문제를 보며 일기장을 읽습니다. 교사는 어떤 질문이 성공으로 이어졌고 어떤 질문이 실패로 이어졌는지 알기 때문에, "아, 아버지에 대해 물어본 것이 올바른 선택이었구나. 나도 그걸 물었을 거야"라고 말할 수 있습니다.
  • 아직 일기장을 가지고 있지 않은 학생은 교사의 선택을 복사하라는 지시를 받습니다. 목표는 학생의 추측을 교사의 '사후 지혜'와 일치시키는 것입니다.

실제 작동 방식

이 논문은 이를 **'온-폴리시 사후 자기 증류 (On-Policy Hindsight Self-Distillation)'**라고 부릅니다. 이를 분해해 보겠습니다:

  • 자기 증류 (Self-Distillation): AI 가 스스로를 가르칩니다. 외부 전문가가 필요하지 않습니다. AI 는 많은 시도 (롤아웃) 를 생성하고 결과를 본 후, '성공적인' 패턴을 사용하여 자신의 '학생' 버전을 가르칩니다.
  • 사후 (Hindsight): 결정이 내려진 에 무슨 일이 일어났는지 되돌아보아 그 결정이 좋았는지 판단합니다.
  • 온-폴리시 (On-Policy): 다른 더 큰 AI 의 데이터가 아닌, 자신의 현재 데이터를 사용하여 이를 수행합니다.

'검색어'에 초점

이 논문은 특히 검색어(AI 가 검색 엔진에 묻는 질문) 에 초점을 맞춥니다.

  • 구식 방법에서는 최종 답변이 맞았다면, 검색 질문이 모호하거나 잘못되었더라도 AI 가 작성한 모든 단어 (검색 질문 포함) 에 '잘했어' 스티커가 붙었습니다.
  • SD-Search 에서는 AI 가 각 특정 검색 질문에 대해 구체적인 '잘했어' 또는 '나빴어' 신호를 받습니다. 검색 질문이 막다른 길로 이어졌다면, 마법 일기장을 가진 교사는 학생에게 다른 더 나은 질문을 보여줍니다. 학생은 더 나은 질문을 모방하는 법을 배웁니다.

결과 (점수판)

연구자들은 이 방법을 일곱 가지 다른 질문 - 답변 벤치마크 (예: 상식 퀴즈) 에서 테스트했습니다.

  • 성능: 그들의 방법 (SD-Search) 은 거대한 720 억 파라미터 '마스터 탐정' AI 를 사용하는 비싼 방법만큼 잘 수행되었으며, 단순히 최종 답변만 보는 방법보다는 더 좋았습니다.
  • 효율성: 그들은 외부 도움이나 비싼 API, 추가 훈련 단계를 전혀 필요로 하지 않았습니다. 그들은 표준 훈련 루프를 사용하면서, AI 가 자신의 과거 시도를 검토하는 작은 '시간 여행' 단계만 추가했습니다.
  • 확장성: AI 모델이 커질수록 (30 억에서 70 억 파라미터로), 이 자기 가르치기 방법은 계속 향상되었지만, '마스터 탐정'에 의존하는 방법들은 그 우위를 잃기 시작했습니다.

요약하자면

SD-Search 는 시험을 치른 후 정답지와 동시에 시험을 본 친구들의 노트를 볼 수 있는 학생과 같습니다. 그런 다음 그들은 다시 시험을 치르면서, '성공적인' 자신들이 던졌던 정확한 질문들을 물어보려고 노력합니다. 그들은 자신의 과거 실수와 성공에서 배우며, 인간 교사나 무엇을 해야 하는지 알려줄 슈퍼컴퓨터가 필요 없이 더 똑똑해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →