STAMP: Provenance-Guided Credit Assignment for Deep Search Agents
STAMP는 지원 문서를 이를 노출한 행동까지 추적하는 출처 가이드형 신용 할당 메커니즘을 도입하고, 부호 보존 변조를 통해 이점을 재분배함으로써 딥 서치 에이전트의 보상-신용 불일치 문제를 해결하며, 이를 통해 여러 벤치마크에서 GRPO 베이스라인 대비 성능을 유의미하게 향상시킨다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 인터넷상의 까다로운 미스터리를 해결하는 아주 똑똑한 디지털 탐정인 '딥 서치 에이전트(deep-search agent)'를 훈련시킨다고 상상해 보세요. 이 탐정은 단순히 추측만 하는 것이 아니라, 단서를 찾고, 웹페이지를 읽고, 증거를 모아 질문에 답을 찾아냅니다. 오랫동안 우리는 이 탐정들을 가르치는 방식을 마치 영화 전체를 오직 마지막 장면만 보고 평가하는 것과 같이 다뤄왔습니다. 만약 탐정이 마지막에 정답을 맞혔다면, 영화 전체에 금메달을 주었습니다. 반대로 틀렸다면, 영화 전체에 빨간색 'F' 학점을 주었습니다.
하지만 여기에는 문제가 있습니다. 탐정이 영화 중간에 아주 훌륭한 단서를 발견했음에도 불구하고, 나중에 혼란에 빠져 결국 최종 정답을 틀릴 수도 있기 때문입니다. 반대로, 실제 증거를 전혀 찾지 못한 채 운 좋게 정답을 맞히는 경우도 있습니다. 기존 방식은 이 둘을 구분할 수 없었습니다. 그것은 탐정이 한 모든 행동, 심지어 아무런 도움이 되지 않은 지루한 행동들에 대해서도 동일한 보상(또는 비난)을 주었습니다. 저자들은 이를 "보상-크레딧 불일치(reward-credit mismatch)"라고 부릅니다. 이는 학생이 중간에 세 개의 완벽한 연구 단락을 썼더라도 결론이 틀렸다는 이유만으로 에세이 전체에 낙제 점수를 주는 것과 같습니다.
핵심 아이디어: STAMP
연구진은 STAMP(Step-level Trace-guided Advantage Modulation with Provenance)라고 불리는 새로운 훈련 방법을 제안합니다. STAMP를 탐정의 영화를 프레임 단위로 관찰하는 매우 세밀한 영화 평론가라고 생각해보세요.
단순히 최종 답변만 보는 대신, STAMP는 두 가지 구체적인 질문을 던집니다:
- 탐정이 실제로 올바른 증거를 찾았는가? (그들이 찾고자 했던 특정 인물이나 사실을 찾아냈는가?)
- 어떤 구체적인 움직임이 그 증거를 처음으로 드러냈는가? (검색어를 입력했을 때인가, 아니면 링크를 클릭했을 때인가?)
STAMP는 "참조 기반 검증기(reference-based verifier)"를 사용합니다. 이는 기본적으로 탐정이 찾은 문서들을 살펴보고 "이 문서가 우리가 필요한 사실을 실제로 증명하는가?"라고 묻는 똑똑한 검사 역할을 합니다. 만약 그렇다면, STAMP는 그 문서를 탐정이 처음으로 접하게 된 정확한 순간까지 거슬러 올라갑니다. 그리고 그 특정 순간에 "크레딧 부스트(credit boost)"를 부여합니다.
영화를 망치지 않고 작동하는 방법
여기서 영리한 부분은, STAMP가 영화의 최종 성적을 바꾸지는 않는다는 점입니다. 만약 탐정이 여전히 최종 정답을 맞히지 못했다면, 그 영화는 여전히 실패작입니다. 하지만 STAMP는 훈련을 조정하기 위해 "부호 보존형 어드밴티지 변조(sign-preserving advantage modulation)"를 사용합니다.
탐정이 롤러코스터를 타고 있다고 상상해 보세요. 만약 탑승이 성공적이었다면(양의 어드밴티지), STAMP는 좋은 단서를 찾았던 특정 순간들에 약간의 추가 부스트를 주어 그 행동들이 더욱 보람 있게 느껴지도록 만듭니다. 만약 탑승이 사고로 이어졌다면(음의 어드밴티지), STAMP는 좋은 행동들을 가혹하게 처벌하지 않습니다. "알았어, 미션은 실패했지만, 네가 했던 그 검색 쿼리는 정말 훌륭했어. 그러니 그 교훈을 지우지는 말자"라고 말하는 것입니다. 이는 탐정이 최종 결과와 상관없이 어떤 검색 동작이 유효한지를 정확하게 배울 수 있도록 보장하며, 학습 내용이 결과와 혼동되지 않도록 합니다 именно 합니다.
이 논문이 '아닌 것'이라고 명시한 부분
저자들은 이 방법이 무엇이 아닌지를 매우 명확히 밝히고 있습니다. 그들은 검색의 매 단계마다 복잡한 새로운 보상 시스템을 발명해야 한다는 주장에 반대합니다. 또한 증거 없이 어떤 움직임이 좋았는지 추측해야 한다는 생각도 일축합니다. STAMP는 증명된 증거에 의존합니다. 즉, 문서가 없거나 검증기가 해당 사실을 뒷받침하지 않는다고 판단하면 크레딧을 주지 않습니다. 그들은 단순히 단계별로 무작위 보너스를 더하는 것은 효과가 없다고 명시했는데, 왜냐하면 기존 시스템은 결국 그것들을 평균화해버리기 때문입니다.
결과: 효과가 있는가?
연구팀은 세 가지 챌린지 세트인 BrowseComp, BrowseComp-ZH(중국어 버전), xbench-DS에서 STAMP를 테스트했습니다. 그들은 동일한 시작 모델, 동일한 훈련 데이터, 동일한 검색 도구를 사용하여 표준 훈련 방식인 GRPO와 비교했습니다.
결과는 STAMP가 탐정의 성능을 일관되게 향상시켰음을 보여주었습니다:
- BrowseComp에서 정확도가 +2.0 포인트 상승했습니다.
- BrowseComp-ZH에서는 +5.5 포인트 급증했습니다.
- xbench-DS에서는 +3.0 포인트 개선되었습니다.
논문은 이러한 이득이 STAMP가 "숨겨진 보석(hidden gems)"을 잡아내기 때문에 발생한다고 설명합니다. 즉, 실패한 시도 중에서도 유용한 증거를 찾아낸 단계들을 포착해낸 것입니다. 기존 방식은 이를 무시했습니다. 실제로, 정답을 맞힌 시도 중 **83.5%**의 단계는 유용한 증거를 전혀 생산하지 못했던 반면, 오답 시도 중에서도 **7.0%**의 단계는 유용한 단서를 찾아냈습니다. STAMP는 최종 결과와 상관없이 유용한 단계를 보상함으로써 이 문제를 해결합니다.
얼마나 확실한가?
저자들은 훈련 방법 외에는 모든 것이 동일한 통제된 실험을 수행했기 때문에 이 수치들에 확신을 가지고 있습니다. 또한 "절제 연구(ablation studies)"(기계를 분해하여 각 부품이 어떤 역할을 하는지 확인하는 과정)를 실시하여, 검증기, 최초 노출 추적, 특수 변조 등 STAMP의 모든 부분이 성공에 기여했음을 확인했습니다.
하지만 저자들은 한계점도 언급했습니다. 이들은 이 테스트를 오직 하나의 모델 크기(Qwen3-30B)에서만 진행했습니다. 그들은 이 방법이 잘 작동한다는 것을 보여주었지만, 훨씬 더 큰 모델(예: 70B 이상)에서도 똑같이 잘 작동할지는 아직 입증되지 않았다고 제안합니다. 따라서 수행된 테스트에 대한 결과는 견고하지만, 더 큰 뇌를 가진 모델들을 위한 잠재력은 여전히 열려 있는 과제입니다.
요약하자면, STAMP는 결과뿐만 아니라 과정의 가치를 인정하도록 AI 탐정을 가르치며, 진실을 밝혀낸 구체적인 움직임에 크레딧을 부여합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.