OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework
이 논문은 복잡한 쿼리 이해, 잠재적 사용자 의도 파악, 그리고 개인 선호도 정렬을 위한 세 가지 핵심 혁신을 통해 기존 OneSearch 의 한계를 극복하고, 오프라인 및 온라인 평가에서 검색 성능과 비즈니스 지표를 크게 향상시키면서도 추가 지연 시간 없이 정보 버블과 롱테일 희소성 문제를 완화하는 'OneSearch-V2'라는 잠재 추론 강화 자기 증류 생성 검색 프레임워크를 제안합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
원서치-V2 (OneSearch-V2): 검색의 '직관'을 깨우는 마법
이 논문은 쿠키쇼 (Kuaishou) 라는 중국 앱에서 사용하는 쇼핑 검색 시스템을 어떻게 더 똑똑하게 만들었는지 설명합니다. 기존 시스템 (V1) 이도 좋았지만, 복잡한 질문에는 약하고 사용자의 진짜 의도를 파악하는 데 한계가 있었습니다. 이를 해결하기 위해 개발한 V2는 마치 검색 엔진에 **'생각하는 능력'과 '직관'**을 심어준 것과 같습니다.
세 가지 핵심 아이디어로 이루어진 이 혁신을 일상적인 비유로 설명해 드릴게요.
1. 복잡한 질문을 이해하는 '생각의 나침반' (Thought-Augmented Query Understanding)
상황:
사용자가 "여름에 입기 좋은 옷"이라고 검색했다고 칩시다. 기존 시스템은 단순히 '여름', '옷'이라는 단어만 보고 과거에 많이 팔린 옷을 보여줍니다. 하지만 사용자는 사실 "가볍고 시원한 반팔 티셔츠"를 원할 수도 있고, "해변가에서 입을 드레스"를 원할 수도 있습니다.
기존의 문제:
시스템이 "아, 여름이니까 반팔이겠지?"라고 단순히 추측만 할 뿐, 왜 그 옷을 원하는지 깊이 생각하지 못했습니다.
V2 의 해결책 (생각의 나침반):
V2 는 검색할 때 잠깐 '생각하는 과정 (CoT)'을 거칩니다.
- "사용자가 '여름'이라고 했으니, 계절을 고려해야 해."
- "옷을 원하니, 카테고리부터 정해야지."
- "이 사용자는 과거에 밝은 색상을 좋아했으니, 그걸도 고려해야겠어."
이런 생각의 과정을 통해 핵심 키워드 (예: 반팔, 밝은 색, 해변용) 를 뽑아냅니다. 중요한 건, 이 생각 과정은 실제 검색 결과를 보여줄 때는 사라진다는 점입니다. 마치 요리사가 레시피를 머릿속으로 완벽하게 구상하고, 최종적으로 요리만 손님에게 내어주는 것과 같습니다. 사용자는 복잡한 생각 과정을 보지 못하지만, 결과는 훨씬 더 정확해집니다.
2. 생각을 '직관'으로 바꾸는 '자기 훈련' (Reasoning-Internalized Self-Distillation)
상황:
위에서 설명한 '생각 과정'을 매번 실시간으로 수행하면 시간이 너무 오래 걸려서, 사용자가 기다리는 동안 검색 결과가 뜨지 않을 수 있습니다. (너무 느리다는 뜻입니다.)
기존의 문제:
생각을 하려면 시간이 걸리고, 생각하지 않으면 결과가 부정확합니다.
V2 의 해결책 (자기 훈련/자기 증류):
V2 는 **스스로를 가르치는 '자기 훈련'**을 합니다.
- 선생님 (Teacher): 생각 과정 (키워드) 을 보고 정답을 맞히는 모델.
- 학생 (Student): 생각 과정 없이, 오직 질문만 보고 정답을 맞히는 모델.
선생님이 학생에게 "이 질문에는 이런 키워드가 중요해"라고 가르칩니다. 학생은 이 가르침을 받아들이고, 생각 과정 없이도 선생님이 생각한 것처럼 정답을 맞출 수 있도록 뇌 (모델 가중치) 를 훈련시킵니다.
비유:
마치 숙제를 할 때 처음에는 선생님이 풀이 과정을 보여주고 (생각 과정), 그다음에는 학생이 그 풀이 과정을 머릿속에 완전히 새겨서 나중에 혼자서도 빠르게 문제를 푸는 것과 같습니다. 결국 생각 과정 (지식) 을 머릿속에 저장해 두었기 때문에, 실제 검색할 때는 생각할 필요 없이 직관적으로 정확한 결과를 바로 뿜어낼 수 있게 됩니다.
3. 사용자의 진짜 마음을 읽는 '피드백 시스템' (Behavior Feedback Preference Alignment)
상황:
기존 시스템은 "누가 무엇을 클릭했는지"라는 과거 기록 (로그) 만 보고 학습했습니다. 하지만 과거 기록만 믿으면, "인기 없는 신상품"이나 "특이한 취향"을 가진 사용자를 놓치기 쉽습니다. 또, 시스템이 "클릭만 많이 하면 되는 거야?"라고 생각해서, 실제로는 안 사지만 클릭만 하는 상품만 띄우는 '보상 사기 (Reward Hacking)'가 생길 수도 있습니다.
기존의 문제:
과거 데이터에 너무 의존해서 새로운 트렌드를 놓치고, 사용자의 진짜 만족도 (구매, 장바구니 담기) 보다는 클릭 수만 쫓습니다.
V2 의 해결책 (직접 피드백):
V2 는 별도의 '평가자 (Reward Model)'를 두지 않고, 사용자의 실제 행동 (클릭, 장바구니, 구매) 을 직접 점수로 매겨 학습시킵니다.
- 단순히 클릭만 한 것보다 구매를 한 것이 훨씬 높은 점수입니다.
- 검색어와 상품이 얼마나 잘 맞는지도 함께 고려합니다.
비유:
기존 시스템이 "이 식당은 과거에 방문객이 많았으니 좋은 식당이야"라고 판단했다면, V2 는 "방문객이 음식을 맛있게 먹고 돈을 내고 갔다"는 사실을 보고 "이 식당이 진짜 좋은 식당이구나"라고 판단합니다. 또한, **새로 생긴 식당 (신상품)**이나 **작은 식당 (롱테일 상품)**도 기회를 주어, 검색 결과가 더 다양하고 신선해집니다.
🌟 V2 가 가져온 변화 (결과)
이 시스템을 실제 쿠키쇼 쇼핑몰에 적용한 결과 놀라운 변화가 일어났습니다.
- 더 많은 클릭과 구매: 사용자가 원하는 상품을 더 잘 찾아주니, 클릭률과 구매율이 크게 늘었습니다. (구매 전환율 약 3% 증가)
- 복잡한 질문에도 강함: "여름에 입기 좋은 옷"처럼 모호한 질문을 해도, 사용자의 취향을 파악해 더 정확한 옷을 보여줍니다.
- 새로운 상품 발굴: 인기 있는 상품만 보여주는 '정보의 방' (Bubble) 을 깨고, 잘 알려지지 않은 좋은 신상품들도 찾아줍니다.
- 속도 유지: 생각 과정을 머릿속에 저장했기 때문에, 결과가 더 똑똑해졌지만 속도는 그대로입니다.
요약
OneSearch-V2는 검색 엔진에게 **"생각하는 법 (CoT)"**을 가르치고, 그 생각을 **"직관 (Self-distillation)"**으로 바꾸며, **사용자의 진짜 행동 (Feedback)**을 통해 스스로를 계속 발전시키는 시스템입니다. 덕분에 사용자는 더 빠르고, 더 정확하며, 더 다양한 쇼핑 경험을 즐길 수 있게 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.