기술 요약: 웹 규모 검색을 위한 시각-언어 모델 기반의 관련성 측정 고도화
문제 정의
Pinterest와 같은 개인화된 검색 시스템에서 검색 결과가 사용자의 의도(의미론적 관련성)와 일치하도록 보장하는 것은 매우 중요합니다. 클릭, 저장과 같은 사용자 참여 지표는 쉽게 수집할 수 있지만, 위치 편향(position bias), 제시 효과(presentation effects), 주의력(attention) 등의 혼란 변수로 인해 실제 의미론적 관련성을 반영하지 못하는 경우가 많습니다. 결과적으로, 관련성 평가는 참여도는 증가하면서 관련성은 저하되는 트레이드오프를 감지하기 위한 온라인 A/B 실험의 필수적인 "가드레일" 역할을 합니다.
전통적으로 관련성 평가는 인간의 주석(human annotation)에 의존합니다. 그러나 이 방식은 높은 비용, 긴 소요 시간, 제한된 확장성이라는 제약을 가집니다. 이러한 병목 현상은 작은 샘플 크기를 가진 측정 설계로 이어지며, 이는 큰 규모의 지표 변화만을 감지할 수 있을 뿐, 이질적인 처치 효과(heterogeneous treatment effects)나 작지만 의미 있는 개선을 포착하는 데 실패합니다. 본 논문은 웹 규모에서 운영 가능한 확장 가능하고 비용 효율적이며 신뢰할 수 있는 자동화된 관련성 평가 시스템의 필요성을 다룹니다.
방법론
1. 미세 조정된 시각-언어 모델 (VLMs)
저자들은 자동화된 관련성 레이블링을 위해 미세 조정된 오픈 소스 시각-언어 모델(특히 Qwen3-VL 시리즈)을 활용하는 엔드 투 엔드 파이프라인을 제안합니다.
- 입력 표현: 모델은 검색 쿼리 텍스트, Pin 이미지, 그리고 포괄적인 텍스트 메타데이터(Pin 제목/설명, 랜딩 페이지 제목/설명, 보드 제목, 과거에 높은 참여를 기록한 쿼리)로 구성된 멀티모달 입력을 처리합니다.
- 학습: 모델은 약 80만 개의 인간 주석이 달린 쿼리-Pin 쌍을 사용하여 5단계 평점 척도(매우 관련 있음 ~ 매우 관련 없음)로 미세 조정됩니다. 목표는 교차 엔트로피 손실(cross-entropy loss)을 최소화하여 관련성 점수(1~5)를 예측하는 것입니다.
- 추론: 모델은 출력 로짓(logits)에 대한 argmax를 통해 예측된 관련성 수준을 출력합니다. 시스템은 Qwen3-VL의 교차 언어 능력을 활용하여 다양한 언어를 지원합니다.
2. 층화 추출 설계 (Stratified Sampling Design)
VLM이 제공하는 레이블링 비용 및 시간의 절감은 단순 무작위 추출에서 더 정교한 층화 쿼리 추출 설계로의 전환을 가능하게 합니다.
- 근거: 관련성 분산은 주로 쿼리 간의 차이(의도, 콘텐츠 품질, 인벤토리 깊이)에 의해 발생합니다. 층화 추출은 이러한 분산 구조를 타겟팅합니다.
- 구현: 쿼리는 관심 카테고리와 인기 세그먼트(Head, Torso, Tail, Single)를 기준으로 층화됩니다.
- 통계적 이점: 층간(between-strata) 분산 성분을 제거함으로써 층화 추출은 표본 평균의 분산을 크게 감소시킵니다. 이는 직접적으로 최소 탐지 가능 효과(MDE)를 낮추어, 시스템이 검색 랭킹 성능의 작고 의미 있는 변화를 감지할 수 있도록 합니다.
- 비교: 저자들은 CUPED와 같은 대안적인 분산 감소 기법은 Pinterest 인벤토리의 동적인 특성과 사전 처치 공변량(pre-treatment covariates) 요구 사항 때문에 적합하지 않으며, 이는 일반화 가능성을 해치거나 이중 주석 비용을 발생시킬 수 있다고 언급했습니다.
3. 관련성 측정 파이프라인
A/B 실험을 위한 평가 파이프라인은 다음과 같습니다:
- 샘플링: 쿼리 간의 차이를 차단하기 위해 제어 그룹과 처치 그룹에서 쌍을 이룬 검색 쿼리를 선택합니다.
- 레이블링: 미세 조정된 VLM이 각 쿼리에 대한 상위 K개(25로 설정)의 검색 결과에 대해 관련성 레이블을 생성합니다.
- 지표 계산: 시스템은 쿼리 수준의 $sDCG@K(매우관련있는문서가무한히공급된다고가정하는nDCG@K$의 변형)를 계산하고, 이를 집계하여 실험 수준의 지표를 도출합니다.
- 분석: 이질적 처치 효과는 층(strata)별로 분석되며, Benjamini-Hochberg 절차를 통해 허위 발견율(false discovery rate)을 제어합니다.
주요 결과
인간의 판단과의 일치도 (RQ1)
시스템은 인간의 주석과 엄격하게 검증되었습니다:
- 정확도: VLM과 인간 레이블 간의 정확한 일치율은 **82.9%**이며, **94.2%**의 평점이 1점 이내의 차이를 보였습니다.
- 일치도: Quadratic Weighted Kappa(QWK)는 0.507로, 양호한 서수적 일치(ordinal agreement)를 나타냈습니다.
- 순위 상관관계: Kendall's τ는 0.534, Spearman's ρ는 0.668로, 강력한 순위 정렬을 보여주었습니다.
- 오차 지표: 모든 인기 세그먼트에서 쿼리 수준 $sDCG@K$의 평균 오차는 0.03 이내를 유지했습니다. 결정적으로, (A/B 테스트에 사용되는) 쌍 차이 오차(paired difference error)의 크기가 무시할 수 있는 수준이어서, 단일 그룹 오차에서 관찰된 미세한 양의 편향을 제거했습니다. 이는 쌍을 이룬 실험 설계가 VLM 레이블 편향에 대해 견고함을 확인시켜 줍니다.
- 모델 선택: Qwen3-VL-8B가 4B 변체와 유사한 성능을 보였으나, 타이트한 오차 분포와 낮은 계산 비용 덕분에 Qwen3-VL-4B가 프로덕션용으로 선택되었습니다. 이 모델은 텍스트 전용인 XLM-RoBERTa 베이스라인보다 특히 분산 감소 측면에서 우수한 성능을 보였습니다.
지표 민감도 및 효율성 (RQ2)
VLM 기반 레이블링과 층화 추출로의 전환은 실험 민감도 측면에서 상당한 개선을 가져왔습니다:
- MDE 감소: 최소 탐지 가능 효과(MDE)가 1.3%~1.5% 범위에서 **≤0.25%**로 감소하여, 민감도가 6배 개선되었습니다.
- 분산 감소: 층화 추출만으로도 동일한 샘플 크기(n=2000)에서 단순 무작위 추출 대비 지표 분산(σ^)을 52% 감소시켰습니다. 층화 추출과 샘플 크대 증가(n=5000)를 결합했을 때, 총 분산 감소율은 **67%**에 달했습니다.
- 운영 효율성:
- 소요 시간: 20배 이상 개선되었습니다 (2일에서 2시간으로).
- 비용: 레이블당 비용이 99.98% 감소했습니다 (0.10에서2 × 10−5로).
- 규모: 시스템은 이전보다 4배 더 많은 관련성 측정 작업을 처리할 수 있게 되어, 더 광범하고 빈번한 평가가 가능해졌습니다.
다국어 성능 (RQ3)
시스템은 비영어권 시장(프랑스, 독일, 브라질)에서도 검증되었습니다. 순위 상관관계는 영어 시장보다 약간 낮았으나, 여전히 중간 이상의 강도를 유지했습니다. 쌍 차이 오차는 0 근처에 밀집되어 있어, 훈련 데이터가 주로 영어임에도 불구하고 이 접근 방식이 비영어 쿼리에 대해서도 효과적으로 일반화됨을 나타냈습니다.
의의 및 기여
본 논문은 핵심적인 의의가 산업 규모의 라이브 A/B 실험 시스템인 Pinterest 내에 VLM 기반의 관련성 평가 파이프라인를 엔드 투 엔드로 설계하고 배포했다는 점에 있다고 주장합니다. 모델 아키텍처나 프롬프팅 전략에 집중하는 기존의 학술적 연구와 달리, 본 연구는 미세 조정된 VLM을 실제 프로덕션 환경에서 인간의 주석을 대체하는 것이 실질적으로 가능하다는 것을 입증했습니다.
주요 기여는 다음과 같습니다:
- 프로덕션 배포: 미세 조정을 포함하여 온라인 A/B 테스트까지 아우르는 검증된 파이프라인을 구축하였으며, 저자들은 이것이 산업 규모의 검색 시스템에서 이 문제를 종합적으로 다룬 첫 번째 사례라고 밝히고 있습니다.
- 실험 민감도: VLM 기반 평가가 확장된 쿼리 세트와 정교한 샘플링 설계를 가능하게 하여, 6배의 MDE 감소와 관련성 변화 탐지 능력의 획기적인 향상을 이끌어냄을 입в증했습니다.
- 신뢰성: 미세 조정된 VLM이 인간의 판단과 밀접하게 일치하며, 쌍 차이 오차가 매우 낮아 고도의 의사결정이 필요한 상황에서 인간의 레이블링을 신뢰할 수 있는 대체제로 사용할 수 있음을 증명했습니다.
저자들은 이 접근 방식이 관련성 측정의 효율성과 민감도를 높이고자 하는 산업계 실무자들에게 실질적인 통찰을 제공한다고 결론지으며, 향-후 연구로서 더 넓은 멀티모달 검색 환경으로 역량을 확장하고 비영어권 시장에서의 성능 격차를 더욱 좁히는 데 집중할 것이라고 밝혔습니다.