기술 요약: 실시간 광고 거래소에서의 경쟁 인지형 요청 디스패치 (Competition-Aware Request Dispatch)
1. 문제 정의
실시간 입찰(RTB) 광고 거래소는 현재 모든 적격 임프레션 요청을 수요 측 플랫폼(DSP)으로 전달하는 지배적인 업계 관행 하에 운영되고 있습니다. 그러나 실제 운영 환경에서는 전달된 요청 중 실제 비드(bid)로 이어지는 비율이 40% 미만입니다. 이러한 "과잉 배포(over-distribution)"는 다음과 같은 심각한 비효율성을 초래합니다:
- 리소스 낭비: DSP는 엄격한 컴퓨팅, 레이턴시 및 예산 제약을 받습니다. 가치가 낮은 트래픽을 과도하게 보내는 것은 DSP의 스로틀링(throttling)이나 선택적 참여를 유발하여, 결과적으로 이들의 유효 입찰 능력을 감소시킵니다.
- 경매 결과 저하: DSP가 과도한 저가치 트래픽으로 인해 참여를 제한할 경우, 한정된 입찰 용량의 할당이 최적화되지 못해 수익화된 결과가 낮아집니다.
- 기존 솔루션의 한계: 현재의 거래소 측 접근 방식(예: 응답률 필터링)은 경매에 대한 '가치'보다는 '응답 확률'을 최적화하는 데 치중합니다. DSP는 요청에 응답할 수는 있지만, 최종 경매 가격에 기여하는 경쟁적 가치는 거의 없을 수 있습니다.
핵심 과제는 단순히 트래픽 볼륨을 최대화하는 것이 아니라, **품질-양의 트레이드오프(quality–quantity trade-off)**를 최적화하는 것입니다. 즉, 어떤 요청을 어떤 DSP에 전달해야 경매 참여의 질과 수익을 극대화할 수 있는지를 결정하는 것입니다.
2. 방법론
저자들은 분포형 비드 모델링(distributional bid modeling), 확률적 포워딩(probabilistic forwarding), 그리고 적응형 임계값 최적화(adaptive threshold optimization)를 통합한 경쟁 인지형 요청 디스패치 프레임워크를 제안합니다. 이 시스템은 매일 200억 건 이상의 요청을 처리하면서도 엄격한 실시간 제약 조건(CPU 기준 <7ms 레이턴시) 내에서 작동합니다.
2.1 분포형 비드 모델링 (Distributional Bid Modeling)
시스템은 모든 요청-DSP 쌍에 대해 두 가지 신호를 추정하기 위해 프로덕션 모델인 Bias-LF-DCN(Deep & Cross Network with Late Fusion)을 사용합니다:
- 충족 확률 (pfill): DSP가 비드를 반환할 확률.
- 비드 가치 분포: 비드 발생 시의 조건부 비드 가치 분포로, 감마 분포(Γ(α,β))로 모델링됩니다.
아키텍처 효율성: CPU 비용을 줄이기 위해 모델은 후기 DSP 퓨전(late DSP fusion) 방식을 채택합니다. 공유 요청 특징(feature)을 한 번만 인코딩한 후, 이를 DSP별 특징과 결합하여 태스크별 타워(충족 예측 및 비드 분포)로 전달합니다. 이 아키텍처는 예측 품질(AUC ~0.96)을 유지하면서도 per-DSP 모델 대비 CPU 사용량을 약 30% 절감합니다.
2.2 경쟁 인지형 디스패치 로직 (Competition-Aware Dispatch Logic)
디스패치의 목적은 응답률을 최대화하는 것이 아니라, DSP가 경매에 높은 **기대 한계 기여도(expected marginal contribution)**를 가질 수 있는 요청을 전달하는 것입니다.
- 기회 가치 (vi): pfill×E[Bid Value]로 계산됩니다.
- 경쟁 임계값 (τ): 특정 임프레션에 대해 상위 K개의 기회 가치(보장된 수요 포함)를 기준으로 정의됩니다.
- 포워딩 확률 (pfwd): 다음을 기반으로 DSP i에 요청을 보낼지 여부를 결정하는 확률적 정책입니다:
- DSP의 비드가 경쟁 임계값을 초과할 확률.
- 저응답 트래픽을 억제하기 위한 부드러운 "충족 게이트(fill gate)".
- 카운터팩추얼 커버리지(counterfactual coverage)를 유지하고 선택 편향을 줄이기 위한 탐색 하한선(pmin).
2.3 적응형 임계값 최적화 (Adaptive Threshold Optimization, PPO)
정적인 임계값은 비정상적(non-stationary)인 시장 역학과 DSP 행동 간의 결합(예: 한 DSP의 임계값 변경이 다른 DSP의 경쟁 맥락을 변화시킴) 때문에 불충분합니다.
- 메커니즘: 시스템은 오프라인에서 per-DSP 디스패치 임계값(λp,λf)을 주기적으로 업데이트하기 위해 **PPO(Proximal Policy Optimization)**를 사용합니다.
- 상태 (st): 집계된 마켓플레이스 통계(충족률, 요청 볼품, 비드 분포, DSP RPM, 경매 결과).
- 액션 (at): 경쟁 임계값의 보수성 및 충족 필터링의 공격성 조정.
- 보상 (Rt): 경매 가치와 요청 효율성의 균형을 맞추기 위해 최고 비드와 DSP RPM의 가중 합으로 구성됩니다.
3. 주요 기여
- 정식화: 본 논문은 거래소 측의 요청 디스패치를 응답률 최대화에서 품질 최대화로 초점을 전환한 경쟁 인지형 최적화 문제로 정식화했습니다.
- 프로덕션 프레임워크: 분포형 비드 모델링, 확률적 디스패치, 그리고 PPO 기반의 적응형 임계값 최적화를 결합한 실용적인 시스템을 개발하였으며, 이는 일일 200억 건 이상의 요청을 처리하는 플랫폼에 배포되었습니다.
- 실증적 검증: 대규모 온라인 실험을 통해 선택적 디스패치가 DSP 트래픽 볼륨을 줄이는 동시에 수익화된 결과를 개선할 수 있음을 입증했습니다.
- 계층적 분석: 집계된 지표가 중요한 이질성을 가릴 수 있음을 보여주는 per-DSP 및 트래픽 세그먼트 분석을 제공하며, 이 정책이 DSP 간의 비교 우위를 드러낸다는 점을 밝혀냈습니다.
4. 실험 결과
프레임워크는 프로덕션 플랫폼에서 네 단계의 순차적 온라인 실험(E1–E4)을 통해 평가되었습니다.
4.1 단일 DSP 실험 (E1–E3)
Mid-RPM 트래픽 계층을 대상으로 한 이 실험들은 다음을 보여주었습니다:
- 트래픽 감소: DSP 요청 볼륨이 34%에서 71%까지 감소했습니다.
- 효율성 향상: 충족률(Fill rate)이 크게 증가했으며(최대 +293%), DSP RPM이 개선되었습니다.
- 수익: 성공적인 라운드에서 순수익이 15.1%에서 24.3%까지 증가했으며, 최고 비드 또한 모든 경우에서 상승했습니다.
4.2 멀티 DSP 배포 (E4)
상위 N개 DSP(전체 트래픽의 80% 이상 커버)에 걸친 20일간의 전체 배포(14일의 적응 윈도우 포함) 결과는 다음과 같습니다:
- 요청 볼륨: DSP 요청을 34.2% 감소시켰습니다.
- 수익: 순수익이 4.6% 증가했습니다(통계적으로 유의미함, p<0.001).
- 효율성: DSP 충족률은 41.8% 증가했고, DSP RPM은 59.0% 상승했습니다.
- 사용자 지표: 총 임프레션은 약간(-1.5%) 감소했음에도 불구하고 순 클릭(Net clicks)은 3.0% 증가하여, 정책이 고품질 임프레션을 유지했음을 나타냈습니다.
4.3 계층적 인사이트
- Low-RPM 트래픽: 요청의 96.4%를 차지하지만 임프레션 실현율이 4.9%로 낮습니다. 정책은 이 트래픽을 공격적으로 필터링하여 "Highest Bid"에는 부정적인 영향을 주었으나 수익은 보존했습니다.
- Mid-RPM 트래픽: 가장 큰 수익 상승(+10.5%)과 긍정적인 최고 비드 효과를 보였으며, 이는 디스패치가 가장 큰 가치를 창출하는 구간임을 확인시켜 줍니다.
- DSP 이질성: 서로 다른 DSP들은 "비교 우위"를 나타냈습니다. 일부는 요청 믹스를 정교화(더 적은 요청, 더 높은 비드)한 반면, 다른 곳은 비드 가격과 eCPC를 높였습니다. 정책은 각 DSP를 자신의 모델 및 예산과 일치하는 트래픽에 효과적으로 집중시켰습니다.
5. 의의 및 주장
본 논문은 현대 RTB 마켓플레이스에서 트래픽 큐레이션과 참여 품질이 요청 볼륨을 최대화하는 것보다 더 중요하다고 주장합니다.
- 패러다임 전환: 이 연구는 "더 많은 트래픽이 더 많은 수익을 가져온다"는 가설에 도전합니다. 대신, 저가치 트래픽을 줄이는 것이 DSP의 제약을 완화하여 더 나은 입찰 행동과 더 높은 경매 효율성을 이끌어낼 수 있음을 보여줍니다.
- 마켓플레이스 역학: 이 정책은 단순히 내부 가격을 높이는 것이 아니라, DSP 간의 비교 우위를 부각함으로써 경쟁 구도를 재편하고, 전체 수익화 체인 전반에 걸쳐 외부 경쟁력을 향상시킵니다.
- 한계점: 저자들은 PPO가 개별 경매가 아닌 집계된 통계에 기반하여 작동한다는 점, 오프라인 시뮬레이션이 DSP 행동을 부분적으로만 재현한다는 점, 그리고 결과가 단일 거래소 환경에서 도출되었다는 점 등 한계점을 명시했습니다. 향-후 연구는 DSP 간 경쟁 효과에 대한 더 강력한 인과적 식별에 집중해야 한다고 제언합니다.