← 최신 논문
📊 statistics

Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments

이 논문은 단일한 지속적 갱신형 글로벌 캘리브레이션(global calibration)을 구현함으로써 동일한 예산 내에서 기존의 실험별 LLM 레이블링 방식보다 20배 이상의 실험 암(arm)에 대해 일일 고충실도 추적을 가능하게 하여, 수백 개의 동시 진행 중인 A/B 테스트 전반에 걸쳐 LLM 기반 콘텐츠 유병률 측정을 확장하는 핀터레스트의 실험 플랫폼을 위한 비용 효율적인 시스템 레벨 솔루션을 제시한다.

원저자: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

게시일 2026-07-30
📖 6 분 읽기🧠 심층 분석

원저자: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매일 수백만 명의 사람들이 거리를 지나다니는 거대하고 북적이는 도시를 운영하고 있다고 상상해 보십시오. 이 도시에는 수천 개의 다양한 상점, 공원, 그리고 광고판이 있습니다. 도시 계획가들은 사람들이 특정 유형의 것들—예를 들어 "원예 도구"나 "AI 생성 예술"—을 얼마나 많은 시간을 들여 보고 있는지 정확히 알고 싶어 합니다. 이것이 바로 **유병률 측정(prevalence measurement)**의 세계입니다. 즉, 전체 "노출(impressions, 또는 시선)" 중 특정 카테고리가 차지하는 비율이 얼마인지를 파악하는 것입니다.

도시의 의사결정을 내리기 위해, 계획가들은 종 often **A/B 실험(A/B experiments)**을 실행합니다. 이것은 마치 두 가지 다른 버전의 거리 표지판을 테스트하는 것과 같습니다. 한쪽은 사람들의 절반에게 보여주고, 다른 쪽은 나머지 절반에게 보여주어, 어떤 표지판이 사람들을 더 즐겁게 하거나 몰입하게 만드는지 확인하는 것입니다. 보통 어떤 결과를 측정하려면 숫자를 세어야 합니다. 하지만 여기 문제가 있습니다. 때때로 당신이 측정하고자 하는 대상은 측정하기 매우 어렵습니다. 모든 사람에게 무엇을 보았는지 일일이 물어볼 수는 없습니다. 그것은 너무 오래 걸리고 비용이 엄청나게 들기 때문입니다. 디지털 세상에서 이 "측정하기 어려운" 작업은 종종 대규모 언어 모델(LLM)—사진이나 게시물을 읽고 "네, 이것은 원예에 관한 것입니다" 또는 "아니요, 이것은 아닙니다"라고 말할 수 있는 초지능형 AI 컴퓨터—에 의해 수행됩니다. 이 AI 판사들은 매우 정확하지만, 매일 수십억 명의 방문자가 있는 도시의 모든 항목을 하나하나 검사하도록 요청하는 것은 모든 실험마다 수행하기에는 너무 비싸고 느립니다.

여기서 Pinterest의 Zehao Xu와 그의 팀이 작성한 논문이 등장합니다. 그들은 매일 수백 개의 실험을 실행하고 있었고, 각 실험 그룹별로 특정 콘텐츠 유형(예: AI 관련 콘텐츠나 안전 문제)의 유병률을 알아내야 했습니다. 그들은 모든 실험을 위해 AI에게 모든 항목을 레이블링하도록 비용을 지불할 여유가 없었습니다. 그래서 그들은 영리한 시스템을 구축했는데, 이것은 마치 "글로벌 번역기"처럼 작동합니다. 새로운 실험마다 비싼 AI에게 모든 항목을 확인하도록 요청하는 대신, 그들은 AI에게 매일 도시 전체의 대표 샘플을 확인하도록 요청합니다. 그 샘ло은 전체를 측정하는 데 사용되는 저렴하고 빠른 모델을 가르치는 데 사용됩니다. 그런 다음, 그들은 이 빠른 모델을 사용하여 나머지 모든 것을 즉시 측정합니다. 그 결과, 그들은 단 하나의 비싼 체크로는 놓칠 수 있는 미세한 변화까지도 잡아내면서, 추가적인 AI 레이블 비용 없이도 매일 수백 개의 실험에 대한 콘텐츠 노출 변화를 추적할 수 있게 되었습니다.

문제점: "골드 스탠다드(Gold Standard)"는 너무 비싸다

온라인 미디어의 세계에서 Pinterest와 같은 기업들은 사용자의 참여를 유지하는 동시에, 사용자들이 특정 유형의 콘텐츠(예: 안전하지 않은 이미지나 저품질 스팸)를 너무 많이 보지 않도록 균형을 맞춰야 합니다. 이를 위해 그들은 A/B 테스트를 실행합니다. 이 테스트에서 그들은 알고리즘을 미세하게 조정하여 특정 유형의 콘텐츠를 사용자가 얼마나 보게 되는지 확인합니다.

이를 측정하기 위한 "골드 스탠다드"는 AI(LLM)를 사용하여 콘텐츠 샘플을 살펴보고 완벽하게 레이블을 붙이는 것입니다. 이것은 마치 갤러리에 있는 모든 그림을 조사하여 풍경화가 몇 점인지 세는 전문 미술 비평가 팀을 고용하는 것과 같습니다. 정확하긴 하지만, 느리고 비용이 엄청나게 많이 듭니다. 만약 동시에 수백 개의 실험이 진행 중이고, 모든 실험의 모든 그룹에 대해 콘텐츠를 확인해야 한다면, 그 비용은 천문학적일 것입니다. 매일 모든 것을 확인하기 위해 "전문가"를 고용할 여유는 현실적으로 없습니다.

게다가, 기업들이 관심을 갖는 변화는 종종 매우 미세합니다. 만약 새로운 알고리즘이 사용자가 보는 "AI 생성 예술"의 양을 단 2% 또는 5% 줄였다면, 단 한 번의 비싼 체크 방식은 그 변화가 실제인지 아니면 단순히 무작위적인 노이즈인지 구별할 만큼 정밀하지 못할 수 있습니다. 이는 마치 하나의 비싼 마이크로 시끄러운 방 안의 속삭임을 들으려고 노력하는 것과 같습니다. 당신은 그것을 완전히 놓칠 수도 있습니다.

해결책: 글로벌 캘리브레이션 맵 (Global Calibration Map)

Pinterest 팀은 모든 실험을 위해 비싼 AI에게 모든 것을 레이블링하도록 요청할 필요가 없다는 것을 깨달았습니다. 대신, 그들은 비싼 AI의 지혜를 사용하여 더 저렴하고 빠른 방법을 "교정(calibrate)"할 방법이 필요했습니다.

이렇게 생각해 보십시오. 당신에게 매우 정확하지만 느린 온도계(LLM)와 저렴하고 빠른 온도계(ML 모델 점수)가 있다고 가정해 봅시다. 저렴한 온도계는 숫자를 제공하지만, 완벽하게 정확하지는 않습니다. 하지만 만약 당신이 매일 몇 개의 특정 지점에서 비싼 온도계로 온도를 확인한다면, 어떤 위치에서든 저렴한 온도계의 수치를 어떻게 수정해야 하는지 알려주는 **지도(map)**를 만들 수 있습니다.

논문은 정확히 이 작업을 수행하는 시스템을 설명합니다:

  1. 글로벌 캘리브레이션 (Global Calibration): 각 실험을 별도로 레이블링하는 대신, 그들은 매일 글로벌 샘플링 프로세스를 실행합니다. 그들은 비싼 LLM을 사용하여 플랫폼 전체 트래픽의 대표 샘플에 레이블을 붙입니다.
  2. 버케팅 (Bucketing): 그들은 저렴하고 빠른 모델(항목이 "AI 생성"일 가능성을 예측하는 모델)로부터 얻은 점수를 가져와 "버킷(bucket)"(예: 0–10%, 10–20% 등)으로 그룹화합니다.
  3. 번역 (The Translation): 매일의 LLM 레이블을 사용하여, 각 버킷에 있는 항목 중 실제로 "AI 생성"인 항목의 비율을 계산합니다. 이를 통해 "만약 저렴한 모델이 어떤 항목이 80–90% 버킷에 있다고 하면, 그것이 실제로 AI 생성일 확률은 95%이다"라는 룩업 테이블(lookup table)이 만들어집니다.
  4. 즉각적인 측정 (Instant Measurement): 이제 어떤 새로운 실험이 진행되더라도 비싼 AI를 호출할 필요가 없습니다. 그저 해당 실험에 포함된 항목들의 저렴한 모델 점수를 확인하고, 그 점수가 어떤 버킷에 속하는지 살펴본 뒤, 미리 계산된 지도를 사용하여 즉시 유병률을 파악하면 됩니다.

결과: 속삭임을 포착하다

팀은 실세계 실험에서 이 시스템을 "골드 스탠다드"인 LLM 측정값과 비교 테스트했습니다. 결과는 인상적이었습니다:

  • 규모 (Scale): 이 시스템은 현재 매일 약 100개의 실험과 **250개의 서로 다른 그룹(arm)**에 적용되고 있습니다.
  • 효율성 (Efficiency): 실험당 한 번의 비싼 체크를 수행하던 기존 방식과 비교했을 때, 이 새로운 시스템은 동일한 레이블링 예산으로 20배 이상 더 많은 동시 실행 실험에 대해 매일 측정을 제공합니다.
  • 정확도 (Accuracy): 약 **300건의 프로덕션 감사(production audits)**에서, 시스템의 95% 신뢰 구간(통계적 확실성 범위)이 비싼 LLM의 정답을 포함한 횟수는 **92%**였습니다. 이는 저렴하고 빠른 방법이 비싼 방법만큼 거의 신뢰할 수 있음을 의미합니다.
  • 민감도 (Sensitivity): 가장 흥격적인 발견은 작은 변화를 감지하는 능력이었습니다. 한 실험에서, 이 새로운 시스템은 특정 콘텐츠 유형의 4.2% 상대적 감소를 감지했습니다. 동일한 실험에 대해 단 한 번의 비싼 LLerm 체크를 했다면, 노이즈가 너무 높아서 이 변화를 전혀 감지하지 못했을 것입니다. 매일 데이터를 집계함으로써, 새로운 시스템은 비싼 마이크가 놓친 "속삭임"을 들을 수 있었습니다.

이것이 중요한 이유

이것은 단순히 돈을 아끼는 것에 관한 것이 아닙니다. 더 나은 결정을 내리는 것에 관한 것입니다. 이 시스템 이전에는 많은 실험에서 콘텐츠 유병률을 측정하는 것이 너무 비용이 많이 들어 측정을 건너뛰어야 했을 수도 있습니다. 혹은, 작은 하지만 중요한 트렌드를 놓친 단 하나의 노이즈 섞인 데이터 포인트에 기반해 결정을 내렸을 수도 있습니다.

"글로벌하게 교정하고 어디에서나 측정함으로써", 팀은 비싼 AI의 비용을 한 번 지불하거나 분산시켜서 수천 번 재사용할 수 있는 시스템을 만들었습니다. 이는 느리고 비싼 프로세스를 빠르고 매일 반복되는 루틴으로 바꾸어 놓았습니다. 이를 통해 제품 팀은 자신들의 변화가 콘텐츠 노출에 어떤 영향을 미치는지 전체적인 그림을 볼 수 있으며, 막대한 비용을 들이지 않고도 플랫폼을 안전하고 고품질이며 매력적인 상태로 유지할 수 있게 되었습니다.

이 논문은 이것이 단순한 수학 공식이 아니라 시스템 차원의 성취임을 강조합니다. 이는 반복적이고 비싼 작업을 재사용 가능한 자산으로 바꾸는 파이프라인을 구축하는 것에 관한 것입니다. 비록 향-후 LLM 비용이 낮아져 직접적인 레이벨링이 더 저렴해질 수 있다고 언급되어 있지만, 글로벌 캘리브레이션을 통해 측정을 확장하는 이 시스템의 논리는 오늘날 복잡하고 대규모인 실험을 관리하는 데 있어 여전히 강력한 도구로 남을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →