← 최신 논문
📊 statistics

Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling

본 논문은 통계적 무편향성과 비용 효율성을 유지하면서 다양한 사용자 세그먼트에 걸친 정책 위반 콘텐츠의 유병률을 효율적이고 정확하게 추정하기 위해, ML 지원 확률 표집과 LLM 레이블링을 결합한 설계 기반 측정 시스템을 제시한다.

원저자: Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Attila Dobi, Aravindh Manickavasagam, Benjamin Thompson, Xiaohan Yang, Faisal Farooq

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수십억 명의 사람들이 매일 사진, 아이디어, 이야기를 공유하는 광활한 디지털 풍경 속에서, 한 가지 조용하지만 중대한 과제가 지속되고 있습니다. 그것은 바로 사용자가 실제로 무엇을 보고 있는지 어떻게 알 수 있는가 하는 문제입니다. 수년 동안 플랫폼들은 유해한 콘텐츠를 신고하기 위해 사용자 보고에 의존해 왔지만, 이 방법은 도움을 요청하며 소리치는 사람들의 수만 세어서 강의 깊이를 측정하려는 것과 같습니다. 많은 위험 요소들이 보고되지 않는데, 이는 사용자들이 이를 인지하지 못하거나, 신고 방법을 모르거나, 혹은 단순히 시스템에 관여하고 싶어 하지 않기 때문입니다. 플랫폼의 안전성을 진정으로 이해하기 위해서, 팀들은 '유병률(prevalence)'—즉, 사용자가 규칙을 위반하는 콘텐츠를 마주치는 실제 빈도—을 측정해야 합니다. 이를 위해서는 이미 신고된 부분만이 아니라 전체 콘텐츠의 흐름을 살펴봐야 합니다. 문제는 유해한 콘텐츠는 흔히 드물게 나타나며, 모든 항목을 매일 수작업으로 확인하는 것은 너무 느리고 비용이 많이 든다는 점입니다.

Pinterest의 연구진은 이를 해결하기 위한 새로운 방법을 개발했습니다. 스마트 샘플링과 고급 인공지능을 결합하여 전례 없는 속도와 정확도로 안전성을 측정하는 시스템을 만든 것입니다. 사용자들의 불만을 기다리는 대신, 그들은 사용자에게 보여지는 모든 것에 대해 매일 대표성 있는 스냅샷을 찍습니다. 그들은 제한된 검토 예산을 가장 위반 가능성이 높은 후보들에 집중시키는 통계적 방법을 사용하여, 모든 것을 확인하지 않고도 수치의 확신을 가질 수 있을 만큼 충분한 사례를 찾아냅니다. 그런 다음, 텍-이미지를 이해하도록 훈련된 대규모 언어 모델(LLM)—지치지 않고 일관되게 검토하는 역할을 하는 AI—을 사용하여 이 샘플들을 레이블링합니다. 이러한 기술들을 결합함으로써, 그들은 사용자가 유해한 콘텐츠를 얼마나 자주 접하는지에 대한 일일 보고서를 생성할 수 있으며, 그 수치가 얼마나 정밀한지에 대한 척도까지 함께 제공할 수 있습니다. 이를 통해 안전 팀은 발생하는 문제를 즉시 포착하고, 수정 사항이 효과가 있는지 테스트하며, 위험이 정확히 어디에서 언제 나타나는지 파악할 수 있습니다. 이 모든 과정은 인간 검토자가 따라잡을 때까지 몇 주를 기다릴 필요 없이 이루어집니다.

이 시스템의 핵심은 검토할 콘텐츠를 선택하는 영리한 방식에 있습니다. 매일 수십억 건의 조회수가 발생하는 바다에서 희귀한 위반 사례를 찾는 것은 숲속에서 특정 종류의 잎사귀 하나를 찾는 것과 같습니다. 무작위로 잎사귀를 고른다면, 수 마일을 걸어가도 아무것도 찾지 못할 수도 있습니다. 대신 연구진은 "가중치(weighted)" 방식을 사용합니다. 그들은 두 가지 주요 단서에 주목합니다. 해당 콘텐츠가 사람들에게 노출된 횟수와 플랫폼의 기존 안전 모델이 생성한 위험 점수입니다. 이 단서들을 결의하여, 인기 있으면서도 위험도가 높은 아이템이 검토 대상으로 뽑힐 확률이 더 높도록 리스트를 만듭니다. 이것이 오직 위험한 아이템만을 체크한다는 의미는 아닙니다. 여전히 전체 모집단에서 추출하되, 견고한 통계적 추정치를 얻을 수 있을 만큼 충분한 위반 사례를 확보하기 위해 확률을 약간 기울이는 것입니다. 이 방법 덕분에 그들은 매일 정해진 수의 체크를 수행하면서도, 위반이 극히 드문 경우에도 플랫폼 전체의 명확한 그림을 얻을 수 있습니다.

매일의 샘플이 선택되면, 연구진은 레이블링 단계로 넘어갑니다. 여기서 연구진은 전통적인 인간 검토 프로세스를 멀티모달 대규모 언어 모델로 대체했습니다. 이 AI는 인간 모더레이터처럼 이미지를 보고, 텍스트를 읽고, 맥락을 이해할 수 있습니다. 하지만 연구진은 단순히 AI에게 결정을 맡긴 것이 아니라, 그 주변에 엄격한 품질 관리 시스템을 구축했습니다. AI가 일일 샘플에 레이블을 달기 전에, 인간 전문가들이 신중하게 검토한 "골드 세트(gold set)" 콘텐츠를 통해 테스트를 거칩니다. AI는 가동되기 전, 인간 전문가의 결정과 매우 좁은 오차 범위 내에서 일치해야 합니다. 일단 가동되면, 시스템은 무작위로 선택된 일일 레이블 중 일부를 다시 인간 전문가에게 보내 검증함으로써 AI의 작업을 지속적으로 확인합니다. 이는 AI가 시간이 지남에 따라 편향되거나 체계적인 실수를 저지르지 않도록 보장합니다. 그 결과, 레이블링 프로세스는 인간만 참여할 때보다 약 15배 빠르고 비용은 10배 이상 적게 들면서도, 유사한 수준의 정확도를 유지합니다.

이 접근 방식의 힘은 플랫폼을 다양한 방식으로 쪼개고 분석할 수 있는 단일하고 통합된 뷰를 제공할 수 있다는 점에 있습니다. 연구진은 매일 하나의 글로벌 샘플을 추출하기 때문에, 새로운 연구를 매번 실행할 필요 없이 지역별, 콘텐츠 표면 유형별, 또는 콘텐츠의 연령별로 안전성이 어떻게 변하는지에 대한 질문에 즉각적으로 답할 수 있습니다. 특정 유형의 콘텐츠가 특정 국가에서 급증하고 있는지, 혹은 새로운 정책 업데이트가 효과가 있는지 등을 비교하여 확인할 수 있습니다. 또한 시스템은 생성된 모든 수치에 대해 신뢰 구간(confidence interval)을 계산하여, 안전 팀이 결과에 어느 정도의 신뢰를 두어야 하는지 알려줍니다. 만약 수치가 매우 드문 위반 사례에 기반하고 있다면 신뢰 구간이 넓게 나타날 것이며, 이는 팀이 중대한 결정을 내리기 전에 더 많은 데이터를 기다려야 함을 시사합니다.

연구진은 시뮬레이션과 실제 핀터레스트 운영 환경 모두에서 이 시스템을 광범위하게 테스트했으며, 현재 1년 넘게 매일 실제로 가동되고 있습니다. 그들은 ML 지원 샘플링 방법을 사용함으로써, 표준 무작위 샘플링 방법과 비교했을 때 일일 샘플에서 6~11배 더 많은 위반 사례를 찾을 수 있다는 것을 발견했습니다. 이러한 효율성 덕분에 훨씬 적은 검토 횟수로도 동일한 수준의 통계적 정밀도를 달ей 할 수 있었고, 혹은 동일한 작업량으로 훨씬 더 촘촘하고 신뢰할 수 있는 수치를 얻을 수 있었습니다. 또한, 샘플링을 유도하는 기본 위험 점수가 시간이 지남에 따라 변하거나 정확도가 떨어지더라도, 시스템의 최종 추정치는 편향되지 않은 상태를 유지한다는 것을 입증했습니다. 오류는 잘못된 답이 아닌 더 넓은 신뢰 구간으로 나타났는데, 이는 트렌드가 실제인지 아니면 단순한 노이즈인지를 알아야 하는 의사결정자들에게 매우 중요한 차이점입니다.

가장 중요한 발견 중 하나는 자동화된 레이블링에서 필연적으로 발생하는 오류를 시스템이 어떻게 처리하는가였습니다. 연구진은 매우 드문 위반의 경우, 가장 큰 위험은 위반을 놓치는 것이 아니라 안전한 콘텐츠를 유해한 것으로 잘못 표시하는 것임을 발견했습니다. 안전한 콘텐츠의 바다에서 단 하나의 거짓 양성(false positive)이 발생하면, 문제가 실제보다 10배는 더 심각한 것처럼 보이게 만들 수 있습니다. 이를 관리하기 위해 시스템은 AI의 거짓 양성률을 지속적으로 모니터링합니다. 만약 이 비율이 너무 높아지면, 시스템은 최종 수치에 수학적 보정을 적용하여 오류를 반영하거나, 해당 스파이크를 일으키는 특정 항목에 대한 인간 검토를 트리거할 수 있습니다. 이를 통해 일일 보고서가 AI 모델의 특이점이 아닌 현실을 반영하도록 보장합니다. 또한 연구진은 일일 수치의 변동이 실제 안전 수준의 변화보다는 게시되는 콘텐츠 유형의 변화나 AI가 규칙을 해석하는 미묘한 변화에 의해 발생하는 경우가 많다는 것을 발견했습니다. 이러한 단기적인 변동을 완화하고 주간 트렌드에 집중함으로써, 정상적인 노이즈와 실제 나타나는 위협을 구분할 수 있었습니다.

이 작업은 디지털 플랫폼이 안전을 모니터링하는 방식의 변화를 의미하며, 사용자 불만에 기반한 반응적 모델에서 선제적이고 데이터 중심적인 접근 방식으로 전환하는 것입니다. 안전 측정을 단순히 집행 업무가 아닌 통계 과학으로 다룸으로써, 연구진은 문제가 나타나는 즉시 감지할 수 있는 도구를 만들었습니다. 이 시스템은 유연하게 설계되어, 온라인 콘텐츠의 지형이 변화함에 따라 팀이 빠르게 새로운 정책을 추가하거나 파라미터를 조정할 수 있도록 합니다. 이는 샘플링, AI 레이블링, 인간 검증, 그리고 통계 분석의 연속적인 루프에 의존하며, 인터넷의 속도에 발맞출 수 있을 만큼 빠른 피드백 루프를 생성합니다. 연구진은 이 시스템이 인간의 판단이나 정책 집행을 대체하는 것이 아니라, 그러한 결정을 효과적으로 내리는 데 필요한 명확성을 제공하는 보완적인 도구임을 강조합니다. 이 시스템은 보이지 않는 것을 보이게 만들어, 안전 팀이 플랫폼의 실제 상태를 이해하고 더 높은 정밀도와 속도로 사용자를 보호할 수 있도록 돕는 눈이 되어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →