← 최신 논문
💬 NLP

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

이 연구는 멀티모달 거대 언어 모델이 프랑스, 이탈리아, 스웨덴 전역에서 틱톡의 유해 콘텐츠 노출을 감사하기 위한 비용 효율적이고 확장 가능한 방법을 제공할 수 있음을 입증하며, 키워드 기반 검색이 수동적 스크롤링에 비해 유해 콘텐츠 노출을 유의미하게 증가시키고 안전 필터가 명시적인 위해를 과소 산정하는 경우가 빈번하다는 사실을 밝혀냈다.

원저자: Hamidreza Saffari, Francesco Pierri

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hamidreza Saffari, Francesco Pierri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매일 수백만 명의 젊은이들이 짧은 영상을 시청하기 위해 앱을 열며, 화면이 자신들이 즐길 만한 것들을 보여줄 것이라고 믿습니다. 그 이면에서는 복잡한 컴퓨터 프로그램이 사용자의 모든 탭, 일시 정지, 건너뛰기를 학습하여 다음에 어떤 영상이 나타날지 결정하며 개인화된 피드를 구축합니다. 이러한 시스템은 몰입감을 높이도록 설계되었지만, 때로는 자해, 섭식 장애, 폭력을 조장하는 내용과 같이 위험하거나 충격적인 콘텐츠로 사용자를 내몰기도 합니다. 이러한 알고리즘은 기업의 서버 내부에서 '블랙박스'처럼 작동하기 때문에, 독립적인 연구자들은 젊은 사용자들이 정확히 무엇을 보고 있는지 파악하는 데 어려움을 겪어 왔습니다. 모든 영상을 검사하는 것은 어렵고, 무엇이 유해한 콘텐츠인지에 대한 기준도 언어와 국가에 따라 다를 수 있습니다. 이러한 노출 정도를 측정할 명확한 방법이 없기 때문에, 안전 조치가 실제로 효과가 있는지, 아니면 보호해야 할 사람들을 오히려 놓치고 있는지 알기가 어렵습니다.

이를 해결하기 위해 이탈리아 밀라노 공과대학교(Politecnico di Milano)의 연구팀은 프랑스, 이탈리아, 스웨덴 등 세 곳의 유럽 국가에서 틱톡(TikTok)을 감사(audit)하기 위한 조사를 실시했습니다. 그들은 앱이 초기 청소년부터 성인에 이르기까지 다양한 연령대의 사용자에게 어떤 영상을 보여주는지 확인하고자 했습니다. 연구진은 수천 개의 영상을 시청하기 위해 수많은 인력을 고용하는 대신, '멀티모달 언어 모델(multimodal language model)'이라는 새로운 종류의 인공지능을 활용했습니다. 이는 인간처럼 텍스트를 읽고, 오디오를 듣고, 이미지를 동시에 볼 수 있는 고급 컴퓨터 시스템입니다. 연구진은 먼저 몇 가지 멀티모달 언어 모델을 인간 전문가가 이미 라벨링을 마친 소수의 영상 세트에 대해 테스트했습니다. 그 결과, 특정 모델 하나가 영상에서 추출한 8개의 정지 이미지와 텍스트 설명을 함께 보여주었을 때, 대규모로 활용하기에 충분한 수준의 정확도로 유해 콘텐츠를 식별할 수 있다는 것을 발견했습니다. 이 방식 덕분에 연구진은 약 50달러의 비용으로 거의 37,000개의 영상을 분석할 수 있었는데, 이는 인간 검수자만을 사용했을 경우 비용과 시간 면에서 감당하기 힘들었을 작업입니다.

연구에는 13세, 16세, 19세, 40세의 특정 연령대를 가진 가상의 사용자 계정들이 사용되었습니다. 이 계정들은 서로 다른 지역에서 앱이 어떻게 작동하는지 확인하기 위해 프랑스, 이탈리아, 스웨덴에 설정되었습니다. 연구진은 이 계정들이 아무런 행동을 하지 않고 메인 영상 피드를 단순히 스크롤하도록 두어, 알고리즘이 무엇을 보여주는지 기록했습니다. 또한, 연구진은 '자살'이나 '도박'과 같이 유해한 주제와 관련된 특정 단어를 직접 검색했을 때 앱이 어떻게 반응하는지 보기 위해 두 번째 테스트를 수행했습니다. 결과는 사용자가 수동적으로 스크롤할 때와 능동적으로 검색할 때의 차이를 극명하게 보여주었습니다. 단순히 스크롤할 때 나타나는 유해 콘텐츠의 양은 국가마다 크게 달랐습니다. 이탈리아는 모든 연령대에서 가장 높은 유해 영상 비율을 보였는데, 19세 페르소나에게 보여진 영상 중 거의 절반이 유해한 것으로 분류되었습니다. 반면, 프랑스와 스웨덴의 비율은 이보다 낮았지만 여전히 존재했습니다.

하지만 계정들이 검색을 시작하자 상황은 급격히 변했습니다. 연구진이 유해한 주제와 관련된 키워드를 입력하자, 앱은 즉시 유해 콘텐츠의 홍수를 쏟아냈으며, 유해 콘텐츠 비율이 35%에서 56% 사이로 치솟았습니다. 이는 수동적으로 스크롤할 때와 비교했을 때 엄청난 증가였으며, 앱이 요청을 받았을 때 해당 자료를 찾아내는 능력이 매우 뛰어나며, 검색하는 순간에는 눈에 보이는 경고나 차단 없이도 이를 제공한다는 것을 보여주었습니다. 흥lik하게도, 이러한 유해 콘텐츠의 급증은 일시적이었습니다. 검색이 끝나고 계정들이 다시 스크롤을 시작하면, 피드는 몇 분 이내에 정상적인 낮은 수준의 유해 콘텐츠 상태로 돌아왔습니다. 이는 단 한 번의 검색이 사용자의 피드를 영구적으로 '오염'시키지는 않지만, 요청 시에는 위험한 자료에 즉각적으로 접근할 수 있게 한다는 점을 시사합니다.

또한 연구는 사용자의 연령보다 거주 국가가 더 중요하다는 점을 발견했습니다. 프랑스와 스웨덴에서는 어린 청소년이 보는 유해 콘텐츠의 양이 성인이 보는 것보다 적었는데, 이는 안전 규칙이 의도한 바대로 작동하고 있음을 의미합니다. 그러나 이탈리아에서는 가장 어린 사용자들도 성인과 비슷하거나 심지어 더 많은 유해 콘텐츠를 보았는데, 이는 해당 지역에서 안전 필터가 의도한 대로 작동하지 않고 있음을 나타냅니다. 연구진은 사용된 인공지능이 완벽하지 않다는 점을 언급했습니다. AI는 일부 영상을 놓치거나, 특히 매우 노골적인 누드 장면이 포함된 영상을 분석하기를 거부하기도 했습니다. 이는 연구진이 보고한 수치가 보수적인 추정치이며, 실제 유해 콘텐츠의 양은 이보다 약간 더 높을 수 있음을 의미합니다. 그럼에도 불구하고, 이 연구는 고급 AI를 사용하여 소셜 미디어 플랫폼을 감사하는 것이 다양한 언어와 국가를 모니터링하는 데 있어 실현 가능하고 저렴한 방법임을 입증합니다. 이 연구는 검색 기능이 유해 콘텐츠로 가는 주요 관문인 동시에, 수동 피드 또한 위치에 따라 크게 달라지며 이탈리아가 젊은 사용자들에게 가장 심각한 노출을 보이고 있다는 점을 강조합니다. 이러한 결과는 플랫폼 기업들이 전 세계 모든 아이를 보호하기 위해 '원 사이즈 핏 올(one-size-fits-all, 일률적 적용)' 방식을 가정하기보다는, 검색 결과를 어떻게 관리하고 지역별로 안전 조치를 어떻게 맞춤화할지에 대해 더 면밀히 살펴봐야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →