← 최신 논문
🤖 AI

Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes

본 논문은 크라우드소싱을 활용한 오디오비주얼 딥페이크 탐지를 평가한 결과, 여러 작업자의 판단을 집계하면 비디오 진위 여부를 신뢰성 있게 선별할 수 있으나, 특히 복잡한 오디오·비디오 사례의 경우 크라우드소싱은 특정 조작 유형과 타임스탬프를 일관되게 식별하는 데 어려움을 겪는다는 점을 발견했다.

원저자: Michael Soprano, Andrea Cioci, Stefano Mizzaro

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Michael Soprano, Andrea Cioci, Stefano Mizzaro

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마치 거대한 뉴스룸의 편집자라고 상상해 보세요. 갑자기 수많은 동영상이 쏟아져 들어옵니다. 일부는 진짜이고 일부는 '딥페이크'입니다. 딥페이크는 AI 에 의해 비밀리에 조작되어 실제처럼 보이고 들리는 동영상입니다. 당신의 임무는 이들을 분류하는 것입니다. 하지만 혼자서 모든 영상을 시청할 수 없으므로, 가짜를 찾아내기 위해 일반인 240 명으로 구성된 '크라우드 (대중)' 팀을 고용합니다.

이 논문은 그 팀의 성과를 평가한 성적표입니다. 그들이 발견한 내용을 간단히 설명해 드리겠습니다.

설정: 두 가지 다른 '훈련 캠프'

연구자들은 대중을 한 번만 테스트한 것이 아니라, 서로 다른 두 세트의 동영상을 사용하여 두 가지 별도의 실험을 진행했습니다.

  1. 어려운 캠프 (AV-Deepfake1M): 이 동영상들은 짧고, 까다로우며, 매우 사실적이었습니다.
  2. 쉬운 캠프 (TMC): 이 동영상들은 더 길었고, 가짜를 찾아내기가 약간 더 쉬웠습니다.

두 캠프 모두에서 대중은 각 동영상에 대해 세 가지 작업을 수행해야 했습니다.

  • 가짜 찾기: 이것이 진짜인지 조작된 것인지 확인합니다.
  • 사기꾼 지목: 오디오 (음성), 비디오 (얼굴), 아니면 둘 다가 조작되었습니까?
  • 시간 pinpoint: 사기가 정확히 언제 시작되었습니까?

결과: 대중이 맞힌 것 (그리고 틀린 것)

1. '안전망' 효과 (RQ1)
대중은 '거짓 경보'를 내는 데 탁월했습니다. 동영상이 진짜라면 근로자들은 거의 가짜라고 부르지 않았습니다. 그들은 무고한 동영상을 고발하지 않도록 매우 신중했습니다.

  • 문제점: 그들은 실제 가짜를 잡아내는 데는 형편없었습니다. 이는 진짜 사람들은 거의 통과시키지만, 슬쩍 들어오려는 도둑들은 거의 놓치는 매우 뛰어난 보안 요원과 같습니다.
  • 차이점: 대중은 '어려운' 캠프에 비해 '쉬운' 캠프 (TMC) 에서 약 두 배 더 많은 가짜를 잡아냈습니다. 이는 동영상의 유형이 매우 중요하다는 것을 증명합니다.

2. '무리 심리' (RQ2)
연구자들이 "모두가 동의했습니까?"라고 물었을 때, 답은 "그렇지 않다"였습니다.

  • 어떤 단일 동영상에 대해 근로자들은 서로 자주 이견을 보였습니다. 한 사람은 진짜라고 생각한 반면, 다른 사람은 가짜라고 생각할 수 있습니다.
  • 그러나 다수결 (대부분의 사람들이 말한 것) 을 취하면 신호가 훨씬 더 명확해졌습니다. 이는 방 안에 있는 사람들에게 소의 무게를 추측하게 하는 것과 같습니다. 한 사람은 완전히 빗나갈 수 있지만, 10 명의 평균은 보통 꽤 정확합니다.
  • 주의할 점: 다수결을 사용하더라도, 동영상이 정말 까다로운 가짜라면 대중은 여전히 그것을 놓쳤습니다. 더 많은 사람에게 물어본다고 해서 맹점을 해결할 수는 없습니다.

3. 세부 사항에 대한 '맹점' (RQ3)
이 부분이 가장 어려웠습니다. 대중이 가짜를 찾아냈을 때조차, 어떻게 조작되었는지 추측하는 데는 형편없었습니다.

  • 혼동: 동영상에 가짜 음성과 가짜 얼굴이 모두 포함되어 있다면, 대중은 보통 '가짜 음성' 또는 '가짜 얼굴'이라고만 추측했고, '둘 다'라는 정답을 거의 맞추지 못했습니다.
  • 희망의 빛 (타임스탬프): 그들이 무엇이 조작되었는지에는 동의하지 못했지만, 언제 일어났는지에 대해서는 놀라울 정도로 잘 동의했습니다. 동영상이 가짜라고 생각하면, 보통 이상함이 시작된 동일한 5 초 구간을 가리킬 수 있었습니다.

결론: 두 단계 전략

이 논문은 간단한 비유를 사용하여 이 '크라우드' 시스템을 활용하는 실용적인 방법을 제안합니다.

대중을 공항의 금속 탐지기라고 생각하세요.

  • 1 단계 (선별): 금속 탐지기 (대중) 는 수천 개의 가방을 빠르게 스캔하는 데 뛰어납니다. 비어 있는 가방을 거의 경고하지 않지만 (낮은 오경보), 숨겨진 작은 물품은 놓칠 수 있습니다 (놓친 가짜).
  • 2 단계 (전문가 검토): 탐지기가 경보음을 울리면, 탐지기에게 그 물품이 무엇인지 또는 가방 어디에 있는지 묻지 마세요. 대신 그 가방을 인간 전문가 (또는 똑똑한 AI) 에게 보내 열어 자세히 검사하게 하세요.

간단히 말해: 대중은 명백한 가짜를 잡아내고 전문가가 살펴볼 의심스러운 동영상을 표시하는 훌륭한 '1 차 필터'입니다. 하지만 동영상이 어떻게 조작되었는지에 대한 최종 판단을 그들에게 맡기지 마세요. 그들이 그 부분을 틀릴 가능성이 높기 때문입니다.

작은 경고 하나

연구자들은 일부 근로자가 테스트를 시작할 때 음량을 낮게 설정했을 수 있다고 지적했습니다. 오디오를 들을 수 없었기 때문에 '오디오 전용' 가짜를 놓쳤을 수 있습니다. 이는 단순한 작업에서도 작은 세부 사항 (예: 음량) 이 결과를 바꿀 수 있다는 교훈입니다.

핵심: 크라우드소싱은 동영상에서 '무언가 잘못되었다'는 것을 찾아내는 데 유용한 도구이지만, 정확히 '무엇이 잘못되었는지' 파악하려면 도움이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →