Deepfakes: we need to re-think the concept of "real" images
이 정책 제안서는 현대 스마트폰 사진 촬영 자체가 생성 모델과 유사한 신경망 기반 알고리즘을 활용한다는 점을 고려할 때, "진실" 이미지에 대한 구식 정의와 데이터셋에 의존하고 있기 때문에 "가짜" 이미지 탐지에 대한 현재의 초점이 근본적으로 결함이 있다고 주장하며, 연구 커뮤니티가 진정성의 개념을 재평가할 것을 촉구합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
가상적으로 당신이 위조범을 잡으려는 형사라고 상상해 보세요. 당신의 임무는 한 폭의 그림을 보고 결정하는 것입니다: "이것은 진짜 걸작인가, 아니면 가짜인가?"
수년 동안 머신러닝 커뮤니티는 이 '딥페이크' 문제를 해결하기 위해 첨단 스캐너를 구축해 왔습니다. 그들은 AI 형사들을 방대한 양의 '진짜' 그림 (사진) 라이브러리로 훈련시켜 진정성이 어떤 모습인지 학습시켰습니다.
문제: 이 논문의 저자들은 형사들이 구식 라이브러리를 사용하고 있다고 주장합니다. 그들은 약 10 년 전부터 더 이상 작동하지 않는 '진짜'의 정의를 사용하여 현대적인 위조품을 찾아내려 하고 있습니다.
간단한 비유를 사용하여 그들의 논의를 다음과 같이 정리해 보겠습니다:
1. "구식 도서관" 문제
현재 AI 형사들은 주로 10~15 년 전의 데이터셋 (사진 라이브러리) 으로 훈련받고 있습니다.
- 비유: 학생에게 현대 자동차를 인식하도록 가르치기 위해 모델 T 포드 사진만 보여준다고 상상해 보세요. 학생은 나무 바퀴와 개방형 지붕을 기준으로 '자동차'가 어떤 모습인지 학습합니다. 현대식 테슬라를 보여주면, 책에 있는 '진짜' 자동차와 다르게 생겼기 때문에 학생은 혼란스러워할 수 있습니다.
- 현실: 이 논문은 현재 거의 모든 '진짜' 이미지 데이터셋이 오래되고, 저해상도이며, 심하게 압축되어 있습니다 (JPEG 와 같은). 그들은 우리가 오늘날 찍는 사진을 대표하지 못합니다.
2. "스마트 카메라"의 전환
오늘날 사진의 90% 이상이 스마트폰으로 촬영됩니다. 하지만 여기에는 반전이 있습니다: 스마트폰은 단순히 사진을 '찍는' 것이 아니라 사진을 '계산'합니다.
- 비유: 과거에는 카메라가 창문과 같았습니다. 당신은 창문을 통해 바라보았고, 빛이 필름에 닿았습니다. 이미지는 현실의 직접적인 기록이었습니다.
- 새로운 현실: 현대 스마트폰은 더 이상 부엌의 믹서기와 같습니다. 당신은 생재료 (여러 센서, 여러 카메라, 수백만 분의 1 초 동안 촬영된 여러 프레임) 를 넣고, 폰의 내부 컴퓨터 (복잡한 신경망을 사용) 가 이를 섞어 완벽한 스무디 (최종 사진) 를 만들어냅니다.
- 갈등: AI 탐지기는 AI 생성기에 의해 만들어진 '가짜' 이미지를 찾아내도록 훈련되었습니다. 하지만 이제 우리 폰에서 나오는 '진짜' 이미지들도 폰 내부의 AI 알고리즘 (신경망) 에 의해 만들어지고 있습니다. '진짜' 사진들이 이미 디지털적으로 조리되고 있기 때문에 '진짜'와 '가짜' 사이의 경계가 흐려지고 있습니다.
3. 실패한 테스트
저자들은 자신의 주장을 증명하기 위해 간단한 실험을 수행했습니다.
- 테스트: 그들은 최고의 '가짜 탐지' AI 모델들을 가져와 두 가지 것을 보여주었습니다:
- 인터넷의 오래되고 저품질 사진들 (AI 가 잘 아는 것들).
- 실제 생활에서 최신 아이폰으로 찍은 신선한 원본 사진들.
- 결과: AI 는 오래된 사진에서는 훌륭하게 작동했습니다. 하지만 신선한 아이폰 사진을 보여주자 AI 는 혼란스러워지기 시작했고 실패했습니다. 아이폰 사진이 폰 자체의 AI 에 의해 처리되었기 때문에, AI 는 '진짜' 아이폰 사진과 '가짜' AI 이미지를 구별할 수 없었습니다.
- 은유: 빨간 모자를 쓴 사람을 찾아내도록 훈련된 보안 요원과 같습니다. 그는 빨간 모자를 쓴 모든 사람을 잡습니다. 하지만 경찰대까지 빨간 모자를 쓰기 시작하면, 보안 요원은 이제 범인과 경찰을 구별할 수 없게 됩니다.
4. 철학적 함정
이 논문은 우리가 고리에 갇혀 있다고 주장합니다.
- '진짜'를 'AI 에 의해 손대지 않은 것'으로 정의한다면, 거의 모든 사진이 더 이상 진짜가 아닙니다. 왜냐하면 우리 폰은 조명 보정, 노이즈 제거, 이미지 선명도 향상을 위해 AI 를 사용하기 때문입니다.
- '진짜'를 '인간이 찍은 것'으로 정의한다면, 이 정의는 도움이 되지 않습니다. 왜냐하면 폰의 AI 가 중대한 작업을 수행했기 때문입니다.
저자들의 결론
이 논문은 탐지기를 고칠 새로운 알고리즘을 제시하지 않습니다. 대신 경보를 울립니다: 우리는 멈추고 전체 게임을 다시 생각해야 합니다.
- 새로운 데이터: 우리는 오래되고 저해상도인 것이 아니라, 현대적이고 스마트폰으로 계산된 사진을 포함한 새로운 데이터셋이 필요합니다.
- 새로운 정의: 우리는 '진짜'가 무엇을 의미하는지 합의해야 합니다. 폰이 사진을 밝게 했다면 그 사진은 진짜일까요? AI 가 흠집을 제거했다면 그것은 가짜일까요? 우리는 더 이상 '디지털 지문'만 찾아서는 안 됩니다. 왜냐하면 '진짜' 사진들도 그 지문을 가지고 있기 때문입니다.
- 아마도 탐지기는 작동하지 않을 것입니다: 저자들은 이미지 픽셀을 살펴가며 가짜를 탐지하려는 시도가 막다른 길일 수 있다고 제안합니다. 대신, 이미지가 '진짜'처럼 보이는지 추측하는 대신, 이미지의 출처를 증명하기 위해 디지털 워터마크나 블록체인 서명과 같은 다른 방법에 의존해야 할지도 모릅니다.
간단히 말해: 거짓말쟁이를 잡기 위해 우리가 만든 도구들은 실패하고 있습니다. 왜냐하면 진실을 말하는 사람들 (우리 폰) 이 거짓말쟁이들과 같은 수법을 쓰기 시작했기 때문입니다. 다음 세대 위조품을 잡기 전에 우리는 규칙집을 다시 써야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.