Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation
이 논문은 단순하고 모델에 구애받지 않는 이미지 변환이 세 가지 주요 상용 AI 기반 콘텐츠 모더레이션 서비스를 효과적으로 우회할 수 있음을 입증하며, 파운데이션 모델 API로 전환하는 것만으로는 강력한 안전성을 보장할 수 없으며 계층적인 모더레이션 접근 방식이 필요하다는 것을 증명한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 수백만 명의 사람들이 매초 사진, 영상, 이야기를 공유하는 거대하고 북적이는 디지털 도시라고 상상해 보십시오. 폭력이나 음란물 같은 유해한 콘텐츠로부터 이 도시를 안전하게 지키기 위해, "도시 경비원"(자동화된 AI 시스템)은 게이트를 통과하는 모든 사진을 끊임없이 스캔합니다. 오랫동안 이 경비원들은 특정 유형의 문제만을 찾아낼 줄 아는 특수 보안 요원과 같았습니다. 하지만 최근 기술 기업들은 맥락을 이해하고 더 다양한 위험을 포착할 수 있는 것을 약속하는, 모든 것을 아는 듯한 거대한 AI 모델인 "슈퍼 경비원"으로 업그레이드했습니다. 여기서 중요한 질문은, 이 슈퍼 경비원들이 실제로 속이기 더 어려운 것인지, 아니면 그저 화려한 새 유니폼을 입었을 뿐 여전히 똑같은 사각지대를 가지고 있는 것인지입니다.
이 논문은 이러한 현대적인 고성로 AI 경비들이 단순하고 낮은 기술의 속임수에 속아 넘어가는지 테스트함으로써 이 질문을 파고듭니다. 이것은 마치 보안 스캐너를 통해 금지된 물건을 몰래 통과시키려는 것과 같습니다. 복잡한 레이저나 거창한 계획이 필요하지 않습니다. 때로는 물건에 선글라스를 씌우거나, 뒤집어 놓거나, 약간의 정적 노이즈를 추가하는 것만으로도 스캐너가 "오, 이건 무해하네!"라고 생각하게 만들기에 충분합니다. 연구자들은 이 비싸고 강력한 새로운 AI 시스템들이 이러한 단순한 변장술을 파악하는 데 있어 기존의 모델들보다 더 나은 모습을 보이는지 알고 싶었습니다.
위대한 AI 변장 테스트
이 논문의 저자들은 오늘날 빅테크 기업들이 사용하는 가장 인기 있는 세 가지 상업용 이미지 모더레이션(이미지 검열) 서비스인 OpenAI의 "omni-moderation", Amazon의 "Rekognition", 그리고 Google의 "SafeSearch"를 대상으로 "고양이와 쥐" 놀이를 하기로 했습니다. 이 시스템들을 해킹하거나 이들을 속이기 위한 가짜 AI를 구축하는 대신, 그들은 매우 간단한 방법을 사용했습니다. 즉, AI가 이미 "유해함"으로 분류한 이미지들에 일곱 가지의 서로 다른, 실행하기 쉬운 시각적 변형을 적용한 것입니다.
이 변형들은 AI가 작동하는 방식에 대한 특별한 지식을 요구하지 않는 디지털 마술과도 같았습니다. 여기에는 다음과 같은 것들이 포함되었습니다:
- 색상 반전: 사진을 옛날 필름 네거티브처럼 반전시키는 것.
- 그레이스케일: 색상을 모두 제거하여 흑백으로 만드는 것.
- 블러(흐림): 안개 낀 창문을 통해 보는 것처럼 이미지를 약간 뭉개는 것.
- 솔트 앤 페퍼(소금과 후추): 옛날 TV의 노이즈처럼 이미지 위에 무작위로 검은색과 흰색 점을 뿌리는 것.
- 분리 및 교체: 이미지의 빨강, 초록, 파랑 부분을 가져와서 서로 뒤섞는 것.
연구자들은 이 "변장된" 이미지들을 다시 AI 시스템에 입력하여, AI가 여전히 "위험!"이라고 외칠지, 아니면 갑자기 "오, 이건 괜찮으니 지나가도 됩니다"라고 말할지 확인했습니다.
충격적인 결과
결과는 매우 드러내는 바가 많았습니다. 이 논문은 이 세 가지 고성능 상업용 AI 서비스 모두가 이러한 단순하고 저렴한 속임수에 의해 우회될 수 있다는 사실을 발견했습니다. AI의 내부 두뇌를 알기 위한 코딩 천재가 되거나 접근 권한을 가질 필요도 없었습니다.
숫자들이 들려주는 이야기는 다음과 같습니다:
- "원샷(One-Shot)" 속임수: 색상을 반전시키는 것과 같은 단 하나의 고정된 변화만으로도 시스템을 속이기에 충분했습니다. Amazon Rekognition의 경우, 단순히 색상을 뒤집는 것만으로 유해한 이미지의 **43.97%**가 안전해 보였습니다. Google의 시스템은 이 한 가지 속임수에 6.29% 속았고, OpenAI의 시스템은 8.11% 속았습니다.
- "블러" 및 "노이즈" 속임수: 연구자들이 노이즈를 추가하거나 이미지를 흐리게 만들었을 때, 특히 이미지가 조금 덜 완벽해지는 것을 허용했을 때 성공률은 더욱 높아졌습니다. 예를 들어, "솔트 앤 페퍼" 속임수를 사용했을 때 Amazon의 시스템은 **45.53%**의 확률로 속았으며, Google과 OpenAI는 이미지가 원본과 매우 유사해 보임에도 불구하고 30% 이상의 확률로 속았습니다.
- 다양한 유형의 문제: AI는 모든 종류의 나쁜 콘텐츠를 똑같이 잘 잡아내지는 못했습니다. 특히 자해와 관련된 이미지는 시스템을 속이기가 매우 쉬웠는데, 이는 가장 취약한 카테고리였습니다. 폭력과 관련된 이미지는 속이기가 가장 어려웠지만, 그조차도 안전하지는 않았습니다.
- 멀티모달 콘텐츠: 연구자들은 "밈(meme)"(텍스트가 포함된 이미지)도 테스트했습니다. 밈은 AI가 텍스트를 읽는 동시에 그림을 봐야 하지만, 단순한 시각적 속임수들이 여전히 효과가 있었으며, 이는 AI의 "슈퍼 비전"에 균열이 있음을 증명했습니다.
이것이 디지털 도시에 의미하는 바
이 논문은 단순히 이러한 강력한 AI 모델로 업그레이드하는 것이 유해한 콘텐츠에 대한 견고한 벽을 자동으로 만들어내지는 않는다는 결론을 내립니다. "슈퍼 경비원"들은 여전히 수년 동안 사용되어 온 동일한 단순한 변장술에 취약합니다.
저자들은 단 하나의 AI 서비스만을 유일한 방어선으로 의존하는 것은 위험하다고 제안합니다. 대신, 이 시스템들이 "계층화된" 보안 팀의 일부가 되어야 한다고 제로합니다. 성을 상상해 보십시오. 단순히 정문 경비원 한 명에게만 의존하는 것이 아니라, 해자와 도개교, 그리고 성 내부의 두 번째 경비원을 두는 것과 같습니다. 마찬가지로, 온라인 플랫폼들은 이러한 AI 도구들을 모든 것을 잡아내는 유일한 도구로 신뢰하기보다는, 다른 점검 방식이나 인간 검토자와 결합하여 사용할 수 있는 하나의 유용한 도구로 활용해야 합니다.
요약하자면, 이 논문은 AI 모더레이션이 많은 발전을 이루었지만, 단순한 이미지 조작이라는 "옛날 속임수"가 여전히 "새로운 모델"을 통과하는 데 매우 효과적이라는 것을 보여줍니다. 이는 디지털 세상에서 악의적인 행위자의 작은 창의성이 때로는 매우 비싼 컴퓨터를 앞지를 수 있다는 점을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.