Evaluating Intellectual Property Guardrails of Generative Image Models: A Technical Report
이 기술 보고서는 2026년 3월 기준 14개의 생성형 이미지 모델을 평가하였으며, 모든 프라이빗 모델이 가상의 캐릭터, 유명인 및 로고에 대해 각기 다른 거부율을 가진 지식재재권(IP) 보호 조치를 구현하고 있음에도 불구하고, 테스트된 모든 모델이 여전히 식별 가능한 지식재산권을 생성할 수 있는 능력을 갖추고 있음을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 상상하는 무엇이든 그려낼 수 있는 마법 같은 화가에게 요청할 수 있는 세상을 상상해 보세요. 당신은 "유명한 슈퍼히어로를 그려줘"라고 말하거나, "대형 탄산음료 회사의 로고를 그려줘"라고 말할 수 있습니다. 이 보고서는 이 "마법 같은 화가들"(생성형 이미지 모델)이 다른 사람의 소유인 유명 캐릭터, 유명인, 또는 기업 로고를 그리라는 요청을 받았을 때 규칙을 얼마나 잘 따르는지 테스트하기로 결정한 Sony AI 팀의 보고서입니다.
다음은 그들이 무엇을 했고 무엇을 발견했는지 일상적인 비유를 사용하여 간단하게 정리한 내용입니다.
거대한 문제: "따라쟁이" 화가
이 AI 모델들을 인터넷에 있는 거의 모든 책을 읽고 거의 모든 그림을 본 학생이라고 생각해 보세요. 이들은 인터넷 전체로부터 학습했기 때문에, 미키 마우스나 나이키의 "스우시(swoosh)" 로고처럼 이전에 보았던 유명한 것들을 의도치 않게(또는 의도적으로) 복제하곤 합니다.
이 화가들을 만든 회사들은 이러한 저작권이 있는 것들을 그리지 못하도록 "울타리"(IP 가드레일이라고 불림)를 설치했습니다. Sony 팀은 이 질문을 던지고 싶었습니다. 이 울타리는 얼마나 튼튼한가? 실제로 효과가 있는가?
테스트: AI를 위한 "쪽지 시험"
이 울타리를 테스트하기 위해, 팀은 1,809개의 서로 다른 질문으로 구성된 거대한 쪽지 시험을 만들었습니다. 그들은 14개의 서로 다른 AI 화가들에게(무료 및 오픈 소스 모델과 유료 및 비공개 모델 포함) 이 질문들에 기반하여 이미지를 그리도록 요청했습니다.
질문은 두 가지 주요 방식으로 설계되었습니다:
- "직접적인" 요청: "미키 마우스를 그려줘." (캐릭터의 이름을 직접 언급함).
- "우회하는" 요청: "큰 둥근 귀와 빨간 반바지, 노란 신발을 신은 쥐를 그려줘." (이름을 말하지 않고 캐릭터를 묘사하여 울타리를 속이려고 시도함).
그들은 다섯 가지 유형의 "유명한 것들"을 테스트했습니다:
- 실제 유명인 (예: 테일러 스위프트).
- 만화 영웅 및 악당 (예: 슈퍼맨).
- 만화 캐릭터 (예: 스폰지밥).
- 비디오 게임 캐릭터 (예: 마리오).
- 기업 로고 (예: 애플 또는 구글).
또한 그들은 AI가 서구의 유명한 것들(할리우드 스타 등)을 막는 데 동양의 것들(일본 애니메이션 등)보다 더 뛰어난지, 그리고 "매우 유명한" 것을 "덜 유명한" 것보다 더 잘 차단하는지도 확인했습니다.
결과: 울타리의 성능
1. "오픈" 화가들은 울타리가 없었습니다
누구나 자신의 컴퓨터에 다운로드하여 실행할 수 있는 세 가지 "오픈" 모델들은 울타리가 전혀 없었습니다. 유명한 로고나 유명인을 그려달라고 요청하면, 그들은 그냥 그려버렸습니다. "안 된다"라고 말하지 않았습니다.
2. "비공개" 화가들은 울려한 울타리가 있었지만, 흔들거렸습니다
아마존, 구글, OpenAI와 같은 11개의 유료 비공개 모델들은 울타리를 가지고 있었습니다. 하지만 울타리의 강도는 매우 다양했습니다:
- 엄격한 경비원: 한 모델(아마존의 Titan Image G2)은 요청의 약 **50%**에 대해 "안 된다"라고 답했습니다. 매우 잘 차단했습니다.
- 관대한 경비원: 다른 회사의 모델들(Stability AI)은 요청의 2% 미만에 대해서만 "안 된다"라고 답했습니다. 거의 모든 것을 통과시켰습니다.
3. "로고" 루프홀(허점)
여기 매우 놀라운 부분이 있습니다. 울타리는 상업적 로고를 막는 데 형편없었습니다.
가장 엄격한 모델조차도 로고(예: 애플 로고)를 그려달라는 요청을 거의 항상 통과시켰습니다. 마치 울타리에 브랜드 이름을 위한 거대한 구멍이 뚫려 있는 것 같았습니다. 팀은 로고가 가장 빈번하게 생성되는 "유명한" 항목이라는 것을 발견했습니다.
4. "이름" 기술
사용자가 직접적으로 요청했을 때("원더우먼을 그려줘"), 모델들은 "안 된다"라고 할 가능성이 훨씬 높았습니다.
하지만 사용자가 캐릭터의 이름을 말하지 않고 묘사했을 때("빨간색과 파란색 슈트를 입고 황금 올가미를 든 키 큰 여성을 그려줘"), 모델들은 훨씬 더 기꺼이 "알겠다"라고 하며 그녀를 그려냈습니다. 이는 울타리가 실제 만들어지는 그림을 이해하는 것이 아니라, 주로 "금지 목록"에 있는 특정 이름들을 체크하고 있다는 것을 시사합니다.
5. 유명함 vs 생소함
팀은 모델들이 매우 유명한 것(예: 배트맨)을 덜 유명한 것보다 더 잘 차단하는지 궁금해했습니다.
- 거절: 모델들은 인지도에 크게 개의치 않았습니다. 유명한 것과 덜 유명한 것을 비슷한 비율로 차단했습니다.
- 성공: 그러나 모델이 무언가를 실제로 그려냈을 때, 그들은 매우 유명한 것들을 성공적으로 그려낼 확률이 훨씬 높았습니다. 매우 유명한 얼굴을 인식하고 재현하는 것이 덜 유명한 얼굴보다 쉽기 때문입니다.
"판사" (답변을 확인하는 방법)
결과를 채점하기 위해, 팀은 인간이 모든 그림을 보게 하지 않았습니다(그것은 시간이 너무 오래 걸릴 것입니다). 대신, 그들은 매우 똑똑한 AI "판사"(시각-언어 모델)를 사용하여 생성된 이미지를 보고 "네, 그것은 유명한 것을 닮았습니다" 또는 "아니요, 그것은 그냥 일반적인 그림입니다"라고 말하게 했습니다.
- 이 "판사"는 꽤 유능했지만 완벽하지는 않았습니다. 일반적인 그림을 유명한 것으로 착각하거나, 미묘한 복제를 놓치기도 하는 엄격한 선생님과 같았습니다.
결론
2026년 3월 현재, 보고서는 일부 회사들이 AI가 유명한 것들을 복제하는 것을 막기 위해 울타리를 구축하려 노력하고 있지만, 그 울타리는 그리 강하지 않다고 결론짓습니다.
- 대부분의 모델은 여전히 인식 가능한 유명 캐릭터와 로고를 생성합니다.
- 로고는 생성하기 가장 쉽습니다.
- 특정 이름을 사용하지 않으면, 모델은 유명한 것을 그려줄 가능성이 훨씬 높습니다.
- "오픈" 모델들은 울타리가 전혀 없습니다.
저자들은 이것이 단지 현재의 스냅샷일 뿐이라고 경고합니다. 울타리는 내일 더 강해질 수도 있고, 모델들은 이를 우회하는 법을 더 잘 배우게 될 수도 있습니다. 하지만 지금 당장은, 유명한 캐릭터나 로고를 그리고 싶다면 이 AI 도구들은 여전히 기꺼이 당신을 위해 그것을 해줄 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.