당신은 누구나 AI 예술 생성기를 위한 커스텀 "필터"(LoRA 라고 함) 를 업로드할 수 있는 거대한 디지털 도서관을 관리하는 사서라고 상상해 보세요. 이러한 필터는 AI 의 스타일을 변경하여 풍경부터 불행히도 아동 성착취물 (CSAM) 과 같은 불법적이고 해로운 콘텐츠에 이르기까지 무엇이든 그리도록 만들 수 있습니다.
보통 필터가 위험한지 확인하려면 AI 에게 해당 필터를 사용하여 "그림을 그리게" 한 다음 결과를 살펴봐야 합니다. 하지만 엄청난 문제가 있습니다. AI 에게 CSAM 을 그리도록 요청하는 것은 법적으로 불가능합니다. 많은 지역에서 이를 생성해 보려고 시도하는 것만으로도 범죄가 됩니다. furthermore, 수백만 개의 업로드가 있는 도서관에서 하나씩 확인하기 위해 AI 에게 수천 장의 이미지를 그리게 하는 것은 너무 느리고 비용이 많이 듭니다.
이것은 딜레마를 만듭니다. AI 에게 단 한 번도 그림을 그리게 하지 않고서도 필터가 위험한지 어떻게 확인할 수 있을까요?
해결책: "가우시안 프로빙"(X-선 시력)
저자들은 가우시안 프로빙이라는 새로운 방법을 제안합니다. AI 에게 그림을 그리게 하는 대신, AI 가 무작위 정적 (잡음) 을 볼 때 AI 의 뇌가 어떻게 생각하는지 "듣는" 것입니다.
다음은 비유입니다:
구식 방법 (생성적 평가): 용의자에게 "너가 쿠키를 훔쳤니?"라고 묻고 "예" 또는 "아니오"라고 대답하거나 쿠키를 만들어 내기를 기다립니다. 이는 느리고 위험하며 때로는 불법입니다.
신규 방법 (가우시안 프로빙): 쿠키를 요구하지 않습니다. 대신 용의자에게 빈 정적 (잡음) 이 가득 찬 TV 화면을 건네고 그것을 처리하도록 요청합니다. 그런 다음 용의자가 그 정적을 볼 때 뇌에서 발생하는 전기 신호를 듣습니다.
만약 그들의 뇌 신호가 특정 방식으로 변한다면, 그들이 실제로 쿠키를 만들어 내지 않았더라도 그들의 "정신 모델"이 쿠키 (이 경우 해로운 콘텐츠) 로 훈련되었음을 드러냅니다.
단계별 작동 원리
입력: 시스템은 AI 모델에 무작위이고 의미 없는 정적 (가우시안 잡음) 을 공급합니다. 이는 AI 에게 빈 정지 화면을 보여주는 것과 같습니다.
처리: AI 는 그 정적을 이미지로 변환하려는 일반적인 과정을 시작하지만, 시스템은 아무런 이미지도 생성되기 전에 이를 중단시킵니다.
측정: AI 가 정적을 "생각"하는 동안 시스템은 AI 뇌 계층 내부의 전기 신호 (활성화) 를 기록합니다.
진단: 시스템은 이러한 신호를 데이터베이스와 비교합니다.
신호가 "정상적인" 예술가의 뇌와 유사하면 필터는 안전합니다.
신호가 해로운 데이터로 훈련되어 발생한 특정 "왜곡" 패턴을 보이면 필터는 위험한 것으로 표시됩니다.
왜 코드만 보는 것보다 나은가
연구자들은 두 가지 방법을 테스트했습니다:
가중치 확인 (원시 가중치): 이는 레시피 책의 재료 목록을 보는 것과 같습니다. 때로는 셰프가 5g 대신 500g 의 소금을 사용한 것을 보아 레시피가 "나쁜" 요리를 위한 것임을 알 수 있습니다. 하지만 영리한 셰프는 숫자를 약간만 변경하여 소금을 숨길 수 있으며, 레시피는 여전히 맛이 나쁩니다.
가우시안 프로빙: 이는 반죽을 맛보는 것과 같습니다. 셰프가 레시피의 숫자를 변경하더라도 반죽이 숟가락에 반응하는 방식 (내부 신호) 은 여전히 그것이 "나쁜" 요리인지 여부를 드러냅니다.
논문의 발견:
효과성: 이 방법은 다양한 유형의 AI 모델 (SD 1.5, SDXL, FLUX) 에서 해로운 콘텐츠 (NSFW 및 CSAM) 로 훈련된 필터를 성공적으로 식별했습니다.
강건성: 연구자들은 시스템을 속이기 위해 가중치를 "재조정"(소금을 숨기기 위해 레시피의 숫자 변경) 했습니다. "원시 가중치" 방법은 숫자가 변경되면 완전히 실패했지만, 가우시안 프로빙은 여전히 작동했습니다. 이는 단순히 페이지의 숫자가 아니라 AI 가 어떻게 기능하는지를 보았기 때문입니다.
속도: 이미지를 생성하지 않으므로 매우 빠르게 수행할 수 있어, 대중과 공유되기 전에 수천 개의 업로드를 스크리닝할 수 있습니다.
결론
이 논문은 AI 필터를 위한 "거짓말 탐지기"를 소개합니다. 이 방법은 모델이 무작위 잡음에 어떻게 반응하는지 분석함으로써 플랫폼이 업로드된 AI 모델에서 위험한 기능 (특히 아동 성착취와 관련된 기능) 을 스캔할 수 있게 하며, 단 하나의 불법 이미지도 생성하지 않습니다. 이는 법을 위반하거나 시스템을 느리게 하지 않고 더 안전한 AI 플랫폼을 가능하게 하는 주요 법적 및 안전 병목 현상을 해결합니다.
다음은 "생성 없이 평가: CSAM 적용을 위한 유해 모델 전문화 비생성적 평가" 논문에 대한 상세한 기술 요약입니다.
1. 문제 정의
본 논문은 오픈 가중치 생성형 AI 생태계 (예: CivitAI, Hugging Face) 에서의 중요한 거버넌스 과제를 다룹니다: 유해한 전문화 (harmful specialization) 를 가진 사용자 업로드 모델 어댑터 (특히 LoRA) 를 생성 출력 없이 감사하는 방법.
제약 조건: 전통적인 안전 감사는 "생성적 평가 (모델에 프롬프트를 입력하고 출력을 검사)"에 의존합니다. 이 접근법은 두 가지 이유로 실패합니다:
확장성: 업로드되는 양 (월간 수십 만 개의 LoRA) 을 처리할 수 없습니다.
합법성: **아동 성착취물 (CSAM)**과 같은 특정 고위험 도메인의 경우, 테스트 목적이라 하더라도 그러한 콘텐츠를 생성하는 것은 미국을 포함한 많은 관할권에서 불법입니다.
목표: 저자들은 "생성 없이 평가 (Evaluation without Generation)" 문제를 정의합니다: 한 번도 이미지를 생성하지 않고 모델의 가중치나 내부 표현만을 분석하여 모델이 유해한 콘텐츠 (NSFW 또는 CSAM) 를 위해 전문화되었는지 여부를 판단하는 것입니다.
요구 사항: 해결책은 다음과 같아야 합니다:
비생성적: 출력 디코딩이나 이미지 렌더링이 없어야 합니다.
확장성: 전체 매개변수 검사에 비해 저장/연산 비용이 낮아야 합니다.
강건성: 적대자가 쉽게 모방할 수 있는 부수적인 **학습 아티팩트 (학습률, 랭크, 또는 데이터셋 특유의 기이함 등)**가 아닌 콘텐츠 전문화를 감지해야 합니다.
2. 방법론: 가우시안 프로빙 (Gaussian Probing)
저자들은 LoRA 어댑터가 기본 확산 모델을 어떻게 교란시키는지를 특성화하는 기능적 표현 방법인 가우시안 프로빙을 제안합니다.
핵심 메커니즘
원시 가중치를 분석하거나 이미지를 생성하는 대신, 이 방법은 무작위 노이즈를 사용하여 모델의 내부 상태를 프로빙합니다:
참조 앙상블:m개의 독립적인 가우시안 노이즈 벡터 (ν∼N(0,I)) 를 샘플링합니다. 이들은 확산 과정에 내재된 "프롬프트 없는" 참조 상태로 작용합니다.
순전파 (Forward Pass): 이러한 노이즈 벡터를 적응된 모델 (fθbase+Δ) 을 통해 T개의 탈노이즈 단계를 거쳐 전파합니다.
활성화 추출: 각 시간 단계에서 특정 레이어 (예: U-Net 의 중간 블록) 에서 중간 은닉 표현 (H(t)) 을 추출합니다.
집계: 이러한 활성화를 시간 단계와 레이어에 걸쳐 풀링하여 고정 차원의 특징 벡터 Φ(Δ)를 생성합니다.
수학적으로, 이는 LoRA 교란이 모델의 탈노이즈 역학을 통해 기대되는 푸시포워드 (pushforward) 를 추정합니다: Ψ(Δ)=Eν[Hˉ(Δ;ν)].
분류: 이러한 특징 벡터에 대해 간단한 분류기 (예: 로지스틱 회귀) 를 훈련시켜 무해한 (SFW) 것과 유해한 (NSFW/CSAM) 전문화를 구분합니다.
왜 가우시안 프로빙인가?
기능적 신호: 정적 가중치 값이 아니라 모델이 고유한 잠재 공간에서 수행하는 계산을 LoRA 가 어떻게 변경하는지 측정합니다.
강건성: 프로브가 무작위이며 학습 데이터와 무관하기 때문에, 결과 신호는 표면적인 학습 아티팩트 (예: 특정 하이퍼파라미터 또는 데이터셋 편향) 가 아닌 전문화의 **기능적 영향 (콘텐츠)**을 반영합니다.
3. 주요 기여
"생성 없이 평가"의 형식화: CSAM 감지의 법적 및 윤리적 제약을 특히 대상으로 하여, 가중치 상태 추론을 통한 모델 능력 감시 문제를 공식적으로 정의합니다.
가우시안 프로빙 알고리즘: 이미지 생성 없이 LoRA 의 "기능적 서명"을 추출하는 새로운 확장 가능한 방법입니다.
실증적 검증: 가우시안 프로빙이 적대적 가중치 조작에 대한 강건성 측면에서 특히 유해 모델과 무해 모델을 구분하는 데 원시 가중치 베이스라인보다 우수함을 보여주는 포괄적인 실험.
실제 CSAM 감지: 실제 CSAM 데이터에 대한 승인된 접근 (실제 불법 이미지 생성 또는 처리 없이) 을 사용하여 검증된, CSAM 전문화 LoRA 를 야생에서 감지하는 최초의 확장 가능한 비생성적 방법.
4. 실험 결과
통제된 연구 (SFW 대 NSFW)
설정: Stable Diffusion 1.5, SDXL, FLUX.1-dev 에서 다양한 데이터셋과 하이퍼파라미터를 사용하여 각 클래스 (SFW/NSFW) 당 1,000 개의 LoRA 를 훈련했습니다.
결과:
분리 가능성: 가우시안 프로빙은 SFW 와 NSFW 를 구분하는 데 높은 AUROC (예: SD 1.5 의 경우 0.998) 를 달성했습니다.
신호 출처: "데이터셋 제외 (Leave-Dataset-Out, LDO)" 테스트에서 원시 가중치 분류기는 잘 수행되었으나 **데이터셋 정체성 (특정 학습 아티팩트)**에 의존했습니다. 가우시안 프로빙은 콘텐츠 신호에 의존하여 데이터셋 특유의 아티팩트가 제거되었을 때도 강건성을 유지했습니다.
적대적 강건성: LoRA 가중치를 단위 프로베니우스 노름으로 재조정하여 크기 정보를 제거했을 때, 원시 가중치 분류기는 크게 저하되었습니다 (AUROC 가 0.92 에서 0.83 으로 하락). 가우시안 프로빙은 강건성을 유지했습니다 (AUROC 가 0.94 로 약간 상승), 이는 가중치 크기가 아닌 기능적 행동을 감지함을 입증했습니다.
야생 연구 (CSAM 감지)
설정: CivitAI 의 실제 세계 LoRA(SFW/NSFW) 와 승인된 CSAM 전문화 LoRA(SD 1.5, SDXL, FLUX.1-dev) 를 평가했습니다.
성능:
CSAM 감지: 가우시안 프로빙은 모든 아키텍처에서 CSAM LoRA 에 대해 **100% 재현율 (recall)**을 달성했습니다.
오탐지: SFW(<1%, SD 1.5/SDXL) 및 NSFW(<4%, FLUX.1-dev) 에 대한 오탐지율이 매우 낮았습니다.
비교: 원시 가중치 베이스라인은 CSAM 데이터의 작은 샘플 크기로 인해 어려움을 겪었으며 (AUROC 약 0.68–0.87), 높은 분산을 보인 반면, 가우시안 프로빙은 안정적이고 고성능의 감지를 제공했습니다.
5. 중요성과 영향
법적 준수: 플랫폼이 그러한 콘텐츠를 생성하는 것에 대한 법률을 위반하지 않고 CSAM 을 스크리닝할 수 있는 법적 실행 가능한 경로를 제공합니다.
확장성: 수백만 개의 업로드에 대한 배포 전 스크리닝을 가능하게 하는, 레드팀링에 대한 계산 효율적인 대안을 제공합니다.
안전 패러다임 전환: AI 안전을 "출력 기반 (반응형)"에서 "상태 기반 (선제적)" 감사로 전환합니다.
광범위한 적용 가능성: CSAM 에 초점을 맞추었지만, 이 방법은 출력 생성이 위험하거나 비윤리적인 다른 제한된 도메인 (예: 생물무기, 사이버 공격) 에도 적용 가능합니다.
미래 연구: "가중치 공간 학습 (weight-space learning)"과 기능적 감시의 기초를 마련하여, 강건한 비생성적 안전 메커니즘에 대한 추가 연구를 장려합니다.
결론
본 논문은 유해한 모델 전문화가 가중치만으로 감지될 수 있음을 성공적으로 입증했습니다. 가우시안 프로빙을 통해 평가를 출력 공간에서 모델의 내부 상태로 전환함으로써, 저자들은 CSAM 및 기타 고위험 전문화에 대한 오픈 가중치 생성형 모델을 스크리닝하는 중요한 문제에 대해 확장 가능하고 강건하며 법적 준수를 갖춘 해결책을 제공합니다.