생성형 AI 는 마치 마법 지팡이와 같습니다. 이 지팡이를 손에 든 사람은 무엇이든 쉽게 만들어낼 수 있습니다.
공격자 (나쁜 사람): 이 지팡이로 가짜 뉴스, 위조된 사진, 정교한 사기 수법을 순식간에 대량 생산할 수 있게 되었습니다.
수비수 (안전 관리자): 이 지팡이로 해로운 내용을 찾아내거나, 피해자를 돕는 메시지를 만들어낼 수도 있습니다.
하지만 문제는 공격자가 먼저 마법 지팡이를 더 많이, 더 빠르게 사용하고 있다는 점입니다.
⚔️ 1. 공격자의 힘: "악당들의 공장화"
연구에 따르면, 나쁜 사람들은 AI 를 이용해 다음과 같이 악행을 저지르고 있습니다.
대량 생산 공장: 예전에는 사기꾼이 한 명당 하루에 100 통의 편지를 썼다면, 이제는 AI 가 100 만 통을 보내도 됩니다. 마치 수제 공예품에서 공장의 컨베이어 벨트로 변한 셈입니다.
문턱이 낮아짐: 예전에는 가짜 사진을 만들려면 포토샵 실력이 필요했지만, 이제는 초등학생도 AI 앱 하나로 쉽게 만들 수 있습니다. 악당들이 늘어날 수밖에 없는 환경이 된 것입니다.
정교한 미끼: AI 는 특정 사람의 말투를 흉내 내거나, 유머러스한 밈 (Meme) 을 만들어 사람들을 속입니다. 마치 가짜 뉴스가 유쾌한 농담처럼 포장되어 퍼지는 것과 같습니다.
정보 환경의 오염: "진짜인지 가짜인지 알 수 없는" 콘텐츠가 넘쳐나면서, 사람들은 "아마도 다 가짜겠지?"라고 의심하게 되어, 진짜 진실조차 믿지 않는 세상이 될 위험이 있습니다.
🛡️ 2. 수비수의 힘: "AI 를 이용한 반격"
하지만 수비수들도 이 마법 지팡이를 이용해 싸울 계획을 세우고 있습니다.
초고속 탐지기: 사람이 일일이 모든 글을 읽을 수는 없지만, AI 는 수백만 개의 글을 순식간에 스캔하여 위험한 내용을 찾아낼 수 있습니다.
수사관들의 조력자: 사기나 테러 조직의 자금 흐름, 네트워크를 분석할 때 AI 가 수사관에게 "이곳을 파보세요"라고 힌트를 줄 수 있습니다.
수비수들의 심리 보호: 수비수들은 매일 끔찍한 콘텐츠 (아동 성착취물, 폭력 영상 등) 를 보며 정신적 고통을 겪습니다. AI 가 가장 끔찍한 것들을 먼저 걸러내면, 인간 수비수는 더 중요한 판단만 하면 되어 정신 건강을 지키는 데 도움이 됩니다.
달콤한 반격 메시지: 공격자가 선동하는 메시지를 AI 가 분석하면, 수비수는 **더 매력적이고 설득력 있는 '반대 메시지'**를 만들어 사람들을 구할 수 있습니다. 마치 나쁜 유혹을 이길 수 있는 더 좋은 유혹을 주는 것과 같습니다.
🌍 3. 분야별 상황: "모든 게임이 같은 것은 아니다"
논문은 각 분야마다 상황이 조금씩 다르다고 말합니다.
분야
상황 설명 (비유)
아동 안전
가장 위급한 상황. AI 가 가짜 아동 성착취물을 무한정 만들어내자, 기존에 쓰던 '지문 (해시)'으로 찾는 방식이 무용지물이 되었습니다. 시스템을 아예 새로 짜야 할 위기입니다.
선거
이미 가짜 뉴스가 넘쳐나는 상태에서 AI 가 더 정교하게 만들었습니다. 진짜와 가짜를 구별하기가 더 어려워졌지만, 근본적인 해결책은 여전히 부족합니다.
사기
공방전이 치열합니다. 사기꾼이 AI 로 더 똑똑해지면, 수비수도 AI 로 더 똑똑하게 잡아야 합니다. 기술 전쟁이 계속될 것입니다.
혐오/괴롭힘
AI 가 더 많은 사람이 더 쉽게 괴롭힐 수 있게 만들었습니다. 하지만 AI 가 다양한 언어와 문화적 뉘앙스를 이해하면, 수비수들이 더 잘 막을 수 있을지도 모릅니다.
테러
AI 가 선동 영상을 만들고, 사람을 모집하고, 심지어 3D 프린터로 무기 설계도를 만들게 할 수도 있습니다. 공격 사슬의 모든 단계에서 AI 가 쓰입니다.
💡 4. 결론: 어떻게 해야 할까요?
이 연구는 다음과 같은 중요한 메시지를 전달합니다.
한 번에 해결될 수 없다: 모든 분야에 똑같은 해결책을 적용할 수 없습니다. 아동 안전, 선거, 사기 등 분야마다 다른 전략이 필요합니다.
협력의 중요성: 구글 같은 기술 기업, 경찰, 정부, 시민 단체가 서로 정보를 공유하지 않으면 AI 의 힘을 이길 수 없습니다. 마치 여러 나라가 힘을 합쳐 바이러스를 막아야 하는 것과 같습니다.
기술의 양면성: AI 는 위험하지만, 동시에 위험을 막을 가장 강력한 도구가 될 수도 있습니다. 우리는 AI 를 막기만 할 게 아니라, 수비수들이 AI 를 잘 쓸 수 있도록 돕는 시스템을 만들어야 합니다.
한 줄 요약:
"생성형 AI 는 나쁜 사람들에게는 '무한한 악의 공장'이 되지만, 좋은 사람들에게는 '초강력 방패'가 될 수도 있습니다. 지금 당장 수비수들이 이 방패를 잘 다룰 수 있도록 도와주지 않으면, 인터넷은 혼란의 늪으로 빠질 수 있습니다."
1. 연구 배경 및 문제 정의 (Problem)
배경: 생성형 AI(LLM 및 프론티어 모델) 는 텍스트, 이미지, 오디오, 비디오 등을 고품질로 생성할 수 있어 경제, 교육 등 다양한 분야를 혁신할 것으로 기대됩니다. 그러나 동시에 온라인 상의 유해 콘텐츠와 악성 행위를 생성하고 확산시키는 데에도 활용될 수 있습니다.
문제: 기존 연구는 AI 모델의 오용을 방지하기 위한 기술적 안전장치 (Guardrails) 에 집중해 왔으나, 공격자와 방어자 간의 사회기술적 (Sociotechnical) 균형이 GenAI 와 함께 어떻게 진화할지에 대한 포괄적인 이해는 부족했습니다.
핵심 질문: GenAI 는 현재 및 미래에 신뢰 및 안전 분야 (Trust & Safety) 에 어떤 영향을 미치며, 공격자와 방어자 간의 경쟁 구도는 어떻게 변화할 것인가?
2. 연구 방법론 (Methodology)
연구 설계: 참여적 연구 (Participatory Research) 워크숍을 기반으로 한 질적 연구 (Qualitative Study).
참여자: 아시아, 유럽, 북미 지역의 5 개 주요 도메인에서 활동하는 43 명의 전문가 (산업계, 시민사회, 학계, 법집행기관 등).
5 개 도메인: 아동 안전 (Child Safety), 선거 무결성 (Election Integrity), 혐오 및 괴롭힘 (Hate & Harassment), 사기 (Scams), 폭력적 극단주의 (Violent Extremism).
프로세스:
각 도메인별로 6 시간 동안 워크숍을 진행 (2024 년 3 월 ~ 2025 년 1 월).
활동: GenAI 교육, 기억에 남는 경험 카드 작성, 변화 카드 (Change Cards) 를 통한 미래 예측, 공격자 활용 시나리오 토론, '미래 이야기 (Futuring Stories)' 작성 등.
분석: 반성적 주제 분석 (Reflexive Thematic Analysis) 을 통해 워크숍 녹취록, 생성된 카드 및 이야기, 비디오 클립을 코딩하고 주제를 도출했습니다.
3. 주요 기여 (Key Contributions)
다양한 도메인에 대한 최초의 포괄적 질적 연구: 5 개의 핵심 신뢰 및 안전 도메인에서 GenAI 의 현재 및 미래 영향을 전문가 관점에서 탐구.
'공격자와 방어자의 동시 강화'라는 지배적 내러티브 도출: 모든 도메인의 전문가들이 GenAI 가 양측을 모두 강화한다는 점에 동의함을 확인.
점진적 경쟁 구도 (Escalating Competition) 모델 제시: 초기에는 공격이 방어 시스템을 압도하지만, 이후 방어 기술이 발전하여 대응할 것이라는 관점.
도메인별 구조적 차이 강조: 각 도메인마다 해악의 성격과 공격 규모가 다르므로, '일률적 (One-size-fits-all)' 접근이 아닌 도메인별 맞춤형 개입이 필요함을 시사.
전략적 프레임워크 제안: GenAI 시대에 신뢰 및 안전 조직이 운영 방식을 전환하고 책임 있는 사용을 위한 경로를 제시.
4. 주요 결과 (Key Results)
A. 공격자 (Attackers) 의 역량 강화
GenAI 는 해악의 **규모 (Scale), 속도 (Speed), 진입 장벽 하향 (Lowered Barriers)**을 극적으로 증가시킵니다.
규모와 속도: 기존 수동 방식보다 훨씬 빠르고 저렴하게 대량의 유해 콘텐츠 (예: CSAM, 스토킹 메시지, 사기성 콘텐츠) 를 생성 가능. 단일 공격자가 수천 명의 대상에게 맞춤형 공격을 수행 가능.
진입 장벽 하향: 전문 기술 없이도 '재일킹 (Jailbreaking)'이나 오픈소스 모델을 통해 유해 콘텐츠 생성 가능. 이는 개별 범죄자부터 조직 범죄, 국가 주체까지 공격자 풀을 확대.
고도화된 메시지: 다국어 동시 생성, 맞춤형 프로파간다, 심층 위조 (Deepfake) 를 통한 신뢰성 확보. 특히 '엔터테인먼트'를 활용한 유해 콘텐츠 (예: 폭력적 밈, 애니메이션) 는 검열을 우회하기 쉬움.
정보 환경의 악화: '거짓말의 배당 (Liar's Dividend)' 현상 발생. 실제 증거가 있어도 "그것은 딥페이크다"라고 주장하며 진실을 부정하는 전략 사용.
유해한 AI 동반자: 고립된 사용자를 대상으로 한 AI 챗봇이 극단주의 선동이나 사기 (로맨스 스캠) 에 악용될 위험.
B. 방어자 (Defenders) 의 역량 강화
방어자들도 GenAI 를 활용해 유해 콘텐츠를 탐지, 완화, 조사하는 데 활용 가능.
대규모 탐지 및 완화: GenAI 를 이용한 자동화된 콘텐츠 분류 및 필터링으로 처리량 증가 대응. 특히 언어적 뉘앙스나 문화적 맥락을 이해하는 모델 개발 기대.
수사 가속화: 범죄 네트워크 분석, 자금 흐름 추적, 공격 패턴 식별 등 복잡한 수사 과정을 AI 로 지원. (예: 테러 조직 분쇄 계획 수립 시나리오)
모더터 (Moderator) 웰빙 개선: AI 가 초기 필터링을 수행하여 인간 모더터가 가장 트라우마가 심한 콘텐츠 (CSAM 등) 에 노출되는 빈도를 줄이고, 복잡한 판단이 필요한 사례에 집중하도록 지원.
반대 내러티브 (Counternarrative) 및 지원: 유해 콘텐츠에 노출된 사용자에게 설득력 있는 반대 메시지를 생성하거나, AI 챗봇을 통해 피해자에게 정서적 지원 및 대응 가이드 제공.
부문 간 협력 촉진: GenAI 위협이 플랫폼, 정부, 시민사회 간 데이터 공유 및 협력 체계를 강화하는 계기가 될 것임.
C. 도메인별 특수성 (Domain-Specific Nuances)
아동 안전: 해시 기반 (Hash-based) 검출 시스템이 GenAI 로 생성된 무한한 새로운 이미지 앞에서 무력화될 위험. 시스템의 근본적 재구성이 필요.
선거 무결성: 기존에 존재하던 저질 정보 환경이 GenAI 로 인해 더욱 악화될 수 있으나, 근본적인 정치적/사회적 문제가 더 큼.
사기: 공격과 방어 모두 비용 절감과 규모 확장이 가능하여 현재 '군비 경쟁 (Arms Race)' 구도가 유지되나, 국제적 협력 체계 강화 필요.
폭력적 극단주의: 유해 콘텐츠 생성부터 모집, 자금 조달, 공격 실행까지 전체 공격 체인 (Attack Chain) 에서 GenAI 활용 가능.
5. 의의 및 시사점 (Significance)
운영 전략의 전환 필요: 신뢰 및 안전 조직은 GenAI 위협에 대응하기 위해 기존 운영 매뉴얼을 재검토하고, 도메인별 맞춤형 실험과 인력 양성이 필수적입니다.
책임 있는 AI (Responsible AI) 의 역할: 단순한 콘텐츠 필터링을 넘어, 방어적 사용 (예: 수사 지원, 반대 내러티브 생성) 을 허용하면서도 악용을 막는 정교한 안전장치 (Guardrails) 와 벤치마크 개발이 필요합니다.
기술적 한계와 기회: 현재는 공격이 방어보다 앞서 있으나, GenAI 를 활용한 고급 방어 기술이 발전하면 균형이 다시 잡힐 수 있다는 낙관적 전망 제시.
정책적 제언: 플랫폼, 정부, 학계 간의 긴밀한 협력과 데이터 공유 체계 구축이 GenAI 시대의 온라인 안전을 위해 핵심적입니다.
이 논문은 GenAI 가 단순히 새로운 위협이 아니라, 신뢰 및 안전 생태계의 구조를 근본적으로 바꾸는 '이중적 힘 (Dual-use technology)'임을 강조하며, 이에 대한 전략적이고 협력적인 대응의 중요성을 역설합니다.