Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed
본 입장 표명서는 보편적 독성 탐지기가 왜 난쟁이증이나 시각 장애와 같은 소외된 공동체를 보호하는 데 실패하는지를 논하며, 프롬프트 기반 적응과 미세 조정을 통해 유해성 인식을 크게 개선하는 커뮤니티 특화형 독성 탐지가 여전히 범용 시스템의 성능 수준에 도달하기 위해서는 상당한 연구가 필요함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 마법의 미술관을 걷고 있다고 상상해 보세요. 이곳의 벽은 살아있는 물감으로 만들어져 있습니다. 이 미술관은 평범한 곳이 아닙니다. 당신의 가장 기발한 말들을 즉시 그림으로 바꿔놓는 초지능 로봇 화가에 의해 움직입니다. 만약 당신이 "모자를 쓴 고양이"라고 말하면, 로봇은 모자를 쓴 고양이를 그려냅니다. '텍스트-투-이미지(Text-to-Image)' 생성이라고 불리는 이 기술은 마치 시각적인 소원을 들어주는 디지털 지니와 같습니다. 하지만 이 강력한 도구도 때로는 실수를 할 수 있습니다. 가끔은 무섭거나, 폭력적이거나, 혹은 아주 무례한 것을 그려내기도 합니다. 이를 막기 위해 과학자들은 "안전 가드(safety guards)"를 만들었습니다. 이들은 그림이 벽에 걸리기 전 모든 그림을 검사하는 디지털 보안요원입니다. 만약 보안요원이 나쁜 것을 발견하면, 그 그림을 차단합니다.
오랫동안 이 보안요원들은 "하나의 규칙으로 모두를 적용하는(one-size-fits-all)" 규칙 책을 가지고 훈련되어 왔습니다. 그들은 폭력이나 혐오 표현 같은 명백히 나쁜 것들을 찾아내도록 교육받았습니다. 이는 마치 보안 요원에게 오직 무기를 소지한 사람만을 찾으라고 가르치는 것과 같습니다. 하지만 위험이 꼭 무기뿐일까요? 만약 위험이 더 미묘하고, 특정 집단만이 알아챌 수 있는 상처를 주는 고정관념이라면 어떨까요? 이 논문은 바로 그 문제를 파고듭니다. 이 논문은 다음과 같이 질문합니다. "만약 안전 가드가 칼을 찾는 데 너무 바빠서, 휠체어 사용자의 다리를 바퀴로 그리거나, 책을 읽고 있는 시각장애인의 눈을 가리개로 가려버린 그림을 놓친다면 어떻게 될까?" 연구진은 우리에게 새로운 종류의 안전 가드가 필요하다고 주장합니다. 즉, 모두에게 똑같은 일반적인 규칙을 적용하는 것이 아니라, 각 공동체의 구체적이고 독특한 규칙을 이해할 수 있는 안전 가드가 필요하다는 것입니다.
문제점: "보편적" 보안요원은 졸고 있다
연구진은 현재 최고 수준의 안전 가드(소위 "최첨단(State-of-the-Art)" 탐지기)를 두 가지 특정 공동체, 즉 시각장애인(BLV)과 왜소증(DWF) 환자들을 대상으로 테스트했습니다. 그들은 이 공동체들의 실제 프롬프트를 기반으로 한 2,400개의 이미지를 생성했습니다. AI에게 이들이 요리하거나, 일하거나, 놀이하는 등의 일상적인 모습을 보여달라고 요청한 것입니다.
그 후, 연구진은 다섯 명의 장애 전문가들에게 이 이미지들을 보여주고 잘못되었거나 해로운 부분이 있는지 지적해 달라고 요청했습니다. 전문가들은 충격적인 격차를 발견했습니다. 현재의 안전 가드들이 이 이미지들에 "안전함"이라는 승인 도장을 찍어주었음에도 불구하고, 전문가들은 그중 **35%**가 실제로 해롭다는 것을 발견했습니다.
여기서 "해롭다"는 것이 구체적으로 무엇을 의미하는지 예를 들어보겠습니다:
- 시각장애인 공동체의 경우: AI가 사람의 눈을 로봇처럼 금속성 눈으로 그리거나, 안내견에게 눈가리개를 씌우거나(우스꽝스럽고 혼란스러운 상황), 지팡이를 요리용 숟가락처럼 사용하는 모습을 묘사할 수 있습니다.
- 왜소증 공동체의 경우: AI가 왜소증이 있는 성인을 아기처럼 그리거나, 그들을 동화 속 난쟁이 같은 판타지 캐릭터로 만들거나, 왜소증이 있는 여성이 수염을 기른 모습으로 묘사할 수 있습니다.
이것들은 단순한 "실수"가 아닙니다. 이는 해로운 생각을 강화하는 깊은 고정관념적 오류입니다. 논문은 현재의 "보편적" 탐지기들이 이러한 특정 유형의 해로움에 대해 완전히 눈이 멀어 있음을 보여줍니다. 연구진이 새로운 특정 규칙을 사용하여 이 이미지들을 검사하도록 요청했을 때, 탐지기들은 처참하게 실패했습니다. 사실, 그들의 성능은 무작위 추측보다도 못한 경우가 많았습니다. 이는 마치 총을 찾는 법만 배운 보안요원에게 가짜 수염을 찾아내라고 요구하는 것과 같습니다. 그들에게는 적절한 도구가 없는 것입니다.
해결책: 가드에게 특정 규칙을 가르치기
"보편적" 보안요원이 작동하지 않았기 때문에, 팀은 전체 로봇을 처음부터 다시 만드는 대신 AI에게 새로운 기술을 가르치는 방법을 시도했습니다. 그들은 안전 가드를 특정 공동체에 맞게 조정하는 세 가지 다른 방법을 테스트했습니다:
- "보여주고 말하기" 방식 (In-Context Learning): AI에게 나쁜 그림의 예시 몇 개를 보여주며 이렇게 말하는 것을 상상해 보세요. "이것 봐, 이건 X 때문에 나쁜 거야. 이제 이 새로운 그림을 봐." 이 방법은 약간의 도움이 되었고 탐지 점수를 개선했지만, 일관성이 없었습니다. 어떤 때는 AI가 맞혔지만, 어떤 때는 여전히 혼란스러워했습니다.
- "심문하기" 방식 (Visual Question Answering): 단순히 "이것이 안전한가?"라고 묻는 대신, 연구진은 AI에게 "이 사람은 수염을 기르고 있는가?" 또는 "눈이 현실적인가?"와 같은 일련의 구체적인 질문을 던졌습니다. 만약 AI가 나쁜 것에 대해 "예"라고 답하면, 그 그림은 차단되었습니다. 이 방법은 훨씬 더 효과적이었습니다! 이는 AI가 세부 사항을 면밀히 살피도록 강제했습니다. 왜소증 공동체의 경우, 이 방법은 탐지 점수를 훨씬 유망한 수준으로 끌어올렸습니다.
- "학습 세션" (Fine-Tuning): 이것은 AI가 약 100개의 사례로 구성된 아주 작은 데이터셋을 사용하여 짧은 집중 학습을 하는 단계입니다. 그들은 AI에게 이 공동체들을 위한 특정 규칙을 가르쳤습니다. 이는 더 작은 규모의 AI 모델들에게 가장 효과적인 방법이었으며, 성능을 크게 향상시켰습니다.
함정: 생각보다 어렵다
이러한 방법들이 개선을 가져왔지만, 논문은 우리가 아직 문제를 해결하지 못했다는 점을 매우 분명히 하고 있습니다. 최선의 방법을 사용하더라도, 특정 해로움을 포착하는 AI의 능력은 일반적인 나쁜 것을 포착하는 능력에 비해 여전히 훨씬 낮습니다. 연구진은 AI가 변화에 매우 민감하다는 것을 발견했습니다. 만약 공동체가 "사실, 우리는 저 특정한 것은 더 이상 해롭지 않다고 생각해요"라고 말한다면, 기존 규칙으로 훈련된 AI는 혼란에 빠지고 빠르게 적응하지 못합니다.
논문은 우리가 진전을 이루기는 했지만, 사회적 약자 공동체를 진정으로 존중하고 보호하는 안전 시스템을 구축하는 것은 엄청난 도전 과제라고 결론짓습니다. 그것은 단지 더 나은 규칙 책을 쓰는 것만이 아닙니다. 그것은 AI 개발자와 해당 공동체 사이의 지속적이고 진화하는 파트너십을 필요로 합니다. "하나의 규칙으로 모두를 적용하는" 방식은 공식적으로 끝났습니다. AI 안전의 미래는 특정 공동체의 이해를 바탕으로 한 조각보(patchwork) 형태가 되어야 합니다. 연구진은 우리가 이 작업을 계속 수행해야 한다고 제안합니다. 왜냐نا, 우리가 이러한 미묘한 해로움을 신뢰성 있게 탐지할 수 있을 때까지, 우리가 보는 "안전한" 이미지들은 여전히 실제 사람들에게 상처를 주는 고정관념을 강화할 수 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.