Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails
이 논문은 언어 모델의 사전 학습 필터와 추론 단계의 가드레일을 감사하여, 이들이 실제 혐오 표현이나 개인정보를 포착하는 데는 실패하면서도 단순한 어휘적 단서에 의존함으로써 소외 계층에 대한 언급을 불균형적으로 삭제하고 있으며, 결과적으로 인간의 판단과 모순되는 일종의 인식적 불의를 초래한다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 세상에 대해 말하고 이해하는 법을 가르치기 위해 거대한 책 도서관을 구축하고 있다고 상상해 보세요. 이 로봇은 '대규모 언어 모델(LLM)'이라고 불리며, 학습을 위해 인터넷에서 수십억 개의 문장을 읽어야 합니다.
하지만 로봇이 읽기 시작하기 전, 인간들은 "나쁜" 책들을 골라내기 위해 (엄격한 사서처럼) 필터를 설치합니다. 그 후 로봇이 사람들과 대화를 시작할 때, 인간들은 로봇이 "안전하지 않은" 말을 하지 못하도록 (안전 검사관처럼) 가드레일을 설치합니다.
이 논문은 이 사서들과 안전 검사관들이 자신의 직무를 얼마나 잘 수행하고 있는지에 대한 감사(audit)—즉, 심층적인 조사—입니다. 연구진은 이들이 로봇을 안전하게 유지하려고 노력하는 과정에서, 의도치 않게 소외된 집단(트랜스젠더, 여성, 중앙아메리카 사람들 등)의 목소리를 지워버리고 있으며, 인간의 판단을 경직되고 종종 잘못된 규칙들로 대체하고 있다는 사실을 발견했습니다.
다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.
1. "금지어"의 함정
연구진은 이러한 안전 시스템 중 상당수가 **아이들의 "나쁜 말 목록"**처럼 작동한다는 것을 발견했습니다.
- 작동 방식: 문장에 특정 "나쁜" 단어(욕설이나 성적인 용어 등)가 포함되어 있으면, 시스템은 문맥을 살피지 않고 즉시 해당 문장을 삭제합니다.
- 문제점: 이는 마치 사서가 신체 부위를 언급했다는 이유만으로 의료 절차에 관한 책을 버리거나, "섹스(sex)"라는 단어를 사용했다는 이유만으로 성 노동자의 권리에 관한 이야기를 삭제하는 것과 같습니다.
- 결과: 이 시스템들은 자신의 "나쁜 말 목록"에 있는 단어를 잡아내는 데는 매우 뛰어나지만, 개인정보 유출, 저작권 침해, 또는 특정 단어를 사용하지 않는 실제 혐오 표현과 같은 실질적인 해악을 포착하는 데는 매우 서툽니다.
2. "과잉 보호" 필터
연구는 이러한 필터들이 특정 집단에 대해 과잉 보호적이며, 마치 특정 종류의 모자를 쓴 사람을 의심하는 경비원처럼 행동한다는 것을 발견했습니다.
- 트랜스젠더: 트랜스젠더 정체성을 언급하는 문장은 시스젠더(non-trans)를 언급하는 문장보다 훨씬 더 자주 삭제 대상으로 분류되었습니다.
- 여성: 여성에 대한 언급은 남성에 대한 언급보다 현저히 더 많이 차단되었습니다.
- 중앙아메리카 사람들: 중앙아메리카 사람들을 언급하는 콘텐츠는 거의 항상 삭제 대상으로 분류된 반면, 서유럽 사람들에 대한 콘텐츠는 거의 손을 대지 않았습니다.
- 비유: 박물관의 보안 요원이 특정 동네에서 온 사람들을 제외한 나머지 사람들은 모두 통과시키지만, 그 동네 사람들은 수상히 여겨 막아서는 상황을 상상해 보세요. 보안 요원이 악의를 가진 것은 아닙니다. 단지 특정 동네의 사람들은 "위험하다"고 가정하는 결함 있는 규칙을 따르고 있을 뿐입니다. 이로 인해 AI(박물관)는 그 동네의 문화를 배울 기회를 잃게 됩니다.
3. 로봇 대 인간
연구진은 인간 자원봉사자들에게 시스템이 분류한 문장들을 보여주며 다음과 같이 물었습니다. "이 문장을 유지해야 할까요, 아니면 삭제해야 할까요?"
- 충격적인 통계: 사전 학습 필터가 삭제하고자 했던 문장에 대해 인간들은 **88.5%**의 확률로 **"유지하라"**고 답했으며, 가드레일이 차단하려 했던 문장에 대해서는 **91.3%**의 확률로 "유지하라"고 답했습니다.
- 비유: 이것은 마치 로봇 요리사가 국물 맛을 보고 특정 허브가 들어갔다는 이유로 "독이 들었다"고 판단하여 냄비 전체를 버리는 것과 같습니다. 반면 인간 요리사는 맛을 보고 그것이 그저 매콤한 국물임을 깨달으며, "아니, 이건 맛있고 안전하게 먹을 수 있어"라고 말하는 것과 같습니다.
- 갈등: 자동화된 시스템은 인간이 실제로 가치 있고 교육적이며 무해하다고 생각하는 콘텐츠를 삭제하고 있습니다. 이러한 문장들을 삭제함으로써, AI는 해당 집단과 그들의 경험을 이해할 능력을 상실하게 됩니다.
4. "침묵의 삭제"
논문은 이를 **"인식론적 삭제(Epistemic Erasure)"**라고 부릅니다.
- 의미: "인식론적(Epistemic)"은 지식과 관련이 있으며, "삭제(Erasure)"는 무언가를 지워 없애는 것을 의미합니다.
- 비유: AI가 세계 지도를 그리고 있다고 상상해 보세요. 필터가 트랜스젠더나 중앙아메리카 사람들에 관한 문장을 계속 삭제하기 때문에, AI가 그리는 지도에는 그들이 있어야 할 자리에 텅 빈 흰색 공간이 생기게 됩니다. AI는 데이터가 삭제되기 전의 모습을 배울 수 없으므로, 그들이 존재한다는 사실이나 그들의 삶이 어떠한지를 문자 그대로 "알지 못하게" 됩니다.
논문의 주장 요약
- 시스템 간의 불일치: 서로 다른 필터와 가드레일은 종종 서로 충돌합니다. 어떤 것들은 다른 것들이 놓치는 것을 잡아내기도 하며, 문맥보다는 단순한 단어 목록에 크게 의존합니다.
- 체계적인 편향: 이것은 단순한 오류가 아니라 하나의 패턴입니다. 서로 다른 기업과 대륙의 시스템들이 모두 동일한 소외 계층을 과도하게 차단하는 경al을 보입니다.
- 인간의 판단과 다름: 인간은 일반적으로 이러한 문장들을 안전하거나 중요하다고 보지만, 기계는 이를 위험하다고 간주합니다.
- 결과: 이러한 자동화된 시스템에 의존함으로써, 우리는 AI가 트랜스젠더, 여성, 특정 지역 사람들의 현실에 눈멀도록 적극적으로 형성하고 있으며, 결과적으로 디지털 세상에서 그들의 목소리를 침묵시키고 있습니다.
논문은 이를 해결하기 위해 단순히 자동화된 "나쁜 말 목록"에 의존해서는 안 된다고 결론짓습니다. 대신, 영향을 받는 당사자들을 의사 결정 과정에 참여시켜야 하며, 단순히 단어 수를 세는 것이 아니라 문맥을 이해하는 시스템을 만들어야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.