Bias in Large Language Models: Origin, Evaluation, and Mitigation
본 논문은 대규모 언어 모델의 편향에 대한 포괄적인 검토를 제시하며, 편향의 기원을 체계적으로 분석하고 데이터, 모델, 출력 수준에 걸친 탐지 방법을 평가하며 완화 전략을 분류하고 동시에 실제 응용 분야에서 편향된 인공지능의 윤리적 및 법적 함의를 논의합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"대규모 언어 모델의 편향: 기원, 평가 및 완화"라는 논문에 대한 설명을 일상적인 비유와 함께 간단한 개념으로 나누어 정리합니다.
큰 그림: 맹점이 있는 '초급독자'
대규모 언어 모델 (LLM) 을 거의 모든 책, 웹사이트, 소셜 미디어 게시물을 읽은 초고급 학생이라고 상상해 보세요. 이 학생은 매우 똑똑하여 거의 누구보다도 에세이를 쓰고, 질문에 답하며, 언어를 번역하는 데 뛰어납니다.
그러나 이 학생이 인간이 쓴 모든 것을 학습했기 때문에, 우리의 편견, 고정관념, 불공정한 습관 또한 모두 배웠습니다. 마치 특정 집단이 수학에 서툴다는 믿음이 만연한 동네에서 자란 아이가 그 믿음까지 받아들이게 되는 것처럼, 이 학생도 그것이 사실이 아니더라도 그렇게 믿게 될 수 있습니다.
이 논문은 세 가지 주요 질문을 던지는 방대한 안내서입니다:
- 이 나쁜 습관들은 어디서 왔는가? (기원)
- 우리는 어떻게 학생이 부정행위를 하는지 잡아낼 수 있는가? (평가)
- 우리는 어떻게 그들을 공정하게 가르칠 수 있는가? (완화)
제 1 부: 나쁜 습관의 기원 (Origins)
저자들은 '나쁜 습관' (편향) 을 **내재적 (Intrinsic)**과 외재적 (Extrinsic) 두 가지 유형으로 나눕니다.
1. 내재적 편향: '내부 기억'
이는 학습하는 동안 형성된 학생의 내부 사전과 세계관이라고 생각하세요.
- 학습 데이터 (교과서): 학생이 '의사'는 거의 항상 남성이었고 '간호사'는 거의 항상 여성이었던 책들을 읽었습니다. 따라서 내부 기억에서 '의사'는 '남성'과, '간호사'는 '여성'과 연결됩니다. 이것이 데이터 편향입니다.
- 수집 방법 (도서관): 학생이 오직 한 특정 국가의 도서관만 방문했다고 상상해 보세요. 그들은 그 나라의 명절이 세상의 유일한 명절이라고 생각하게 될 것입니다. 이것이 공간적/시간적 편향입니다.
- 도구 (펜과 종이): 학생이 단어를 조각내는 방식 (토큰화) 조차 불공정할 수 있습니다. 학생의 '펜'이 소수 집단의 이름을 작고 혼란스러운 조각으로 나누는 반면, 일반적인 이름은 온전하게 유지한다면, 학생은 소수 집단의 이름을 제대로 이해하지 못하게 됩니다. 이것이 토큰화 편향입니다.
2. 외재적 편향: '부적절한 수행'
이는 학생이 특정 시험이나 업무 중 나쁜 습관을 행동으로 옮기는 경우입니다.
- 이해 작업 (NLU): "누가 의사인가?"라고 묻고 텍스트에 "의사가 도착했다"라고만 되어 있다면, 학생은 텍스트에 성별이 명시되지 않았음에도 내부 기억이 편향되어 있기 때문에 '그 (He)'라고 추측할 수 있습니다.
- 생성 작업 (NLG): 학생에게 리더에 대한 이야기를 쓰라고 요청하면, 요청하지 않았음에도 리더를 남성과 간호사를 여성으로 자동 설정할 수 있습니다.
- 결과: 학생은 학습 데이터에서 본 패턴을 단순히 반복할 뿐이므로, 여성보다 남성에게 취업 추천을 하거나, 문장을 번역할 때 특정 문화를 모욕하는 방식으로 번역할 수 있습니다.
제 2 부: 부정행위 잡기 (평가)
우리는 어떻게 학생이 편향되었는지 알 수 있을까요? 이 논문은 교사가 학생을 채점하듯 세 가지 다른 수준에서 점검할 것을 제안합니다.
- 데이터 수준 점검 (교과서 확인):
- 학생이 시작하기 전에 그들이 읽는 책들을 살펴봅니다. 남성에 대한 책은 너무 많고 여성에 대한 책은 너무 적은가? 미국에 대한 책은 많고 아프리카에 대한 책은 없는가? 우리는 다양한 집단의 등장 빈도를 수학적으로 계산합니다.
- 모델 수준 점검 (뇌 확인):
- 우리는 학생의 뇌를 찔러 아이디어를 어떻게 연결하는지 확인합니다. "간호사는 남성인가?"라고 물었을 때 학생의 뇌가 '아니오'로 반응하지만, "의사는 남성인가?"라고 물었을 때 '예'로 반응한다면, 그들의 연결 고리에 숨겨진 편향이 있음을 알 수 있습니다. 우리는 반사실적 (Counterfactuals) 도구 (이름을 '존'에서 '제인'으로 바꾸고 답이 변하는지 확인) 와 같은 도구를 사용합니다.
- 출력 수준 점검 (숙제 채점):
- 우리는 학생이 실제로给出的 답변을 살펴봅니다. 특정 집단을 향해 mean 한 단어를 사용하는가? 서로 다른 사람들에게 다른 조언을 주는가? 또한 **인간 심사관 (실제 사람)**을 사용하여 답변을 읽고 "이건 불공정하게 들린다"라고 말하게 합니다.
제 3 부: 나쁜 습관 고치기 (완화)
이 논문은 언제 개입하느냐에 따라 학생을 '편향 제거'하는 세 가지 방법을 제안합니다.
1. 모델 전 편향 제거 (교과서 정돈)
- 아이디어: 학생이 공부를 시작하기 전에 도서관을 정리합니다.
- 방법: 소외된 집단에 대한 책을 더 추가 (과대표집) 하거나, 혐오스러운 책을 제거합니다. 심지어 "의사는 그 (he) 입니다"를 "의사는 그녀 (she) 입니다"로 바꾸는 등 문장을 다시 써서 학생이 두 가지 옵션 모두를 배우도록 할 수도 있습니다.
- 장단점: 시작하기 쉽고 비용이 적게 들지만, 책만 정리한다고 해서 모든 것을 고칠 수는 없습니다. 일부 나쁜 습관은 이미 학생의 뇌 구조에 박혀 있기 때문입니다.
2. 모델 내 편향 제거 (뇌 재배선)
- 아이디어: 학생이 공부하는 동안 그들에게 다르게 배우도록 강요합니다.
- 방법: 게임의 규칙을 바꿉니다. 학생이 '간호사'를 '여성'과 연결하려 하면 '페널티 점수 (손실 함수)'를 주어 그렇게 하지 않도록 학습시킵니다. 또한 이러한 나쁜 연결을 담고 있는 뇌의 특정 부분을 '가지치기 (잘라내기)' 할 수도 있습니다.
- 장단점: 이는 근본 원인을 고치는 데 매우 효과적이지만, 비싸고 어렵습니다. 컴퓨터를 작동시키는 동안 전선을 다시 연결하는 것과 같습니다.
3. 모델 후 편향 제거 (숙제 편집)
- 아이디어: 학생이 답을 쓰게 하되, 세상에 보여주기 전에 편집합니다.
- 방법: 학생이 편향된 문장을 쓰면 필터를 사용하여 단어를 변경합니다. 또는 학생에게 고정관념을 무시하도록 강요하는 특정 방식으로 문제를 생각하게 하는 '인과적 프롬핑 (causal prompting)' 트릭을 사용합니다.
- 장단점: 이는 빠르고 학생을 다시 학습시킬 필요가 없습니다. 그러나 이는 상처에 밴드를 붙이는 것과 같아, 증상은 고치지만 질병을 치유하지는 못합니다.
제 4 부: 왜 이것이 중요한가 (윤리와 법률)
이 논문은 이러한 편향들이 단순히 성가신 것이 아니라 위험하다고 경고합니다.
- 표현적 해악 (Representational Harms): 학생이 "이슬람교도는 폭력적이다" 또는 "여성은 리더가 될 수 없다"라고 말할 수 있습니다. 이는 사람들의 감정을 상하게 하고 사회 내 부정적인 고정관념을 강화합니다.
- 배분적 해악 (Allocational Harms): 이는 사람들이 현실 세계의 기회를 상실하는 경우입니다. 편향된 학생이 회사의 채용을 도우면, 자격이 있는 여성의 이력서를 거절할 수 있습니다. 편향된 학생이 병원의 환자 진단을 도우면, 소수 집단의 질병을 놓칠 수 있습니다.
이 논문은 법이 이제야 따라잡기 시작했다고 지적합니다. 뉴욕시와 유럽연합과 같은 곳에서는 이제 기업들이 인종, 성별, 나이에 따른 차별이 없도록 AI 도구를 감사 (audit) 하도록 요구받고 있습니다.
결론
이 논문은 로드맵입니다. AI 는 우리 사회의 결함을 비추는 거울과 같다고 알려줍니다. 공정한 AI 를 구축하기 위해 우리는 하나의 해결책에만 의존할 수 없습니다. 우리는 데이터를 정돈하고, 모델을 신중하게 학습시키며, 지속적으로 작업을 점검하고, 사람들에게 도달하기 전에 출력을 수정해야 합니다. 이는 한 번의 작업이 아니라 지속적인 과정입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.