General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
이 논문은 위키피디아로부터 정형화된 구절을 생성하고 이를 사용하여 편향을 유발하는 프롬프트를 식별 및 제거함으로써 마스크 언어 모델의 구절 수준 편향을 완화하는 자동 다중 토큰 파이프라인인 General Phrase Debiaser를 소개하며, 다양한 도메인과 모델 크기에 걸쳐 성별 고정관념을 유의미하게 감소시켰다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어를 읽고 쓰는 컴퓨터는 뉴스를 요약하고, 문서를 번역하며, 심지어 시를 짓는 것까지 가능할 정도로 놀라운 숙련도를 갖추게 되었습니다. 언어 모델이라고 불리는 이 시스템들은 인터넷의 방대한 텍텍스트를 학습하며 그 안에 담긴 패턴, 사실, 그리고 의견들을 흡수합니다. 그러나 인간의 언어에는 역사적 편견과 문화적 고정관념이 가득하기 때문에, 이 모델들은 이를 반복하는 법을 배우기도 합니다. 컴퓨터는 간호사는 항상 여성이고 수학자는 항상 남성이라고 가정할 수 있는데, 이는 모델이 학습 데이터에서 그런 사례를 가장 자주 보았기 때문입니다. 이는 이러한 도구를 공정하게 사용하려는 사람들에게 중대한 문제인데, 기계가 성별, 인종, 직업에 대한 해로운 편견을 의도치 않게 강화할 수 있기 때문입니다. 연구자들은 오랫동안 이러한 문제를 해결하려고 노력해 왔지만, 대부분의 이전 시도들은 단일 단어를 수정하는 데 집중하여 편견을 몇 가지 문제적인 용어를 교체하는 단순한 문제로 취급했습니다. 하지만 현실 세계의 편견은 결코 고립되어 존재하지 않습니다. 그것은 단어들이 결합하여 구절과 문장을 만드는 방식 속에 숨어 있으며, 그 과정에서 의미는 미묘하고 위험한 방식으로 변화합니다.
중국과학원, 알리바바 그룹, 브리스톨 대학교의 연구진은 이러한 더 깊은 층위의 편견을 다루기 위한 새로운 방법을 개발했습니다. 그들은 자신들의 접근 방식을 '제너럴 프레이즈 디바이서(General Phrase Debiaser, 일반 구절 편향 제거기)'라고 부르며, 이는 단일 단어가 아닌 단어의 집합을 살펴봄으로써 언어 모델을 정화하도록 설계된 시스템입니다. 연구진은 문제를 진정으로 해결하기 위해서는 모델의 편향이 가장 강하게 나타나는 특정 구절을 찾아내고, 모델이 그러한 연상을 무시하도록 가르쳐야 한다는 점을 인식했습니다. 그들의 과정은 교정에 필요한 증거를 수집하는 영리한 방법으로 시작됩니다. 모든 가능한 편향된 구절을 인간이 일일이 직접 작성하는 것은 느리고 불완전할 수 있으므로, 이 시스템은 위키피디아 페이지를 스캔합니다. 시스템은 직업, 수학, 예술, 과학과 같은 주제로 연결되는 하이퍼링크를 찾아내어, 모델이 학습했을 법한 고정관념적 구절을 식별합니다. 예를 들어, 모델이 "남성"을 "수학 이론"과 강력하게 연관시키고 "여성"을 "무용 예술"과 연관시킨다는 것을 찾아낼 수 있습니다.
시스템이 이러한 편향된 구절을 식별하고 나면, 두 번째 단계인 모델의 편견을 유발하는 정확한 질문, 즉 프롬프트를 찾는 단계로 넘어갑니다. 컴퓨터에게 "[사람]은 [빈칸]의 전문가이다"와 같은 문장을 완성하도록 요청한다고 상상해 보십시오. 연구진은 컴퓨터가 편향된 추측을 할 가능성이 가장 높은 문장들을 찾아내기 위해 수백만 개의 가능한 문장들을 검색하게 합니다. 그들은 단순히 단일 단어 답변만을 찾는 것이 아니라, 실제 편향이 숨어 있는 곳인 "수학 이론" 대 "무용 예술"과 같은 다중 단어 답변을 찾습니다. 남성과 여성을 대상으로 했을 때 모델이 이러한 구절에 대해 얼마나 다르게 반응하는지를 측정함으로써, 시스템은 편향의 강도를 나타내는 점수를 계산합니다. 연구진은 이 점수를 사용하여 미세 조정(fine-tuning) 과정을 안내합니다. 그들은 이러한 특정 편향 유발 문장들을 모델에 다시 입력하되, 이번에는 모델의 내부 설정을 조정하여 응답의 차이를 줄입니다. 목표는 모델의 수학이나 예술에 대한 지식을 지우는 것이 아니라, 해당 분야를 특정 성별과 더 이상 연결하지 않도록 하는 것입니다.
이 연구의 결과는 단일 단어를 겨냥하는 것보다 구절을 겨냥하는 것이 훨씬 더 효과적임을 보여줍니다. 연구진은 다양한 크기의 세 가지 유명 언어 모델을 대상으로 이 방법을 테스트했으며, 그 결과 직업과 학문 분야 전반에 걸쳐 성별 편향이 크게 감소했음을 발견했습니다. 편향을 측정하기 위해 설계된 표준 테스트에서 모델들은 극적으로 개선되었습니다. 예를 들어, 모델 중 하나인 BERT는 편향 점수가 0.35에서 0.12로 떨어졌고, 다른 모델인 ALBERT는 0.72에서 0.16으로 떨어졌습니다. 이 수치들은 모델이 특정 직업이나 분야를 어느 한 성별과 연관 지을 가능성이 훨씬 낮아졌음을 나타냅니다. 결정적으로, 연구진은 이 정화 과정이 일반적인 언어 이해 능력을 손상시키는지 확인했습니다. 그들은 디바이싱(debiasing)된 모델들을 문법, 감성, 논리를 다루는 일련의 표준 언어 테스트에 통과시켰으며, 모델들이 원래의 기술을 거의 모두 유지하고 있음을 발견했습니다. 언어 이해 능력은 온전하게 유지되었으며, 이는 해로운 고정관념을 제거하면서도 기계의 지능을 망가뜨리지 않는 것이 가능하다는 것을 입증했습니다.
이러한 접근 방식은 인공지능을 수정하는 방식에 대한 연구자들의 사고 전환을 의미합니다. 이전의 방법들은 종종 인간이 작성한 외부 단어 목록에 의존하거나 모델의 전체 어휘를 한꺼번에 수정하려고 시도했는데, 이는 비효율적이거나 편향이 실제로 작동하는 미묘한 차이를 놓칠 수 있었습니다. 반면, 제너럴 프레이즈 디서(General Phrase Debiaser)는 편향된 구절을 자동으로 발견하고 문제가 존재하는 특정 단어 조합을 표적으로 삼습니다. 연구진은 인간의 편향은 결코 단일 단어가 아니라, 구절 전반에 걸쳐 나타나는 연상의 패턴이기 때문에 이러한 멀티 토큰(multi-token) 수준의 교정이 필수적이라고 주장합니다. 비록 이 연구는 특정 유형의 언어 모델인 인코더 전용(encoder-only) 모델에 초점을 맞추었지만, 그들이 밝혀낸 원리는 다른 유형의 시스템에도 잠재적으로 적용될 수 있습니다. 이 작업은 언어의 구조를 더 면밀히 살펴봄으로써, 우리가 더 똑똑할 뿐만 아니라 더 공정한 도구를 구축할 수 있으며, 이를 통해 미래의 컴퓨터가 학습 데이터의 한계가 아닌 그들이 봉사하는 세상의 다양성을 반영하도록 할 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.