Large Language Models are Perplexed by some Political Parties
이 논문은 10개의 대규모 언어 모델과 37개 언어에 걸쳐, 모델들이 사회민주주의 텍스트에 비해 극우 및 민족주의 정당의 텍스트에 대해 더 높은 퍼플렉서티(perplexity)를 보임으로써 정치적 공정성이 훼손된다는 사실을 밝히며, 이러한 편향은 지시 미세 조정(instruction-tuning)이 아닌 사전 학습(pretraining)에 기인한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 인터넷에 쓰인 거의 모든 것을 읽은 초지능 로봇이 하나 있다고 상상해 보세요. 당신은 이 로봇을 "언어 모델(Language Model)"이라고 부릅니다. 이제 당신이 이 로봇에게 전 세계의 연설문이나 정당의 강령을 읽으라고 명령했다고 가정해 봅시다.
연구진들은 아주 간단한 질문을 던졌습니다. 이 로봇은 모든 정당을 공정하게 대하는가, 아니면 몰래 좋아하는 특정 정당이 있는가?
이를 알아내기 위해, 연구진은 로봇에게 의견을 묻는 방식을 사용하지 않았습니다(로봇은 질문 방식에 따라 말을 바꾸도록 쉽게 유도될 수 있기 때문에 이는 까다로운 작업입니다). 대신, 그들은 **퍼플렉서티(Perplexity)**라는 "놀람 측정기"를 사용했습니다.
"놀람 측정기" 비유
로봇을 책을 읽는 사람이라고 생각해 보세요.
- 만약 어떤 사람이 문장을 읽었는데, 그 내용이 완벽하게 이해되고 예상과 딱 들어맞는다면, 그 사람은 놀라지 않습니다. 이 사람의 "놀람 측정기"는 낮게 유지됩니다.
- 만약 어떤 사람이 문장을 읽었는데, 그 내용이 이상하거나 혼란스럽거나 한 번도 본 적 없는 단어를 사용하고 있다면, 그 사람은 매우 놀랄 것입니다. 이 사람의 "놀람 측정기"는 높게 올라갑니다.
AI의 세계에서 **낮은 놀람(낮은 퍼플렉서티)**은 로봇이 해당 텍스트를 이해하기 쉽고 예측하기 쉽다는 것을 의미합니다. **높은 놀람(높은 퍼플렉서티)**은 로봇이 해당 텍스트를 어렵거나, 이상하거나, "성격에 맞지 않는다"고 느낀다는 것을 의미합니다.
연구 결과
연구진은 10개의 서로 다른 로봇(대규모 언어 모델)을 사용하여 37개의 서로 다른 언어로 된 텍스트를 테스트했습니다. 그들은 사회주의자부터 민족주의자까지 다양한 정치 집단의 연설문을 살펴보았습니다.
여기 큰 발견이 있습니다. 로봇들은 특정 정당에 대해 다른 정당들보다 일관되게 더 많은 "놀람"을 느꼈습니다.
- 선호하는 대상: 로봇은 사회민주주의 정당(온건한 중도 좌파 집단이라고 생각하면 됩니다)에 대해 가장 적게 놀랐습니다. 이 텍스트들은 로봇에게 "정상적"이고 이해하기 쉬운 것처럼 느껴졌습니다.
- 낯선 대상: 로봇은 극우 및 민족주의 정당에 대해 가장 많이 놀랐습니다. 이 텍스트들은 같은 언어로 작성되었음에도 불구하고 로봇에게 "이상하거나" 어렵게 느껴졌습니다.
마치 로봇의 머릿속에 온건한 정치에 관한 수백만 권의 책은 있지만, 극단적 민족주의에 관한 책은 거의 없는 도서관이 있는 것과 같습니다. 민족주의 연설을 접할 때, 로봇은 마치 자신이 거의 알지 못하는 언어로 된 책을 읽는 것처럼 단어에서 비틀거립니다.
"기초(Base)" 로봇 vs "튜닝된(Tuned)" 로봇
연구진은 이 편향이 로봇의 초기 훈련(인터넷 읽기)에서 온 것인지, 아니면 나중에 인간이 로봇에게 "착하게" 행동하도록 가르친 것인지(이를 **지시어 튜닝(Instruction Tuning)**이라고 합니다) 확인했습니다.
그들은 이 편향이 인간이 대화법을 가르치기 전, 즉 "가공되지 않은(raw)" 상태의 로봇에게 이미 존재했다는 것을 발견했습니다.
- 비유: 아주 예의 바른 동네에서 자란 학생을 상상해 보세요. 나중에 엄격한 선생님을 고용해 그 학생에게 "좋은 시민"이 되는 법을 가르친다 하더라도, 그 학생의 타고난 예의 바른 본성(또는 이 경우 특정 주제에 대해 불편함을 느끼는 타고난 본성)은 이미 어린 시절부터 성격에 배어 있었습니다.
- 결과: 로봇에게 지시어를 바꾸는 것은 편향을 해결하지 못했습니다. 로봇이 "가공된(tuned)" 상태이든 "가공되지 않은(raw)" 상태이든 "놀람 측정기"는 동일한 집단에 대해 높은 수치를 유지했습니다.
번역과의 연결 고리
연구진은 이 로봇들이 텍스트를 번역할 때 어떤 일이 일어나는지도 살펴보았습니다. 그들은 직접적인 연관성을 발견했습니다.
- 만약 로봇이 특정 정당의 연설에 대해 놀랐다면(높은 퍼플렉서티), 그 연설을 다른 언어로 번역하는 데 서툴렀습니다.
- 만약 로봇이 그 연설에 대해 편안함을 느꼈다면(낮은 퍼플렉서티), 그 연설을 잘 번역했습니다.
이는 로봇의 "불공정함"이 단순히 채팅 중에 무엇을 말하는가에 대한 문제가 아니라, 근본적으로 텍스트를 얼마나 잘 이해하고 처리하는가에 관한 문제임을 시사합니다.
결론
이 논문은 이러한 AI 모델들이 훈련 데이터로부터 기인한 내재된 "정치적 풍미"를 가지고 있다고 결론짓습니다. 이 모델들은 특정 정치적 관점(예: 사회민주주의)에는 자연스럽게 편안함을 느끼고, 다른 관점(예: 극우 민족주의)에는 자연스럽게 어려움을 겪습니다.
이것은 단순히 로봇에게 "공정하게 행동하라"고 말한다고 해서 쉽게 해결될 수 있는 문제가 아닙니다. 편향은 집이 지어진 방식처럼 기초 깊숙이 박혀 있습니다. 이를 해결하려면, 처음부터 집을 짓는 데 사용된 재료(훈련 데이터) 자체를 바꿔야 합니다.
중요 참고 사항: 연구진은 공식적인 정치 텍스트(정당 강령 및 의회 연설 등)만을 테스트했습니다. 로봇이 일상적인 소셜 미디어 게시물이나 비공식적인 대화를 어떻게 다루는지에 대해서는 테스트하지 않았으므로, 결과가 동일할지는 알 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.