It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt
본 연구는 대규모 언어 모델의 지정학적 편향이 사전 학습 데이터에서 유래하기보다는 사후 학습 정렬 단계에서 주로 도입되고 증폭되며, 이러한 편향의 방향과 크기는 모델 개발자의 지역과 프롬프트에 사용된 언어에 따라 달라진다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
여러 나라 (미국, 프랑스, 중국) 에서 온 학생 그룹이 세계 사건에 관한 에세이를 쓰는 법을 배우고 있다고 상상해 보세요.
오랫동안 사람들은 학생이 편향된 에세이를 썼다면 도서관에서 편향된 책을 읽었기 때문이라고 가정했습니다. AI 세계에서는 이 '도서관'이 모델이 채팅을 배우기 전에 읽는 방대한 인터넷 데이터를 의미합니다. 이를 **사전 학습 (pre-training)**이라고 합니다.
그러나 이 논문은 실제 이야기가 다르다고 주장합니다. 학생들이 도서관에서 무엇을 읽었는지가 아니라, **최종 시험 준비 수업 (post-training)**에서 무슨 일이 일어나는지가 그들의 생각을 바꾸는 것입니다.
다음은 간단한 비유를 사용한 연구 결과의 요약입니다:
1. '백지'와 '최종 시험'
연구진은 서로 다른 7 개의 AI '가족' (서로 다른 학교와 같음) 을 살펴보았습니다. 각 가족에 대해 두 가지 버전을 비교했습니다:
- Base Model: 특정 코칭을 받기 전에 도서관 책을 읽은 직후의 학생입니다.
- Chat Model: 인간이 공손하고 안전하게 답변하는 법을 가르치는 '코칭' 단계 (post-training) 를 거친 후의 동일한 학생입니다.
결과: 'Base' 학생들은 대부분 중립적이었습니다. 분쟁에서 어느 나라가 옳고 그른지에 대해 뚜렷한 의견을 가지고 있지 않았습니다. 하지만 '코칭' (post-training) 을 거치자 갑자기 강력한 의견을 갖게 되었습니다.
- 비유: 스포츠 라이벌 관계에 대해 중립적인 학생을 상상해 보세요. 코치가 "팀 A 를 반드시 지지해야 한다"고 말하자, 학생은 갑자기 팀 A 를 위해 크게 응원을 시작합니다. 편향은 그들이 읽은 책에서 온 것이 아니라 코치의 지시에서 온 것입니다.
2. '코치의 국적'이 중요합니다
연구진은 편향의 방향이 코치가 어디 출신인지에 따라 달라진다는 것을 발견했습니다.
- AI 가 서구권 연구소 (미국 또는 프랑스) 에서 개발된 경우, 코칭은 지리정치적 시나리오에서 AI 가 중국에 반대하도록 만들었습니다.
- AI 가 중국 연구소 (알리바바 등) 에서 개발된 경우, 코칭은 AI 가 중국을 지지하도록 만들었습니다.
- 예외: 한 중국 연구소 (01.AI) 는 실제로 학생이 중국에 반대하도록 코칭하여, 단순히 국가 문제가 아니라 모델을 구축하는 사람들이 내린 구체적인 선택에 달려 있음을 증명했습니다.
큰 변화: 가장 극적인 예는 알리바바의 Qwen 모델이었습니다.
- 코칭 전: 중립적이었습니다 (빈 페이지와 같음).
- 코칭 후: 극도로 친중 성향을 보였습니다. 연구진에 따르면, post-training 만으로 중국을 지지할 확률이 18 배나 급증했습니다.
3. '질문의 언어'가 편향을 증폭시킵니다
연구진은 질문을 할 때 사용된 언어가 답변을 바꾸는지 여부도 테스트했습니다.
- 프랑스 사례: 프랑스 AI(Mistral) 는 영어로 질문받았을 때 중립적이었습니다. 하지만 프랑스어로 질문받자 갑자기 친프랑스 성향을 강하게 보였습니다.
- 중국 사례: 중국제 모델에 중국어로 질문하면 때로는 친중 성향이 더 강해지지만, 항상 그런 것은 아닙니다. 때로는 언어가 볼륨 조절기처럼 작용하여 특정 모델에 따라 편향을 높이거나 낮춥니다.
비유: AI 를 배우로 생각하세요. 영어로 질문하면 중립적인 캐릭터를 연기할 수 있습니다. 하지만 같은 질문을 모국어로 속삭이면, 갑자기 문화적 배경에 훨씬 더 잘 맞는 역할을 연기하기 시작할 수 있습니다.
4. '실제' 국가에 관한 것만은 아닙니다
AI 가 단순히 사실 (예: "중국은 크다") 을 암기하는지 확인하기 위해, 연구진은 가상의 국가와 가상의 이름 (중국어처럼 들리는 '자둥'이나 영어처럼 들리는 '브레더랜드' 등) 을 고안해냈습니다.
- 결과: 가상의 국가라도 중국 AI 는 중국처럼 들리는 국가를 선호했고, 프랑스 AI 는 프랑스처럼 들리는 국가를 선호했습니다.
- 교훈: AI 는 단순히 사실을 회상하는 것이 아니라, 어떻게 생각하도록 훈련되었는지에 따라 실제이든 가상이든 어떤 상황에도 문화적 렌즈를 적용하고 있습니다.
5. '거부' 트릭
일부 중국 모델은 처음에 중국에 관한 질문에 답변을 거부하는 것처럼 보였습니다 ("답변할 수 없습니다"라고 말함). 연구진은 이것이 의견이 부족해서가 아니라 포맷팅 트릭임을 깨달았습니다. 더 깊이 살펴보니 모델이 완전한 문장을 작성할 수 있게 허용되면, 실제로 강력한 의견을 가지고 있다는 것을 발견했습니다.
- 비유: 마치 학생이 손을 들고 "답변할 수 없습니다"라고 말하지만, 선생님이 "단어 하나만 적어보세요"라고 말하자 즉시 "팀 A"라고 적는 것과 같습니다. 의견은 처음부터 있었으며, 포맷이 그것을 숨겼을 뿐입니다.
결론
이 논문은 AI 의 지리정치적 편향은 입력된 데이터의 우연이 아님을 결론짓습니다. 대신, 인간이 AI 를 특정 가치와 일치시키는 최종 학습 단계에서 적극적으로 구축됩니다.
- 옛 믿음: "AI 가 편향된 것은 인터넷이 편향되어 있기 때문이다."
- 새 발견: "AI 가 편향된 것은 그것을 훈련시킨 사람들 (코치) 이 특정 선호도를 갖도록 만들었기 때문이다."
이는 AI 의 편향을 해결하려면 인터넷 데이터를 정리하는 것만으로는 부족하다는 것을 의미합니다. 우리는 AI 가 어떻게 행동하도록 가르치는지 사용되는 구체적인 규칙과 인간 피드백인 정렬 (alignment) 과정을 살펴봐야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.