Geopolitical alignment: Endorsement effects in large language models
이 연구는 거대 언어 모델이 정책 평가에서 상당한 지정학적 편향을 보이며, 동일한 정책이라도 미국이나 EU가 지지할 때보다 중국이나 러시아가 지지할 때 체계적으로 더 낮게 평가하고, 이러한 격차는 모델의 종류나 근거 제시 요청 여부에 따라 지속되거나 심화된다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 0점에서 100점 사이의 척도로 국제 정책을 평가할 준비가 된, 책상 앞에 앉아 있는 아주 똑똑한 로봇 판사라고 상상해 보십시오. 당신에게는 매우 구체적인 테스트가 주어졌습니다. 하나는 중소기업의 통관 서류 절차를 간소화하는 것에 관한 것이고, 다른 하나는 랜섬웨어를 막기 위해 사이버 보안 경보를 공유하는 것에 관한 것입니다. 두 정책 아이디어는 완벽하게 동일하며, 정책의 텍스트는 매번 정확히 같습니다.
하지만 반전이 있습니다. 당신이 점수를 매기기 전, 책상 위에 작은 메모가 놓입니다. 그 메모에는 "이 아이디어는 [이름]에 의해 지지됨"이라고 적혀 있습니다. 때때로 그 이름은 미국이나 유럽연합(EU)입니다. 또 다른 때는 중국이나 러시아입니다.
Maxim Chupilkin의 논문은 단순하지만 섬뜩한 질문을 던집니다. "메모에 적힌 이름이 정책 내용이 바뀌지 않았음에도 불구하고 당신의 점수를 바꾸는가?"
짧은 답변은 이렇습니다. "네, 분명히 그렇습니다." 로봇 판사들은 우리가 기대하는 것만큼 중립적이지 않습니다.
"이름표" 효과
이 거대언어모델(LLM)들을 시험을 치르는 학생이라고 생각해 보십시오. 학생이라면 질문을 보았을 때 수학적 근거에 기반하여 답해야 합니다. 하지만 이 실험에서 "학생들"(GPT-5, Claude Sonnet, Gemini, DeepSeek)은 누가 서명했느냐에 따라 똑같은 수학 문제를 다르게 채점하기 시작했습니다.
정책이 미국이나 유럽연합에 의해 지지되었을 때, 모델들은 높은 점수를 주었습니다.
- GPT-5는 미국에 80.5, EU에 78.6을 주었습니다.
- Gemini는 더욱 열광적이어서, 미국에 85.0, EU에 83.0을 주었습니다.
하지만 정확히 똑같은 정책이 중국이나 러시아에 의해 지지되었을 때, 점수는 급격히 떨어졌습니다.
- Gemini는 가장 혹독한 비평가였습니다. 중국 점수를 49.9로, 러시아 점수를 고작 36.2로 떨어뜨렸습니다.
- Claude Sonnet 역시 점수를 크게 깎아먹으며, 중국에 54.5, 러시아에 56.9를 주었습니다.
- GPT-5는 Gemini만큼 극단적이지는 않았지만, 중국에 대해서는 66.6, 러시아에 대해서는 63.2로 점수를 낮추었습니다.
이 논문은 이 세 모델에게 있어 "중국"이나 "러시아"라는 이름이 마치 '레드 플래그(경고 신호)'처럼 작용한다고 시사합니다. 마치 로봇이 "오, 이 정책이 그들로부터 온 거라고? 조심해야겠어, 아마 위험할지도 몰라"라고 생각하는 것과 같습니다. 비록 정책 텍택스트 자체는 서구권이 가져왔을 때와 동일함에도 불구하고 말입니다.
(처음에는) 움직이지 않았던 단 하나의 로봇
한 가지 예외가 있었습니다. 바로 DeepSeek입니다. 로봇들에게 오직 숫자만 달라고 요청했던 첫 번째 테스트 라운드에서, DeepSeek은 진정한 공정한 판사처럼 행동했습니다. 미국에 85.2, EU에 83.5, 중국에 84.8, 러시아에 81.0을 주었습니다. 차이가 너무 작아서 통계적으로 유의미하지 않았습니다. DeepSeek만이 이름표에 신경 쓰지 않는 유일한 존재처럼 보였습니다.
"정당화"의 함정
그다음, 실험자들은 규칙을 바꿨습니다. 그들은 로봇들에게 이렇게 물었습니다. "점수를 주되, 왜 그런 점수를 주었는지 짧은 문장으로 설명하시오."
여기서 이상한 일이 벌어졌습니다. 설명을 요구하는 것은 단순히 로봇의 생각을 드러내는 데 그치지 않고, 실제로 생각 자체를 바꾸어 놓았습니다.
- GPT-5와 Claude의 경우: 점수는 대체로 비슷하게 유지되었습니다. 그들은 여전히 서구를 선호했으며, 이유를 묻는다고 해서 그것이 고쳐지지는 않았습니다.
- Gemini의 경우: 이유를 설명하라고 요청하자 실제로 중국과 러시아에게 조금 도움이 되었습니다. 점수가 상승하여(각각 약 19.4점과 16.0점) 격차가 줄어들긴 했지만, 여전히 불이익은 존재했습니다.
- DeepSeek의 경우: 이것이 큰 놀라움이었습니다. DeepSeek에게 점수를 설명하라고 요청하는 순간, 그 "공정한" 가면이 벗겨졌습니다. 갑자기 중국과 러시아에 대해 가혹하게 처벌하기 시작했습니다. 러시아 점수는 33.3점 급락하여 47.8이 되었고, 중국은 23.3점 떨어졌습니다.
마치 DeepSeek이 자신의 진짜 생각을 말하도록 강요받기 전까지는 숨기고 있었던 것 같습니다. 설명을 써야 하는 상황이 되자, "데이터 보안", "감시", "지정학적 리스크" 같은 이유를 나열하며 중국과 러시아를 깎아내린 반면, 미국과 EU에 대해서는 "신뢰성"과 "표준"을 언급하며 찬사를 보냈습니다. 논문은 이러한 변화가 숨겨진 내부 상태를 드러낸 것이라기보다, 프롬프트 자체가 숫자로만 대답할 때 억제되어 있던 지정학적 추론을 활성화시킨 것이라고 언급합니다.
실제로 무슨 일이 일어나고 있는가?
논문은 이 모델들이 단순히 정책을 읽는 것이 아니라, 그 정책에 붙은 국가의 *분위기(vibe)*를 읽고 있다고 제안합니다.
- 미국이나 EU가 지지자일 때, 모델들은 이를 "신뢰할 수 있는 신호"로 취급합니다. 그들은 "이것은 안전하고, 표준적이며, 잘 조정된 것이다"라고 생각합니다.
- 중국이나 러시아가 지지자일 때, 모델들은 "경고 신호"로 전환합니다. 그들은 정책 텍스트에서 전혀 언급되지 않은 데이터 도난, 스파이 행위, 혹은 전략적 의존성에 대해 즉각적으로 걱정하기 시작합니다.
이 논문이 말하지 않는 것
이 실험이 무엇을 증명하지 못했는지 아는 것이 중요합니다. 논문은 이 결과가 소수의 실행(시나리오당 10회)을 바탕으로 한 시뮬레이션에 기초하고 있음을 명시적으로 밝히고 있습니다. 저자들은 이것이 로봇의 뇌에 박힌 영구적이고 변경 불가능한 결함이라기보다, 이 특정한 방식의 질문법에 의한 속성임을 주의 깊게 언급합니다. 또한, 그들은 "중도적이고 기술적인" 정책(통관 및 사이버 경보 등)만을 테스트했다는 점을 명시했습니다. 우리는 로봇이 더 감정적이거나 정치적인 주제에 대해서도 똑같이 반응할지는 알지 못합니다.
시사점
주요 결론은 이러한 AI 모델에서 지정학적 편향은 실재하며 측정 가능하다는 것입니다. 내용이 동일하더라도, 지지자의 정체가 평가를 바꿉니다. 논문은 만약 우리가 이 모델들을 정책 결정에 사용한다면 주의해야 한다고 주장합니다. 모델이 어떤 계획의 "실행 가능성"을 분석하는 것처럼 보일지라도, 실제로는 "스폰서"에 반응하고 있을 수도 있기 때문입니다.
그리고 핵심은 이것입니다. 설명을 요구하는 것이 항상 상황을 더 명확하게 만드는 것은 아닙니다. 때로는 로봇에게 답변을 정당화하라고 요구하는 것이 DeepSeek의 사례처럼 오히려 편향을 더 심화시킬 수 있습니다. 저자들은 고도의 이해관계가 걸린 결정을 내릴 때, "숫자만 제시하는" 모드와 "설명하는" 모드 모두에서 모델을 테스트해야 한다고 제언합니다. 왜냐하면 두 모드는 서로 완전히 다른 이야기를 할 수 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.