← 최신 논문
💬 NLP

Mapping Geopolitical Bias in 11 Large Language Models: A Bilingual, Dual-Framing Analysis of U.S.-China Tensions

이 논문은 균형 키잉(balanced keying)을 사용하여 11개의 대규모 언어 모델 내 지정학적 편향을 정확하게 측정하는 새롭고 재현 가능한 심리측정 방법을 소개하며, 개발자 출신, 질의 언어, 이슈 도메인이 모두 중요한 요인이고 미국에서 제작된 모델조차 중국어로 응답할 때는 친중 성향을 보인다는 점을 밝혀냈다.

원저자: William Guey, Wei Zhang, Pierrick Bougault, Vitor D. de Moura, José O. Gomes

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: William Guey, Wei Zhang, Pierrick Bougault, Vitor D. de Moura, José O. Gomes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 11개의 서로 다른 로봇들이 미·중 간의 격렬한 논쟁에 대해 실제로 어떻게 '생각'하는지 알아내려 한다고 상상해 보십시오. 당신은 그들에게 "A국이 B국보다 평화를 유지하는 데 더 기여합니까?"와 같은 질문을 던집니다.

여기 문제가 있습니다. 이 로봇들은 믿기지 않을 정도로 예의가 바릅니다. 만약 당신이 "하늘은 파란색인가요?"라고 물으면 그들은 "네"라고 답할 것입니다. 하지만 만약 당신이 "하늘은 초록색인가요?"라고 묻는다면, 그들은 그저 도움이 되고 싶어서, 혹은 당신의 말에 동조하도록 프로그래밍되었기 때문에 여전히 "네"라고 답할 수도 있습니다. 심리학에서는 이를 묵인 편향(acquiescence)(그저 "예"라고 말하려는 경향)이라고 부릅니다.

만약 당신이 로봇에게 질문을 단 한 가지 방식으로만 던진다면, 그들이 실제로 의견을 가지고 있는 것인지 아니면 그저 "예스맨(yes-man)"인 것인지 구별할 수 없습니다. 이는 마치 어떤 사람에게 가장 좋아하는 색이 무엇인지 알기 위해 "파란색을 좋아합니까?"라고만 묻는 것과 같습니다. 그가 "네"라고 대답한다면, 그가 정말로 파란색을 사랑하는 것인지 아니면 단지 거절하는 것을 싫어하는 것인지 알 수 없는 것과 마찬가지입니다.

"마법의 거울" 해결책

이 논문의 저자들은 이를 해결하기 위해 매우 영리한 트릭을 고안해 냈는데, 이를 **극성 키 기반의 이중 프레임 도구(polarity-keyed dual-framing instrument)**라고 부릅니다. 이것을 "마법의 거울" 테스트라고 생각하면 됩니다.

질문을 하나만 던지는 대신, 그들은 모든 주제에 대해 두 가지 질문을 던집니다:

  1. 정방향 질문: "A국이 B국보다 안정에 더 기여합니까?"
  2. 역방향 질문: "B국이 A국보다 안정에 더 기여합니까?"

그 후 그들은 특별한 점수 산정 방식("마법의 열쇠")을 사용합니다:

  • 만약 로봇이 질문 모두에 동의한다면(둘 다 "예"라고 답한다면), 점수는 서로 상쇄되어 0이 됩니다. 이는 로봇이 그저 "예스맨"(묵인 편향)일 뿐이며, 실제로는 아무런 의견이 없음을 드러냅니다.
  • 만 만약 로봇이 첫 번째 질문에는 동의하지만 두 번째 질문에는 동의하지 않거나(또는 그 반대의 경우), 점수는 합산됩니다. 이는 로봇이 진정한 신념을 가지고 있음을 드러냅니다.

이 방법은 로봇의 예의(당신에게 동의하는 것)와 신념(실제로 생각하는 것)을 분리해 냅니다.

그들이 발견한 것

이 "마법의 거울"을 11개의 서로 다른 AI 모델(미국산, 중국산, 그리고 유럽산 하나 포함)에 적용하여, 그들은 이들의 답변을 결정짓는 세 가지 주요 요인을 발견했습니다.

1. 로봇이 "태어난 곳"이 중요하다 (하지만 비대칭적이다)

  • 발견: 중국에서 만들어진 모든 로봇은 친중 성향을 띠었습니다. 그러나 미국에서 만들어진 로브들은 복합적이었습니다. 어떤 것은 친미 성향을 보였고, 어떤 것은 중립적이었으며, 일관되게 친중 성향을 보이는 모델은 없었습니다.
  • 비유: 모든 학생이 자기 팀을 위해 손을 드는 교실을 상상해 보십시오. 하지만 다른 나라에서 온 학생들은 그 중간에 걸쳐 있습니다. 어떤 학생은 자기 팀을 응원하고, 어떤 학생은 조용히 앉아 있습니다. "홈 팀" 효과는 한쪽에서는 강력하고 균일하지만, 다른 쪽에서는 무질서합니다.

2. 사용하는 언어가 로봇을 끌어당긴다

  • 발견: 이것이 가장 큰 놀라움이었습니다. 모든 로봇은, 어디서 만들어졌든 상관없이, 영어 대신 **만다린(중국어)**으로 질문했을 때 친중 성향으로 기울었습니다. 미국에서 만든 로봇들조차 중국어로 대화할 때 태도가 변했습니다.
  • 비유: 보통 영어를 사용하는 사람들의 집단을 상상해 보십시오. 대화의 언어를 프랑스어로 바꾸면, 그들이 미국인일지라도 갑자기 특정 프랑스 관점에 동의하기 시작합니다. 이는 로봇이 제작자의 의도뿐만 아니라, 해당 언어로 된 책과 웹사이트(학습 데이터)로부터 이러한 관점을 배웠음을 시사합니다.

3. 주제에 따라 강도가 달라진다

  • 발견: 미국과 중국의 로봇 사이의 격차는 민감한 정치적 이슈(대만이나 남중국해 등)를 다룰 때는 매우 컸지만, 경제적 이슈(달러의 패권 등)를 다룰 때는 거의 존재하지 않았습니다.
  • 비유: 이는 마치 라이벌과 챔피언십 경기(높은 이해관계)를 치를 때는 매우 공격적이지만, 연습 경기(낮은 이해관계) 중에는 매우 가볍게 경기에 임하는 스포츠 팀과 같습니다. 로봇들은 특정 민감한 주제에서만 "정치적"이 됩니다.

"예스맨" vs "신념을 가진 자"

가장 중요한 발견 중 하나는 단순한 동의가 곧 편향은 아니라는 점입니다.

  • 한 로봇(Mistral)은 거의 모든 것에 "예"라고 답했습니다. "마법의 거울" 없이 보았다면, 우리는 이 로봇이 편향되었다고 생각했을 것입니다. 하지만 이 로봇은 정방향과 역방향 질문 모두에 "예"라고 답했기 때문에, 수학적 계산 결과 이 로봇은 사실 중립적이라는 것이 밝혀졌습니다. 그저 예의 바른 "예스맨"이었던 것입니다.
  • 또 다른 로봇(Qwen) 역시 "예"라고 자주 답했지만, 질문이 뒤집혔을 때 답변을 바꿨습니다. 이는 이 로봇이 실제로 진정한 친중 신념을 가지고 있음을 증명했습니다.

이것이 왜 중요한가

이 논문은 AI의 답변이 자신만만하게 들린다고 해서 그 답변을 그대로 신뢰해서는 안 된다고 주장합니다. 만약 우리가 이 "마법의 거울" 방법을 사용하지 않는다면, 우리는 로봇의 도움을 주려는 욕구(아첨/사교성)를 진정한 정치적 의견으로 오해할 수 있습니다.

저자들은 이 "마법의 거울" 도구를 공개형 인터랙티브 웹사이트로 출시했습니다. 이는 누구나 이 도구를 사용하여 (미·중 관계뿐만 아니라) 어떤 논쟁적인 주제에 대해서도 AI를 테스트하고, AI가 실제로 의견을 가지고 있는지 아니면 단지 친절하게 보이려고 당신에게 동의하고 있는지를 확인할 수 있음을 의미합니다.

요약하자면: 이 논문은 AI의 "가짜" 의견을 걸러내기 위한 테스트를 구축했습니다. 그 결과, AI가 어디서 만들어졌는지, 어떤 언어로 대화하는지, 그리고 질문하는 주제가 무엇인지가 AI의 답변을 결정하는 세 가지 가장 큰 요인임을 밝혀냈습니다. 또한, 자세히 들여다보지 않으면 친절함이 종종 편향된 것처럼 보일 수 있다는 사실도 밝혀냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →