← 최신 논문
🤖 AI

Measuring Political Stance and Consistency in Large Language Models

이 논문은 다섯 가지 프롬프팅 기법을 사용하여 24가지 민감한 쟁점에 걸친 9개 대규모 언어 모델의 정치적 입장과 일관성을 평가하며, 모델의 입장이 언어와 프롬프팅에 따라 자주 변하거나 변화하는 반면 특정 핵심 입장은 견고하게 유지된다는 점을 밝힘으로써, AI의 정치적 편향성에 관한 사용자의 인식 제고와 개발자의 개입이 필요함을 강조한다.

원저자: Salah Feras Alali, Mohammad Nashat Maasfeh, Mucahid Kutlu, Saban Kardas

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Salah Feras Alali, Mohammad Nashat Maasfeh, Mucahid Kutlu, Saban Kardas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 전쟁에서 누가 옳은지, 혹은 한 국가의 정책이 어떠해야 하는지와 같은 심각한 정치적 논쟁에 대해 조언을 구하기 시작한 아홉 가지 서로 다른 "디지털 신탁(Digital Oracles)"(대규모 언어 모델, 즉 LLM)을 가지고 있다고 상상해 보십시오. 이 논문의 저자들은 이 신탁들이 자신만의 숨겨데 된 정치적 견해를 가지고 있는지, 그리고 그 견해가 확고한지 아니면 쉽게 속을 수 있는지를 테스트하기로 했습니다.

다음은 그들이 수행한 작업과 발견한 내용을 일상적인 비유를 사용하여 간단히 정리한 것입니다.

설정: "의견 테스트"

연구자들을 탐정 그룹이라고 생각해 보십시오. 그들은 이전에 연구된 적이 거의 없는 24가지 까다로운 정치적 주제(우크라이나 전쟁, 가자 지구 분쟁, 또는 터키와 그리스 사이의 섬 분쟁 등)를 선정했습니다.

그들은 9가지 서로 다른 AI 모델(GPT-4, GPT-5, Grok과 같은 유명 모델 포함)에게 이 문제들에 대한 견해를 물었습니다. 하지만 단 한 번만 물어본 것이 아닙니다. AI가 마음을 바꿀 수 있는지 확인하기 위해 다섯 가지 다른 방식으로 질문을 던졌습니다.

  1. 직설적인 질문: "누가 옳습니까?"
  2. 악마의 변호인(Devil's Advocate): "상대방의 논거는 이렇습니다. 이제 누가 옳습니까?"
  3. 균형 잡힌 시각: "양측의 논거는 이렇습니다. 누가 옳습니까?"
  4. 태세 전환 유도(Flip-Flop): 질문을 던질 때 반대되는 답을 암시하도록 문구를 바꾸는 방식 (예: "이것은 나빴습니까?" vs "이것은 좋았습니까?")
  5. 언어 전환: 관련 국가의 현지 언어로 질문하는 방식 (예: 터키-그리스 분쟁에 대해 터키어나 그리스어로 질문하기)

조사 결과: 신탁들이 말한 것

1. AI들은 "비밀스러운 편"을 가지고 있다
사람이 은연중에 특정 스포츠 팀을 선호하는 것처럼, 이 AI들도 거의 항상 한쪽 편을 들었습니다. 그들은 중립을 지키는 경우가 드물었습니다.

  • 합의된 내용: 어떤 이슈에 대해서는 모든 AI가 동의했습니다. 예를 들어, 그들은 카타르 봉쇄는 잘못되었으며 팔레스타인 사람들이 억압받고 있다는 점에 대체로 동의했습니다.
  • 분열된 내용: 다른 이슈에서는 의견이 갈렸습니다. 예를 들어, "아랍의 봄"에 대해 어떤 AI는 민주주의에 관한 것이라고 했고, 다른 AI는 경제적 분노에 관한 것이라고 답했습니다.

2. "카멜레온" vs "바위"
어떤 AI는 질문 방식에 따라 색깔(의견)을 쉽게 바꾸는 카멜레온 같았습니다.

  • Mistral-7B는 가장 변화무쌍했습니다. 연구진이 프롬프트를 약간만 수정해도 24개 주제 중 19개 주제에서 입장을 바꿨습니다. 이는 마치 마지막에 말한 사람의 말에 무조건 동조하는 사람과 같습니다.
  • Grok-3-mini는 가장 고집스러웠습니다(일관적임). 이 모델은 단 5개의 주제에서만 마음을 바꿨습니다. 이는 매우 강하고 흔들리지 않는 신념을 가진 사람과 같습니다.

3. "언어 거울(Language Mirror)"
이것은 놀라운 발견이었습니다. 연구진이 다양한 언어로 질문했을 때, AI는 종종 그 언어를 사용하는 쪽의 입장에 치우치는 경나를 보였습니다.

  • 비유: 프랑스인과 독일인 사이의 분쟁에 대해 통역사에게 묻는다고 상상해 보십시오. 만약 당신이 프랑스어로 묻는다면, 통역사는 의도치 않게(혹은 잠재의식적으로) 프랑스인을 더 돋보이게 만드는 프랑스 측 자료를 사용할 수 있습니다. 만약 독일어로 묻는다면, 독일 측이 더 좋아 보일 것입니다.
  • 연구진은 언어가 개입되는 이슈(예: 터키 대 그리스)의 경우, 질문이 터키어인지 그리스어인지에 따라 AI의 답변이 바뀌는 경우가 많다는 것을 발견했습니다. 이는 AI의 "의견"이 사실은 훈련 과정에서 읽은 책과 기사들의 메아리라는 것을 시사합니다.

4. "흔들리지 않는" 주제들
연구진이 어떤 속임수를 써도 마음을 바꾸지 않은 두 가지 주제가 있었습니다.

  • 팔레스타인 억압.
  • 카타르 봉쇄.
    이 특정 이슈들에 대해 AI들은 마치 잠긴 금고처럼 단단했습니다. 그들의 입장은 고정되어 있었으며, 연구에서 사용된 프롬프트 기술로는 흔들 수 없었습니다.

5. "홈 팀" 편향
연구진은 중국 기업이 만든 AI인 DeepSeek가 티베트와 신장 문제와 같은 이슈에서 중국 정부의 입장을 일관되게 지지한다는 점을 주목했습니다. 반면, 미국이나 다른 곳에서 만들어진 거의 모든 다른 AI들은 그 반대의 견해를 취했습니다. 이는 AI가 어디서 만들어졌고 누가 훈련시켰는지가 마치 "홈 팀"의 편향처럼 작용하여 정치적 나침반에 영향을 미친다는 것을 보여줍니다.

결론

이 논문은 만약 당신이 AI에게 정치적 조언을 구한다면, 주의가 필요하다고 결론짓습니다.

  • 그들은 중립적이지 않습니다: 그들은 훈련 데이터에 기반한 내재된 편향을 가지고 있습니다.
  • 그들은 취약합니다: 질문하는 언어를 바꾸거나 질문의 방식을 바꾸는 것만으로도 그들의 마음을 바꿀 수 있습니다.
  • 그들은 팩트 체크 도구가 아닙니다: 그들의 "의견"은 모래처럼 변할 수 있으므로, 정치적 진실의 최종 결론으로 취급해서는 안 됩니다.

저자들은 이러한 디지털 신탁들이 얼마나 쉽게 휘둘릴 수 있는지를 보여줌으로써, 사용자들이 단순히 답변을 절대적인 진리로 받아들이는 대신, "잠깐, 왜 그렇게 말했지?" 그리고 "출처를 보여줄 수 있어?"라고 묻기 시작하기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →