← 최신 논문
🤖 AI

Political Plasticity: An Analysis of Ideological Adaptability in Large Language Models

본 연구는 시스템 프롬프트는 대체로 효과가 없지만 사용자 프롬프트는 특히 경제적 자유 축을 중심으로 최신 대규모 언어 모델에서 상당한 이념적 변화를 성공적으로 유도할 수 있음을 보여주기 위해'정치적 가소성'개념을 도입하며, 다만 검증 실험은 잠재적 데이터 유출과 다양한 언어 간 현저한 변이를 드러낸다.

원저자: Bruno Bianchi, Diego Tiscornia, Matias Travizano, Ariel Futoransky

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bruno Bianchi, Diego Tiscornia, Matias Travizano, Ariel Futoransky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"정치적 가소성: 대규모 언어 모델의 이념적 적응성 분석"이라는 논문에 대한 설명을 간단한 언어와 창의적인 비유를 사용하여 제시합니다.

핵심 아이디어: AI 는 돌조각인가요, 점토인가요?

돌덩이와 젖은 점토 덩어리가 있다고 상상해 보세요. 돌덩이에 새로운 모양을 새기려 하면 거의 변하지 않습니다. 단단하죠. 하지만 젖은 점토에 엄지손가락을 누르면 손 모양으로 쉽게 변형됩니다.

이 논문은 단순한 질문을 던집니다: 대규모 언어 모델 (LLM) 은 돌조각과 같은가요, 아니면 점토와 같은가요?

구체적으로, 저자들은 "정치적 가소성"을 살펴봅니다. 이는 다음과 같은 질문을 세련된 표현으로 묻는 것입니다: 만약 AI 에게 보수당이나 진보당처럼 행동하라고 말하면, 실제로 그 역할에 맞춰 답변을 바꾸겠습니까, 아니면 고집스럽게 자신의 숨겨진 신념에 매달리겠습니까?

실험: "예/아니오" 테스트

이를 테스트하기 위해 연구자들은 AI 에게 "당신은 좌파인가요, 우파인가요?"라고 단순히 묻지 않았습니다. 대신 200 개의 질문이 포함된 방대한 설문지를 만들었습니다.

이 질문들을 두 면이 있는 자라고 생각하세요:

  1. 경제적 자유: 세금, 기업, 돈에 관한 질문들.
  2. 개인적 자유: 신체 자율성, 표현의 자유, 생활 방식에 관한 질문들.

AI 는 이 질문들에 "예" 또는 "아니오"로 답해야 했습니다. 연구자들은 답변을 바탕으로 "자유 점수"를 계산했습니다.

AI 를 "성형"하려 시도한 세 가지 방법

팀은 AI 의 답변을 구부릴 수 있는지 확인하기 위해 세 가지 다른 방법을 시도했습니다.

1. "시스템 프롬프트" (상사의 명령)

  • 비유: 매니저가 웨이터에게 "오늘은 불쾌한 노인처럼 행동해야 한다"고 지시하는 상황을 상상해 보세요.
  • 테스트: 연구자들은 AI 에게 숨겨진 지시 (시스템 프롬프트) 를 주어 "당신은 좌파 고문이다" 또는 "당신은 우파 고문이다"라고 말했습니다.
  • 결과: 이는 돌을 성형하려는 시도와 같았습니다. 대부분의 AI 는 거의 변하지 않았습니다. 상사의 지시를 무시하고 대부분 같은 방식으로 답변을 계속했습니다. 오직 소수의 특정 모델 (최신 GPT-5 버전 등) 만 여기서 유연성을 보였습니다.

2. "주제 목록" (상세한 대본)

  • 비유: 매니저가 웨이터에게 백신, 이민, 세금에 대해 정확히 무엇을 말해야 하는지 나열한 10 페이지 분량의 대본을 주는 상황입니다.
  • 테스트: 단순히 "좌파가 되어라"라고 말하는 대신, 구체적인 정치적 입장 (예: "당신은 백신 의무화를 지지한다") 목록을 AI 에게 주었습니다.
  • 결과: 여전히 돌은 잘 구부러지지 않았습니다. AI 들은 시스템 측에서 온 이러한 상세한 지시들을 대부분 무시했습니다.

3. "사용자 프롬프트" (대화 상대)

  • 비유: 이번에는 고객 (사용자) 이 앉아서 "이봐, 우리 둘 다 좌파인 척해 보자. 좌파들이 어떻게 말하는지 예시 몇 가지를 보여줄게..."라고 말합니다.
  • 테스트: 연구자들은 숨겨진 지시를 사용하지 않았습니다. 대신 채팅 창 자체를 활용했습니다. 특정 정치적 편향을 보여주는 질문과 답변의 예시를 몇 개 제공한 후, 실제 질문을 던졌습니다.
  • 결과: 이것은 점토에 마법처럼 작용했습니다. 편향이 사용자의 대화에 있을 때, AI 들은 답변을 크게 바꾸었습니다. 사용자가 연기하는 정치적 진영처럼 행동하기 시작했습니다. 이는 특히 더 새롭고 똑똑한 모델들에서 두드러졌습니다.

반전: "역방향" 테스트

여기서 일이 이상해지기 시작했습니다. 연구자들은 질문을 뒤집어 보기로 했습니다.

  • 비유: "하늘은 파란가?"라고 묻는 것과 "하늘은 파란색이 아닌가?"라고 묻는 것을 상상해 보세요.
  • 테스트: 동일한 질문을 사용하되, "예"라는 답변이 이제 정반대의 정치적 견해를 의미하도록 문장을 구성했습니다.
  • 결과: 대부분의 오래되거나 작은 AI 들은 혼란스러워했습니다. "역방향" 질문을 받았을 때, 단순히 답변을 뒤집은 것이 아니라, 완전히 틀린 방향으로 크게 흔들렸습니다. 마치 "도움이 되려는" 또는 "동의하려는" 노력에 너무 매몰되어 실수로 의도와 정반대의 말을 한 것처럼 보였습니다.
  • 예외: 최신, 가장 첨단 모델들 (GPT-5 와 Gemma) 은 역방향 질문을 올바르게 처리할 만큼 똑똑했습니다. 혼란을 겪지 않고 일관성을 유지했습니다.

언어 테스트

연구자들은 영어, 스페인어, 프랑스어 등 여섯 가지 다른 언어로도 이 실험을 시도했습니다.

  • 발견: AI 들은 언어마다 약간씩 달랐습니다. 어떤 모델은 영어에서는 매우 유연했지만 스페인어에서는 조금 더 단단했습니다. 마치 사용하는 언어에 따라 점토의 질감이 달라지는 것과 같습니다.

주요 결론

  1. 오래되거나 작은 모델은 단단합니다: 작거나 오래된 AI 모델은 단단한 돌과 같습니다. 어떻게 프롬프트를 주든 정치적 견해를 크게 바꾸지 않습니다. 그들의 답변은 종종 불안정하거나 예측 불가능합니다.
  2. 새롭고 똑똑한 모델은 유연합니다: 최신, 가장 큰 모델들은 젖은 점토와 같습니다. 특정 방식으로 (숨겨진 지시가 아닌 사용자 채팅을 통해) 대화하면, 정치적 "분위기"에 맞춰 답변을 기꺼이 적응시킵니다.
  3. "예/아니오" 함정: 질문하는 방식을 조심하지 않으면, AI 는 실제로 의견을 가진 것이 아니라 테스트의 패턴을 추측하고 있을 수 있습니다. 이를 "데이터 누출"이라고 합니다. AI 가 이전에 이 정확한 질문들을 본 적이 있고 단순히 답변을 외웠을 수 있습니다.
  4. 신뢰 문제: 이러한 모델들은 대화 상대에 따라 답변을 너무 쉽게 바꾸기 때문에, 그들이 "중립적"이라고 가정할 수 없습니다. 질문을 한 방식으로 물으면 한 가지 답변이 나오고, 다른 방식으로 물으면 정반대의 답변을 얻을 수 있습니다.

요약

이 논문은 AI 가 중립적인 심판이 아니라고 결론 내립니다. AI 는 카멜레온입니다. 일부 카멜레온 (오래된 모델) 은 한 가지 색에 갇혀 있지만, 다른 카멜레온 (새로운 모델) 은 어떻게 대화하느냐에 따라 원하는 대로 색을 바꿉니다. 이는 민감한 정치적 주제에 AI 를 신뢰할 때 매우 신중해야 함을 의미합니다. 왜냐하면 그 "의견"은 단지 우리가 질문을 한 방식에 대한 반영일 뿐일 수 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →