← 최신 논문
💻 computer science

Ideology by Alphabet: Option Order and the Measurement of Machine Political Preferences

이 논문은 대규모 언어 모델의 겉으로 드러나는 정치적 이데올로기가 진정한 선호도가 아니라 주로 고정된 답변 순서 편향의 결과물임을 입증하며, 선택지 순서를 무작위화하면 이전에 식별되었던 이데올로기적 군집이 해체되고 특정 슬롯 배치가 모델에 상충하는 정치적 입장을 임의로 부여할 수 있음이 드러남을 보여준다.

원저자: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

게시일 2026-09-17
📖 5 분 읽기🧠 심층 분석

원저자: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리가 컴퓨터에게 선택을 요청할 때, 우리는 흔히 그것이 상황의 사실들을 저울질하고 있다고 가정한다. 인간처럼 읽고 쓸 수 있는 인공지능의 한 종류인 대규모 언어 모델에게 어떤 문제에 대한 네 가지 서로 다른 해결책 중 하나를 고르라고 요청하면, 우리는 그 답변이 문제에 대한 이해를 반영할 것이라고 기대한다. 이것은 우리가 인간 투표자나 전문가 패널을 대하는 방식이기도 하다. 즉, 그들의 선호가 가치관과 지식에 뿌리를 두고 있다고 가정하는 것이다. 하지만 설문 설계의 세계에는 '순서 효과(order effect)'라는 잘 알려진 정신적 속임수가 있다. 만약 어떤 사람에게 일련의 선택지를 나열하여 제시한다면, 그들은 단지 그것이 목록에서 첫 번째로 보였다는 이유만으로 통계적으로 첫 번째 옵션을 선택할 가능성이 높다. 이는 뇌가 피로하거나 선택지들을 구별하기 어려울 때 지름길을 택하기 때문에 발생한다. 수십 년 동안 사회 과학자들은 투표 용지나 설문지의 단어 순서가 투표 결과를 바꿀 수 있다는 사실을 알고 있었다. 남겨진 질문은 이러한 동일한 지름길이 기계에도 적용되는지, 그리고 만약 그렇다면, 그것이 존재하지도 않는 정치적 인격을 만들어낼 만큼 강력한가 하는 점이다.

헝가리 데브레첸 대학교의 연구팀은 인공지능 모델을 정치적 투표자로 취급함으로써 이를 테스트하기 위해 연구를 시작했다. 그들은 직장 안전 처리 방식, 시장 규제, 또는 사회적 혜택 분배와 같은 현실 세계의 거버넌스 이슈를 포함한 400가지의 서로 다른 시나리오로 구성된 방대한 테스트를 만들었다. 각 시나리오에 대해 그들은 모델들에게 네 가지 뚜렷한 옵션을 제시하고, 각 옵션에 점수를 매긴 뒤 승자를 선택하도록 요청했다. 그들은 15개의 서로 다른 오픈 소스 모델을 대상으로 이 테스트를 실행하여 64만 개 이상의 개별 응답을 생성했다. 실험의 첫 번째 단계에서 그들은 대부분의 연구자가 사용하는 표준적인 방법을 사용했다. 즉, 모든 질문에 대해 옵션의 순서를 동일하게 유지했다. 만약 "정부" 옵션이 항상 첫 번째로 나열되었다면, 그것은 계속 첫 번째에 머물렀다. 만약 "개인" 옵션이 항상 마지막이었다면, 그것은 계속 마지막에 머물렀다.

연구진이 이 고정 순서 설정에서 나온 결과를 분석했을 때, 그들은 놀랍게도 진정한 정치적 분열처럼 보이는 패턴을 발견했다. 모델들은 두 개의 명확한 그룹으로 분류되었다. 연구진이 "시장 합리주의자(market-rationalists)"라고 부른 한 그룹은 효용, 지표, 그리고 재정적 인센티브와 관련된 옵션을 일관되게 선호했다. 다른 그룹인 "제도주의자(institutionalists)"는 규칙, 공정성, 그리고 공동체적 책임과 관련된 옵션을 선호했다. 이 분열은 너무나 깔끔하고 논리적이어서, 경제를 자유주의 유형과 조정된 유형으로 나누는 정치학의 유명한 이론을 닮아 있었다. 결과는 매우 일관적이어서 신뢰성에 대한 모든 표준 테스트를 통과했다. 마치 연구진이 인공지능의 정치적 이데올로기를 성공적으로 지도화한 것처럼 보였다.

하지만 연구진은 이 깔끔한 정치적 지도가 테스트 자체에 의해 만들어진 환상일 것이라고 의심했다. 이를 확인하기 위해 그들은 동일한 400개의 질문을 다시 실행하되, 이번에는 옵션의 순서를 뒤섞었다. 모든 질문에 대해 네 가지 선택지를 회전시켜 각 옵션이 첫 번째, 두 번째, 세 번째, 네 번째 슬롯에 동일한 횟수만큼 나타나도록 했다. 이는 답변의 내용이 화면상의 위치와 더 이상 결합되지 않음을 의미했다. 연구진이 이 무작위 버전의 데이터를 분석했을 때, 첫 번째 라운드에서 발견했던 특정한 정치적 지도는 해체되었다. "시장 합리주의자"와 "제도주의자" 사이의 명확한 경계가 무너졌다. 모델들은 여전히 서로 진정으로 달랐고, 이러한 차이에 대한 새로운 지도는 통계적으로 신뢰할 수 있었지만, 더 이상 고정 순서 테스트가 시사했던 두 개의 뚜렷한 진영이나 깔끔한 유형을 형성하지 않았다.

연구는 첫 번째 라운드에서 발견된 "이데올로기"가 모델의 신념을 반영하는 것이 아니라, 상당 부분 옵션이 인쇄된 순서의 산물임을 드러냈다. "시장 합리주의자"로 분류되었던 세 개의 모델은 단순히 목록의 맨 첫 번째 옵션을 선택하는 습관이 가장 강했던 세 개의 모델일 뿐이었다. 연구진이 모든 질문의 첫 번째 슬롯에 "시장" 관련 옵션을 배치했기 때문에, 이 세 모델은 매번 그것을 선택했고, 가짜 정치적 특징을 만들어낸 것이었다. 연구진은 이 겉보기의 정치적 편향이 모델이 첫 번째 슬롯을 얼마나 좋아하는지에 대한 단순한 척도와 거의 완벽하게 상관관계가 있음을 계산해 냈다. 실제로 그들이 첫 번째 테스트에서 선택한 옵션의 특정 배치는 그들이 선택할 수 있었던 13,000가지 이상의 서로 다른 방식 중 가장 오도하기 쉬운 배치였다.

이 발견의 함의는 이 기계들의 조언에 의존하는 모든 이들에게 중요하다. 연구진은 질문과 답변을 정확히 동일하게 유지하면서 단지 선택지의 순서만 바꿨을 때, 모델이 최우선 추천을 바꾸는 경우가 71%에 달한다는 것을 발견했다. 이는 일반적인 무작위 오류율인 약 33%보다 훨씬 높은 수치다. 더욱 놀라운 점은, 모델이 답변에 대한 확신도는 거의 변하지 않았다는 것이다. 모델이 옵션이 이동함에 따라 추천을 바꿨을 때, 모델은 이전의 답변만큼이나 새로운 답변에 대해서도 똑같이 확신한다고 보고했다. 이는 모델이 논거를 저울질하는 것이 아니라, 위치에 기반한 기계적인 규칙을 따르고 있음을 시사한다.

연구는 또한 이 문제가 특정 유형의 질문에 국한되지 않는다는 것을 보여주었다. 모델들은 어렵고 논쟁적인 정책 질문에서뿐만 아니라 쉬운 질문에서도 마찬가지로 마음을 바꾸는 경 likelihood가 높았다. 사실, 순서 효과는 가장 중요한 곳, 즉 옵션들이 서로 구별하기 어려운 질문에서 가장 강력하게 나타났다. 이는 결정권자가 어려운 선택에 직면했을 때 가장 이용 가능한 쉬운 지름길을 잡는 "만족화(satisficing)"라고 알려진 행동이다. 이 기계들에게 있어 그 지름길은 목록의 첫 번째 항목을 선택하는 것이었다.

연구진은 고정된 목록의 옵션을 사용하여 인공지능의 정치적 성향을 측정하는 것은 근본적으로 결함이 있다고 결론지었다. 고정 순서 테스트는 모델이 무엇을 생각하는지를 드러내는 것이 아니라, 모델이 화면의 레이아웃에 어떻게 반응하는지를 드러낸다. 순서를 무작위화했을 때 잔여적인 진정한 콘텐츠 선호도가 남아있기는 하지만, 그것은 약하며 고정 순서 테스트가 시사하는 깔끔한 이데올로기적 유형을 형성하지 않는다. 이전 연구들에서 발견된 "이데올로기"는 단지 질문이 작성된 방식의 통계적 인공물에 불과했을 수도 있다. 이 모델들이 무엇을 선호하는지에 대한 진정한 그림을 얻으려면, 연구자들은 질문을 던질 때마다 답변의 순서를 무작위로 섞어야 한다. 이 단계가 없다면, 기계의 정치적 입장에 대한 어떠한 주장도 설계상의 로또에 기반한 추측에 불과하다. 이 연구는 우리가 기계에게 선택을 요청할 때, 단어의 순서를 논거의 무게로 착각하지 않도록 주의해야 한다는 경고를 준다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →