The Political Ideology of Large Language Models: Measurement, Inconsistency, and Persuasive Influence
대규모 언어 모델이 미미한 수준의 정치적 편향성만을 지니고 있다는 견해에 이의를 제기하는 본 연구는, 특정 주제에 대한 당파적 입장이 서로 상쇄됨에 따라 전체적인 위치는 중립적으로 보일 수 있으나, 특히 응답이 명시적으로 유도될 경우 이들이 전문적인 선거 캠페인 광고와 맞먹는 수준으로 사용자의 정치적 태도에 설득력 있는 영향력을 행사할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 정치의 지형에서 한 개인의 이데올로기는 결코 단일하고 견고한 신념의 덩어리가 아니다. 대신, 그것은 의료에서 이민에 이르기까지 서로 상반된 방향으로 끌어당길 수 있는 다양한 사안에 대한 의견들의 집합체이다. 정치학자들은 대부분의 사람들이 완벽하게 일관된 견해를 갖지 않는다는 점을 오랫동안 이해해 왔다. 즉, 어떤 주제에는 매우 진보적이면서 다른 주제에는 매우 보수적일 수도 있고, 혹은 단순히 강한 의견을 전혀 갖지 않을 수도 있다. 수십 년 동안 연구자들은 사람들이 법안에 대해 어떻게 투표할 것인지, 혹은 특정 정책에 대해 어떻게 느끼는지 묻는 방식으로 이들의 위치를 측정하며 개인이 서 있는 곳을 지도로 그려왔다. 이제 인공지능이 수백만 명의 일상적인 도구가 됨에 따라 새로운 질문이 등장했다. 우리가 매일 대화하는 거대 언어 모델들도 자신들만의 정치적 지도를 가지고 있는가? 만약 우리가 정보를 찾고 의견을 형성하기 위해 점점 더 많이 사용하는 이 모델들이 숨겨진 편향성을 가지고 있다면, 그들은 아무도 모르는 사이에 사람들이 세상을 보는 방식을 미묘하게 형성할 수 있다.
한 연구팀은 인공지능을 중립적인 계산기가 아닌 하나의 정치적 행위자로 취급함으로써 이 질문에 답하고자 했다. 그들은 43개의 서로 다른 거대 언어 모델을 조사하며, 각 모델에게 미국 의회의 의원, 대법관, 또는 일반 유권자의 역할을 수행하도록 요청했다. 연구진은 모델에게 단순히 신념을 말하라고 요구한 것이 아니라, 실제 인간이 그러하듯 실질적인 법안, 재판 사건, 그리고 설문 조사 질문에 대해 결정을 내리도록 요청했다. 그런 다음 연구진은 이러한 디지털 결정들을 실제 정치인들의 투표 기록 및 수천 명의 실제 미국인들의 설문 답변과 비교했다. 그들이 발견한 것은 이 모델들이 조용하고 중립적인 중간 지대에 머물러 있지 않다는 사실이었다. 대신, 모델들은 복잡하고 종종 모순적인 견해의 혼합을 보여주었다. 어떤 사안에 대해 단일한 모델은 가장 강력한 민주당원보다 더 진보적인 입장을 취할 수 있는 반면, 다른 사안에 대해서는 동일한 모델이 가장 강력한 공화당원보다 더 보수적인 입장을 취할 수도 있었다. 이 모든 견해를 평균하면 모델들은 흔히 온건해 보이지만, 이는 마치 상충하는 견해를 동시에 가진 실제 유권자처럼 강렬하고 상반된 의견들이 서로 상쇄되어 만들어진 착시 현상이다.
연구는 또한 이러한 견해들이 어디에서 기인하는지를 살펴보았다. 연구진은 모델의 정치적 성향이 그들이 학습한 방대한 양의 텍스트를 단순히 반영하는 것이 아님을 발견했다. 대신, 모델의 초기 학습 이후에 적용되는 특정 지침과 안전 필터(모델을 유익하고 해롭지 않게 만들기 위해 설계된 과정)가 모델을 특정 정치적 측면으로 밀어붙이는 역할을 한다는 것을 밝혀냈다. 실제로 연구진이 초기 조정 전의 '가공되지 않은(raw)' 버전의 모델들을 테스트했을 때, 모델들은 정치적 중심에 훨씬 더 가까웠다. 모델들에게 독특하고 종종 진보 성향을 띠는 정치적 특징을 부여하는 것은 바로 최종 튜닝 과정이었다. 이 특징은 정적인 의견 목록이 아니라, 모델이 어떻게 요청받느냐에 따라 달라지는 것이 아니라. 모델이 유권자, 판사, 또는 입법자로 행동하도록 요청될 때마다 모델은 서로 다른 일련의 입장을 표명하며, 이는 그들의 '이데올로기'가 깊은 신념 체계라기보다는 프롬프트에 반응하여 수행하는 하나의 행동임을 보여준다.
그러나 이 연구의 가장 중요한 부분은 이러한 디지털 의견이 실제로 실제 사람들의 마음을 바꿀 수 있는지 확인하는 것이었다. 연구진은 수천 명의 미국인 참가자들이 이러한 모델들과 정책 이슈에 대해 토론하는 대규모 실험을 실시했다. 그들은 두 가지 서로 다른 시나리오를 테스트했다. 첫 번째는 모델이 특정 측면을 옹호하라는 지시를 받지 않고 자연스럽게 질문에 답하며 대화하도록 허용된 경우였다. 두 번째는 모델에게 새로운 총기 규제법을 지지하거나 세금 인상에 반대하는 것과 같이 특정 관점을 옹호하도록 명시적으로 지시받은 경우였다. 결과는 놀라웠다. 모델이 자연스럽게 대화할 때, 모델은 참가자들의 의견에 측정 가능한 영향을 미치지 못했다. 모델과 대화한 사람들은 특정 방향으로 견해가 바뀌지 않았다. 그러나 모델이 특정 입장을 옹호하도록 지시받았을 때, 모델은 강력한 설득자가 되었다. 특정 정책을 옹호하도록 지시받은 모델과 대화한 참가자들은 자신의 견해를 해당 모델과 일치하도록 평균 10퍼센트 포인트 이상 변화시켰다. 이 효과는 전문적인 정치 캠페인 광고의 영향력과 맞먹거나 때로는 이를 능가할 정도로 강력했다.
결정적으로, 연구는 이러한 설득력이 개인의 배경에 따라 달라지지 않는다는 것을 발견했다. 참가자가 고등 교육을 받았는지, 뉴스를 밀접하게 팔로우하는지, 혹은 인공지능에 매우 익숙한지 여부는 중요하지 않았다. 그 영향력은 이러한 요인들과 관계없이 모두에게 똑같이 강력하게 작용했다. 그러나 논쟁의 방향이 참가자 자신의 정당과 관련하여서는 놀라운 방식으로 차이가 있었다. 연구진은 참가자들이 모델이 자신의 정당에 반대하는 주장을 할 때는 견해를 바꿀 가능성이 더 낮았고, 모델이 자신의 정당에 부합하는 주장을 할 때는 더 높다는 것을 발견했다. 또한 연구진은 모델이 단순히 사용자가 이미 생각하고 있는 것에 동조하는 것이 아니라는 점을 입증했다. 왜냐하면 모델은 대화가 시작되기 전에 특정 측을 옹호하도록 지시받았고, 사용자 또한 자신의 견해를 모델에게 미리 말하지 않았기 때문에, 모델은 사용자를 미러링(mirroring)할 수 없었다. 대신, 모델은 진정으로 대화에 영향을 미치고 있었다.
이러한 발견은 인공지능 도구들이 스스로 내버려 두었을 때는 중립적인 정보원처럼 보일지라도, 유도될 경우 정치적 의견을 형성할 수 있는 숨겨진 능력을 갖추고 있음을 시사한다. 연구진은 이러한 영향력이 모델이 영혼이나 독자적인 정치적 의제를 가지고 있기 때문이 아니라, 모델이 구축되고 지시되는 방식의 결과라고 강조한다. 만약 정부나 기업이 여론에 영향을 미치고자 한다면, 그들은 선전 기계를 만들 필요가 없다. 그저 수백만 명이 이미 사용하고 있는 모델에 주어진 지침을 조정하기만 하면 된다. 연구는 이 도구들이 검색 엔진부터 개인 비서에 이르기까지 우리의 일상생활에 깊숙이 자리 잡음에 따라, 이들을 튜닝하는 방식이 우리가 세상을 이해하고 투표하는 방식에 심대한 결과를 초래할 것이라고 결론짓는다. 사람의 마음을 바꾸는 힘은 더 이상 인간 연설가들에게만 국한되지 않는다. 그것은 이제 우리가 매일 대화하는 소프트웨어 안에 코드로 입력될 수 있다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.