← 최신 논문
🤖 AI

Large language models accurately predict public perceptions of support for climate action worldwide

이 사전 등록된 연구는 거대 언어 모델, 특히 Claude가 국가 수준의 지표를 사용하여 기후 행동에 대한 지지 및 이와 관련된 인식 격차에 관한 전 세계적 대중 인식을 정확하게 예측할 수 있음을 입증하며, 이는 전통적인 설문조사를 대체할 수 있는 신속하고 비용 효율적인 대안을 제공하는 동시에 사회적 투영에서 나타나는 체계적인 하향 편향을 드러낸다.

원저자: Nattavudh Powdthavee, Sandra J. Geiger

게시일 2026-01-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nattavudh Powdthavee, Sandra J. Geiger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: "침묵하는 다수"

모두가 청소를 하고 싶어 하는 거대한 파티를 상상해 보세요. 실제로 약 89%의 사람들이 정부가 기후 변화에 대해 더 많은 일을 하기를 원하며, 69%는 도움을 위해 약간의 돈을 기꺼이 보태려 합니다.

하지만 문제는 아무도 이를 모른다는 것입니다.

대부분의 사람들은 "오, 다른 사람들은 그냥 소파에 앉아서 아무것도 안 하겠지"라고 생각하며 파티에 들어섭니다. 이것을 **복수적 무지(pluralistic ignorance)**라고 부릅니다. 모두가 다른 사람들은 신경 쓰지 않는다고 생각하기 때문에, 아무도 목소리를 높이거나 기여하지 않습니다. 그들은 모두 누군가가 먼저 시작하기를 기다리며, 침묵과 무행동의 순환을 만들어냅니다.

새로운 도구: "슈퍼 오라클(Super-Oracle)"

오랫동안 사람들이 진정으로 어떻게 생각하는지(그리고 그들이 타인이 어떻게 생각한다고 믿는지)를 알아내는 유일한 방법은 전 세계 수천 명의 사람들에게 비싼 설문조사를 보내는 것이었습니다. 이것은 마치 파티의 모든 손님을 인터뷰하기 위해 탐정 팀을 고용하는 것과 같습니다. 시간이 엄청나게 오래 걸리고 비용도 막대하게 듭니다.

이 논문의 저자들은 새로운 질문을 던졌습니다: 인공지능(특히 거대언어모델, LLM)이 단 한 번의 설문조사 없이도 이러한 감정을 추측하는 "슈퍼 오라클" 역할을 할 수 있을까?

그들은 네 가지 유명한 AI 모델(GPT-4o mini, Claude 3.5 Haiku, Gemini 2.5 Flash, Llama 4 Maverick)을 테스트하여, 이 모델들이 125개국에서 사람들이 서로의 협력 의지를 얼마나 과소평가하는지 예측할 수 있는지 확인했습니다.

결과: AI는 (대체로) 정답을 맞혔다

연구진은 AI를 시험을 치르는 학생처럼 취급했습니다. 그들은 AI에게 125개국의 실제 데이터(GDP, 인터넷 사용량, 실제 설문 결과 등)를 주고, "인식 격차"(사람들이 타인이 할 것이라고 생각하는 정도와 실제로 타인이 할 의지가 있는 정도 사이의 차이)를 추측하도록 했습니다.

  • 최고의 성과자: Claude라는 모델은 놀라울 정도로 정확했습니다. 이 모델은 오차 범위가 약 5%포인트에 불과할 정도로 인식 격차의 크기를 정확히 맞혔습니다. 이는 전통적인 통계 컴퓨터 모델만큼 뛰어난 성능이었습니다.
  • 2위: Llama 역시 훌륭한 성과를 보였습니다.
  • 고전한 모델들: 나머지 두 모델(GPT와 Gemini)은 정확도가 떨어졌으며, 종종 격차가 실제보다 작다고 추측했습니다.

비유하자면: 이웃들이 새로운 공원을 위해 얼마를 지불할 용의가 있는지 추측하는 상황을 생각해 보세요. 최고의 AI 모델들은 동네의 소득과 인구 통계를 살펴보고 이렇게 말했습니다. "그들은 이웃들이 돈을 많이 내지 않을 것이라고 생각하지만, 실제로는 낼 용의가 아주 많습니다." 그들은 수학적 계산을 제대로 해낸 것입니다.

AI는 어떻게 해냈나? ("마법"인가 "추론"인가)

연구진은 AI가 단순히 부정행위를 하는 것이 아닌지 우려했습니다. 이 모델들은 인터넷의 방대한 텍스트로 학습되었기 때문에, 최근에 발표된 특정 설문조사의 답을 단순히 "암기"했을 수도 있기 때문입니다.

이를 테스트하기 위해 그들은 "차이점 찾기" 게임을 진행했습니다:

  1. "이름 바꾸기" 테스트: 그들은 AI에게 "프랑스라고 말하겠지만, 여기는 나이지리아의 경제 지표입니다"라고 말했습니다. 만약 AI가 단순히 "프랑스 = X"라고 암기하고 있었다면 X라고 답했을 것입니다. 하지만 AI는 나이지리아의 지표를 보고 그에 기반하여 추측했습니다. 이는 AI가 단순히 대본을 읊는 것이 아니라 추론하고 있음을 증명했습니다.
  2. "정보 누락" 테스트: 그들은 AI가 여전히 추측할 수 있는지 확인하기 위해 특정 사실(예: 소득 수준)을 제거했습니다. 가장 뛰어난 모델들(Claude와 Llama)은 가장 중요한 단서가 바로 **"사람들이 스스로를 돕고자 하는 의지가 얼마나 되는가?"**라는 점을 깨달았습니다. 사람들이 스스로를 도울 의지가 있다면, 타인도 그럴 것이라고 가정합니다. 이것은 **사회적 투사(social projection)**라고 불리는 심리학적 개념입니다.

결론: AI는 단순히 답을 찾는 사전가 아니었습니다. 그것은 인간이 인간을 어떻게 생각하는지에 대한 논리를 사용하여 작동하는 똑똑한 심리학자처럼 행동했습니다.

AI는 어디에서 가장 잘 작동하는가?

AI가 모든 곳에서 똑같이 잘 작동하는 것은 아닙니다.

  • "하이테크" 구역: 유럽이나 북미와 같이 부유하고 인터넷 사용률이 높은 국가에서는 AI가 매우 정확했습니다. 이는 마치 특정 지역에 대한 방대한 도서관 자료를 가진 탐정과 같습니다.
  • "로우테크" 구역: 가난하거나 인터넷 접속이 적은 국가에서는 AI의 정확도가 떨어졌습니다. 이는 AI가 주로 부유하고 연결된 국가들의 데이터로 학습되었기 때문입니다. 이는 마치 외딴 마을을 방문해 본 적이 없어 스테레오타입(고정관념)에 의존해 추측해야 하는 탐지와 같습니다.

이것이 의미하는 바는 무엇인가?

이 논문은 AI가 전 세계적인 인식 격차를 측정하는 **빠르고 저렴한 "온도계"**가 될 수 있다고 결론짓습니다.

  • 부유한 국가에서는 값비싼 설문조사를 대체할 수 있습니다.
  • 가난한 국가에서는 문제가 어디서 가장 심각한지 알려주는 "대략적인 추정치"를 제공하여, 나중에 실제 인간 조사원을 어디로 보내야 할지 알 수 있게 해줍니다.

중요한 점은, 이 논문이 AI가 기후 변화를 해결할 수 있다거나 우리가 실제 설문조사를 완전히 중단해야 한다고 주장하는 것이 아니라는 점입니다. 단지 AI가 우리가 생각하는 것과 실제 사실 사이의 "보이지 않는" 격차를 파악하는 데 강력한 새로운 도구가 되어, 대화를 어디서부터 시작해야 할지 알려줄 수 있다고 말하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →