Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models
이 논문은 서로 다른 아키텍처 내부 및 상호 간의 여러 거대 언어 모델로부터 출력을 집계하는 것이 추정 오차를 유의미하게 줄이고 불확실성에 대한 메타인지적 인식을 드러내며, 조직적 의사결정을 위한 인간 군집 지능의 확장 가능한 대안을 제공한다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: AI가 더 똑똑한 답을 "크라우드소싱"할 수 있을까?
거대한 황소의 무게를 맞히는 게임을 한다고 상상해 보세요. 만약 한 사람에게 물어본다면, 그 사람은 완전히 틀릴 수도 있습니다. 하지만 100명에게 물어보고 그들의 추측치를 평균 내면, 그 결과는 종종 놀라울 정도로 정확합니다. 이것이 바로 그 유명한 "대중의 지혜(Wisdom of the Crowd)"입니다.
수십 년 동안 인간은 이 기술을 사용해 왔습니다. 하지만 100명을 모으는 것은 느리고, 비용이 많이 들며, 조직하기 어렵습니다.
이 논문은 새로운 질문을 던집니다. GPT-5, Gemini, Claude와 같은 대규모 언어 모델(LLM)을 사용하여 "인공적인 대중(Artificial Crowd)"을 만들 수 있을까? 100명의 인간에게 묻는 대신, 하나의 AI에게 30번 묻거나, 세 종류의 서로 다른 AI에게 각각 10번씩 물어봄으로써 단 한 번의 질문보다 더 나은 답을 얻을 수 있을까요?
실험: "추측 게임"
연구진은 이를 테스트하기 위해 통제된 게임을 설정했습니다. AI에게 "대통령이 누구인가?"와 같은 단순한 질문을 하지 않았습니다. AI는 그런 사실들을 단순히 암기하고 있기 때문입니다. 대신, 추측과 추론이 필요한 8가지 까다로운 추정 문제를 제시했습니다. 예시는 다음과 같습니다:
- "뉴욕 지하철 시스템 전체를 처음부터 다시 구축하는 데 드는 비용은 얼마인가?"
- "자동차 한 대가 수명 동안 사용하는 가솔린의 양은 얼마인가?"
- "특정 회사의 내년 주가는 얼마가 될 것인가?"
그들은 AI를 마치 사람들의 군중처럼 취급했습니다. 세 가지 주요 전략을 사용했습니다:
- 솔로 아티스트 (The Solo Artist): 특정 AI 하나(예: 오직 GPT-5만)에게 동일한 질문을 30번 반복해서 물었습니다. AI는 약간 무작위적이기 때문에(마치 사람이 '컨디션이 좋은 날'이나 '나쁜 날'이 있는 것처럼), 30번의 답변이 조금씩 다르게 나타났습니다.
- 전문가 패널 (The Panel of Experts): 세 종류의 서로 다른 AI(GPT-5, Gemini, Claude)에게 동일한 질문을 각각 10번씩 물었습니다.
- 전체 평균 (The Grand Average): 이 모든 답변을 가져와 평균을 내어, 이 "군중"이 개별 AI 하나보다 더 똑똑한지 확인했습니다.
연구 결과
1. 군중이 더 똑똑하다 (대체로)
인간의 경우와 마찬가지로, "인공적인 군중"은 보통 단일 AI의 추측보다 더 정확했습니다.
- 비유: 세 명의 친구가 유리병 안에 든 젤리빈의 개수를 맞히는 상황을 상상해 보세요. 한 명은 500개, 한 명은 1,000개, 다른 한 명은 2,000개라고 추측합니다. 이들의 평균은 1,166개입니다. 만약 실제 정답이 1,100개라면, 평균값은 각 친구의 개별 추측보다 훨씬 정답에 가깝습니다.
- 결과: 답변들을 평균 냄으로써 오차가 크게 줄어들었습니다. 어떤 경우에는 "군중"이 단일 AI의 추측보다 최대 37% 더 정확했습니다.
2. "에코 체임버(메아리 방)" 문제
동일한 AI에게 30번을 물었을 때도 도움이 되었지만, 서로 다른 AI들에게 물었을 때만큼은 아니었습니다.
- 비유: 만약 한 사람에게 30번을 묻는다면, 그 사람은 똑같은 실수를 30번 반복하거나, 혹은 그 사람의 "기분"이 30번의 추측 모두를 잘못된 방향으로 편향시킬 수 있습니다.
- 결과: 서로 다른 유형의 AI를 섞는 것(전문가 패널)이 가장 효과적이었습니다. 왜냐하면 그들은 서로 다른 종류의 실수를 저질렀고, 그 실수들이 서로 상쇄되었기 때문입니다.
3. "신뢰도 측정기"의 작동
연구진은 AI에게 단순히 숫자만 주는 것이 아니라, "신뢰 구간"(자신이 생각하는 정답이 존재할 범위)도 함께 제시하도록 요청했습니다.
- 비유: 기상 캐스터가 "비가 올 것이며, 오후 1시에서 3시 사이에 올 확률이 90%입니다"라고 말하는 것과 같습니다.
- 결과: AI는 자신이 불확실할 때를 인지하는 능력이 놀라울 정도로 뛰어났습니다. 넓은 범위(예: "10에서 100 사이 어디쯤일 수 있습니다")를 제시했을 때는 대개 틀렸습니다. 반면 좁은 범위(예: "확실히 40에서 42 사이입니다")를 제시했을 때는 대개 맞았습니다. 이는 AI가 자신의 불확실성에 대한 일종의 "자기 인식"을 가지고 있음을 시사합니다.
4. 모든 추측이 평등하지 않다
"군중"은 주가나 경제 트렌드와 같이 역사적 패턴이 존재하는 문제에서 가장 잘 작동했습니다.
- 비유: 지난 10년간의 데이터를 가지고 있다면 7월의 평균 기온을 맞히기는 쉽습니다. 하지만 한 번도 건설된 적 없는 가상의 지하철 시스템 구축 비용을 맞히는 것은 매우 어렵습니다.
- 결과: AI 군중은 트렌드를 예측하는 데는 뛰어났지만, 과거 데이터에 의존할 수 없는 완전히 새롭고 창의적인 "만약에(what-if)" 시나리오에서는 고전했습니다.
결론
이 논문은 AI가 "대중의 지혜"를 모방할 수 있음을 증명합니다. 여러 개의 AI 모델을 사용하거나(또는 하나의 모델에게 여러 번 묻음으로써) 답변을 평균 내면, 단일 AI에 의존하는 것보다 훨씬 더 정확한 결과를 얻을 수 있습니다.
또한, 이 논문은 AI 모델들이 자신이 맹목적으로 추측하고 있을 때(넓은 신뢰 범위를 제시함으로써)를 알려줄 수 있다는 점을 보여주며, 이는 AI를 활용해 의사결정을 내리려는 사람들에게 유용한 도구가 됩니다. 다만, 이 "슈퍼 군중"은 순수한 상상력보다는 어떤 데이터나 역사가 가이드 역할을 해줄 수 있는 상황에서 가장 잘 작동합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.