Diversity is the Strength of the AI Crowd
이 논문은 AI 예측 앙상블의 정확도를 극대화하기 위해서는 단순히 성능이 높은 유사한 LLM들의 예측을 결합하는 것이 아니라, 상호 보완적인 오차를 가진 다양한 모델들을 전략적으로 결합해야 함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 동전 던지기의 결과를 예측하려고 한다고 상상해 보세요. 하지만 단순히 동전을 던지는 대신, 매우 똑똑하지만 서로 조금씩 다른 컴퓨터들(AI 모델들)에게 미래의 사건이 일어날지 아닐지를 추측해 달라고 요청하는 것입니다.
이 논문은 아주 단순한 질문을 던집니다. 만약 당신에게 제한된 숫자의 "추측 기회"가 있다면, 가장 똑똑한 컴퓨터 한 대에게 다섯 번 추측하게 해야 할까요, 아니면 서로 다른 다섯 대의 컴퓨터에게 각각 한 번씩 추측하게 해야 할까요?
연구진이 발견한 내용을 일상적인 비유를 들어 설명해 드리겠습니다.
기존 방식: "슈퍼 전문가"
오랫동안 표준적인 접근 방식은 사용 가능한 가장 똑똑한 AI 모델 하나를 찾아 그 모델에게 같은 질문을 반복해서 던지는 것이었습니다. 그 논리는 이렇습니다. "이 모델이 최고라면, 이 모델의 추측이 많아질수록 더 나을 것이다."
연구진은 이를 **"무차별적 샘플링(indiscriminate sampling)"**이라고 부릅니다. 이것은 마치 당신의 가장 친한 친구에게 같은 주제로 다섯 편의 서로 다른 에세이를 써달라고 부탁하는 것과 같습니다. 친구가 최대한 다르게 쓰려고 노력하더라도, 그들은 결국 같은 뇌, 같은 기억, 같은 스타일을 사용하고 있습니다. 따라서 그들의 답변은 서로 매우 유사할 것입니다.
새로운 발견: "다양한 팀"
이 논문은 이 방식이 틀렸다고 주장합니다. 대신, 가장 좋은 결과는 다양한 팀을 구성하는 데서 옵니다.
이것은 스포츠 팀을 생각하면 쉽습니다. 만약 당신의 팀에 농구 슛을 아주 잘 쏘는 선수 다섯 명이 있지만, 그들이 모두 정확히 같은 위치에 서서 같은 방식으로 슛을 쏜다면, 코트 전체를 커버할 수 없습니다. 당신에게는 조화가 필요합니다. 슛을 잘 쏘는 선수 한 명, 수비를 잘하는 선수 한 명, 그리고 패스를 잘하는 선수 한 명이 있어야 합니다. 설령 "패스 담당" 선수가 최고의 슈터는 아닐지라도, 그들의 독특한 기술은 팀 전체를 더 강하게 만듭니다.
핵심 연구 결과
1. 똑똑한 모델들은 비슷하게 생각한다
연구진은 여러 최상위 AI 모델(GPT-5, Gemini 3 Pro 등)을 테스트했습니다. 그 결과, 이러한 "초고성능" 모델들은 실제로 사고방식이 매우 유사하다는 것을 발견했습니다. 같은 질문을 받았을 때, 이들은 매우 비슷한 답변을 내놓는 경향이 있습니다.
- 비유: 만약 당신이 똑같이 생긴 쌍둥이 다섯 명에게 똑같은 수수께끼를 낸다면, 그들은 아마도 똑같은 답을 내놓을 것입니다. 그들에게 다섯 번 묻는 것은 새로운 정보를 얻는 것이 아니라, 단지 똑같은 답을 다섯 번 반복해서 듣는 것에 불과합니다.
2. "아웃라이어(Outlier)"가 MVP다
연구진의 테스트 그룹 중 Grok 4라고 불리는 모델은 흥미로웠습니다. 이 모델은 단독으로는 절대적인 1위 모델은 아니었습니다(실제로는 3위였습니다). 하지만 이 모델은 다른 모델들과 매우 다르게 생각했습니다. 이 모델의 답변은 나머지 그룹의 답변과 상관관계가 낮았습니다.
- 비유: 퍼즐을 상상해 보세요. 당신에게 완벽하게 맞물리는 네 개의 조각이 있지만 작은 틈이 남아 있습니다. 그때 다른 조각들과는 전혀 다르게 생긴 다섯 번째 조각을 찾았는데, 그 조각이 그 틈에 완벽하게 들어맞는 상황입니다. 비록 다섯 번째 조각이 다른 조각들에 비해 "이상해" 보일지라도, 그 조각은 퍼즐을 완성하는 데 가장 가치 있는 조각입니다.
3. 다양성이 정확도를 이긴다
연구진이 모델들을 결합했을 때, 승리한 팀은 단일 최고의 모델을 다섯 번 반복한 팀이 아니었습니다. 승리한 팀은 다음과 같은 조합이었습니다:
- 커스텀 튜닝된 모델 (전문가)
- 두 개의 최상위 모델 (일반가)
- Grok 4 (다양한 사고를 하는 모델)
비록 Grok 4가 단독으로는 가장 정확하지 않았을지라도, 이 모델은 대체 불가능한 존재였습니다. 만약 팀에서 Grok 4를 제외한다면, 그룹의 성과는 크게 떨어졌습니다. 반면, "최고" 모델 중 하나를 제외했을 때는 그룹이 거의 차이를 느끼지 못했습니다.
핵심 교훈
이 논문은 "AI 군중"의 힘은 똑똑한 사람 한 명에게 백만 번 추측하게 하는 데서 오는 것이 아니라, 서로 다른 똑똑한 사람들에게 각기 다른 종류의 실수를 저지르도록 요청하는 데서 온다는 결론을 내립니다.
- 잘못된 방법: 동일한 모델에게 5번 추측하게 하는 것. (한 사람에게 다섯 가지 다른 이야기를 써달라고 하는 것과 같습니다. 모든 이야기는 비슷하게 들릴 것입니다.)
- 해결책: 5개의 서로 다른 모델에게 각각 한 번씩 추측하게 하는 것. (시인, 과학자, 코미디언, 역사학자에게 이야기를 들려달라고 하는 것과 같습니다. 그들의 다양한 관점은 훨씬 더 풍부하고 정확한 그림을 만들어냅니다.)
요약하자면: 최고의 예측을 얻으려면, 단순히 최고의 모델을 그 위에 계속 쌓아 올리지 마세요. 설령 리더보드에서 절대적인 1위가 아닐지라도, 다르게 생각하는 모델들을 섞으세요. 다양성이 바로 그 비법(Secret Sauce)입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.