Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles
이 논문은 학습된 방법을 통해 다양한 거대 언어 모델의 예측을 결합하는 것이 개별 모델의 성능을 능가할 수 있음을 입증하는 동시에, 학습 중단 시점의 오염이 능력 평가를 심각하게 왜곡한다는 점과 이러한 앙상블의 주요 이점이 복잡한 비선형적 상호작용보다는 다양한 모델 출력의 선형적 결합에서 기인한다는 점을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
방 안에서 가장 똑똑한 사람이 실제로는 가장 똑똑한 것이 아닌 세상을 상상해 보십시오. 대신, 테이블에 둘러앉은 집단 전체가 진정한 천재입니다. '대중의 지혜'라고 알려진 이 아이디어는, 많은 사람의 추측을 모아 평균을 내면 그 결과가 단 한 명의 최고 전문가의 추측보다 더 정확한 경우가 많다는 것을 시사합니다. 마치 새 떼를 생각해보십시오. 단 한 마리의 새는 전체 그림을 보지 못하지만, 함께 모여 완벽하게 항해합니다. 과학자들은 이것이 인간에게도 적용된다는 사실을 오래전부터 알고 있었습니다. 하지만 이제 인공지능(AI)이 어디에나 존재하는 시대가 되면서, 큰 질문 하나가 떠올랐습니다. 이 마법 같은 기술이 로봇들에게도 통할까요? 만약 여러 가지 AI 모델에게 미래 사건의 결과를 추측하게 한다면, 그들의 결합된 답변이 단일 AI보다 더 똑똑할까요? 이것은 단순히 재미있는 게임이 아닙니다. 왜냐하면 만약 AI 군집이 작동한다면, 우리는 인간 전문가 팀 없이도 날씨부터 주식 시장에 이르기까지 모든 것을 예측하는 데 사용할 수 있기 때문입니다. 하지만 여기에는 함정이 있습니다. AI 모델들은 과거의 데이터로 학습되었으며, 만약 그들이 이미 학습 데이터에서 정답을 '보았다면', 그것은 진정한 추측이 아니라 기억을 이용한 일종의 부정행위가 됩니다.
이 논문은 15개의 서로 다른 거대언어모델(LLM)을 예측 게임의 참가자 팀처럼 취급하며 바로 그 질문을 파고듭니다. 연구진은 이 AI들에게 스포츠 팀이 승리할지 혹은 정치인이 당선될지와 같이 실세계의 254가지 질문에 대한 결과를 추측하도록 요청했습니다. 그러고 나서 연구진은 집단이 개별 모델을 이길 수 있는지 확인하기 위해 다양한 방식으로 AI의 답변을 결합해 보았습니다. 결과는 흥미로운 소식과 중대한 경고 문구가 뒤섞인 형태였습니다.
먼저 좋은 소식입니다. '대중의 지혜'는 AI에게도 적용되는 것처럼 보이지만, 오직 올바르게 결합했을 때만 그렇습니다. 연구진은 단순히 모든 AI의 추측을 평균 내는 것이 최선의 전략은 아니라는 것을 발견했습니다. 대신, 그들은 답변을 어떻게 섞을지 결정하기 위해 영리한 컴퓨터 프로그램('학습된 집계기')을 사용했습니다. 이 똑똑한 믹서는 단일 AI 모델보다 더 나은 성과를 냈으며, 단순 평균보다도 더 뛰어났습니다. 흥미롭게도, 이 연구는 이러한 개선이 AI 믹서가 복잡하고 마법 같은 수학을 수행했기 때문이 아니라고 제안합니다. 그 대신, 이 믹서는 모델들이 서로 다른 종류의 실수를 저지르는 데 더 많은 가중치를 두는 법을 배웠기 때문에 효과가 있었습니다. 이는 마치 스포츠 코치가 한 선수는 수비에는 강하지만 공격에는 약하고, 다른 선수는 그 반대라면, 이들을 함께 배치하여 모든 상황을 대비하는 것을 깨닫는 것과 같습니다. 연구는 단순한 선형 결합—기본적으로 가중 평균—만으로도 최상의 결과를 얻기에 충분했다는 것을 발견했으며, 이는 AI 군집 지혜의 핵심이 복잡한 상호작용이 아니라 오류의 다양성에 있음을 시사합니다.
하지만 모든 것을 바꾸는 거대한 "하지만"이 존재합니다. 연구진은 많은 AI 모델이 비밀리에 부정행위를 하고 있다는 사실을 발견했습니다. 이 모델들은 특정 시점까지의 방대한 인터넷 데이터를 학습했기 때문에, 학습이 멈추기 전에 해결된 질문들에 대한 답을 종종 '기억'하고 있었습니다. 이를 '오염(contamination)'이라고 합니다. 연구진이 AI가 이미 답을 알고 있을 수 있는 모든 질문을 걸러내자, 결과는 극적으로 변했습니다. 비싸고 화려한 '클라우드' 모델과 작고 로컬 기반인 모델 사이의 거대한 격차는 거의 사라졌습니다. 대규모 모델들은 기억에 의존할 수 없을 때 훨씬 덜 인상적으로 보였습니다. 실제로, 최고의 AI 군집조차도 사람들이 실시간으로 결과에 돈을 거는 실제 인간 예측 시장보다 현저히 떨어졌습니다. 인간 시장은 AI 군집이 보고 있는 것과 동일한 정보를 보고 있음에도 불구하고, AI 군집보다 약 두 배 더 정확했습니다.
그렇다면 시사점은 무엇일까요? AI 군집은 똑똑할 수 있지만, 자신의 기억에 의해 쉽게 속을 수 있습니다. 만약 당신이 AI가 실제로 미래를 예측하는 데 능숙한지 알고 싶다면, 그것이 학습을 마친 이후에 일어난 일들로 테스트해야 합니다. 그때까지 AI 군집의 '지혜'는 무엇을 알아낼 수 있는지보다는, 그것이 이미 알고 있는 것이 무엇인지를 반영하는 것에 불과할 것입니다. 이 연구는 우리가 서로 다른 모델을 섞음으로써 더 나은 AI 팀을 구축할 수는 있지만, 인간 군집의 역동적이고 실시간적인 지능에 도달하기까지는 여전히 갈 길이 멀다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.