When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs
이 논문은 난도가 높은 과학 문제에 대해 소규모 지시 미세 조정(instruction-tuned) LLM의 경우, 생성된 답변들 사이의 높은 일치도가 정확도와 반드시 상관관ที่ 있는 것은 아니기 때문에 다수결 투표를 통한 자기 일관성(self-consistency) 방식이 단일 샘플 추론보다 오히려 정확도를 낮추는 경우가 많음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
정말 까다로운 수수께끼를 풀려고 노력하고 있다고 상상해 보세요. 친구에게 답을 물어봤는데, 친구는 확신이 없어 보입니다. 그래서 당신은 똑같은 수수께끼를 열 번 물어봅니다. 만약 친구가 여덟 번이나 같은 답을 한다면, 당신은 아마 이렇게 생각할 것입니다. "좋아, 저 말이 맞는 게 분명해!" 이것은 현대의 컴퓨터 두뇌라고 불리는 거대 언어 모델(LLM)이 똑똑해지려고 노력하는 방식과 매우 비슷합니다. 단 한 번 추측하는 대신, 이들은 종종 문제를 여러 번 "생각"하도록 하여 다양한 사고 과정을 생성하게 한 뒤, 가장 자주 등장하는 답을 선택합니다. 이 기술을 **자기 일관성(Self-Consistency)**이라고 부릅니다. 이것은 마치 군중에게 투표를 요청하는 것과 같습니다. "다수결"이 거의 항상 정답일 것이라는 아이디어입니다.
이것이 왜 중요할까요? 왜냐하면 이 컴퓨터 두뇌들이 생물학에서 물리학에 이르기까지 어려운 과학 문제들을 해결하는 데 사용되고 있기 때문입니다. 만약 이 "군중 투표" 기술이 효과가 있다면, 우리는 컴퓨터가 더 나은 결과를 얻을 수 있도록 더 오래, 더 열심히 생각하게 만들 수 있습니다. 하지만 만약 그 군중이 실제로 틀렸다면 어떨까요? 만약 컴퓨터가 틀린 답에 대해 너무 확신한 나머지, 여러 번 물어볼수록 오히려 자신의 잘못된 생각에 더 깊이 빠져들게 된다면 어떻게 될까요? 이것이 바로 이 논문이 던지는 무서운 질문입니다. 연구진은 알고 싶었습니다. 가장 어려운 과학 문제들에 대해, 컴퓨터에게 자신의 답에 투표하게 하는 것이 실제로 도움이 될까요, 아니면 오히려 상황을 악화시킬까요?
투표의 역설: 대규모 투표의 역효과
이 연구에서 연구진은 두 가지 인기 있는 소형 컴퓨터 두뇌(하나는 Qwen2.5-7B, 다른 하나는 Llama-3-8B라고 불림)를 사용하여 GPQA Diamond라는 매우 어려운 테스트를 수행했습니다. 이 테스트에는 생물학, 화학, 물리학 분야의 대학 졸업 수준의 과학 문제 198개가 포함되어 있습니다. 이는 대학 4학년 학생들도 땀을 흘리게 할 만한 수준입니다.
연구팀은 이 모델들이 자신의 답에 대해 "투표"하게 될 때 어떤 일이 일어나는지 알아보기 위해 정교하고 계획된 방법을 사용했습니다. 그들은 모델이 각 문제를 해결하기 위해 최대 64번의 시도를 생성하도록 했고, 그 후 가장 흔하게 나온 답(다수결)을 채택했습니다.
여기 반전이 있습니다: 다수결이 역효과를 냈습니다.
더 똑똑해지는 대신, 컴퓨터 두뇌들은 대부분의 문제에서 오히려 성능이 저하되었습니다.
- Qwen 모델의 경우, 투표 방식이 문제의 **56.6%**에서 정확도를 떨어뜨렸습니다.
- Llama 모델의 경우, **65.7%**의 문제에서 성능이 저하되었습니다.
이렇게 생각해 보세요: 어떤 학생이 어려운 수학 시험을 보고 있습니다. 학생은 문제에 대해 확신이 없어서, 스스로에게 "답이 뭐지?"라고 열 번 물어봅니다. 만약 학생이 머릿속으로 똑같은 실수를 여덟 번 반복했다면, "다수결"은 그 학생에게 그 틀린 답을 높은 확신을 가지고 선택하라고 말합니다. 더 많이 물어볼수록, 학생은 그 틀린 답에 더 확신을 갖게 됩니다. 논문에서는 이를 "역효과(backfire)"라고 부릅니다. 이 어려운 과학 문제들에 있어서, 컴퓨터의 확신은 거짓말쟁이였습니다.
"오라클(Oracle)"의 꿈 vs 현실
연구진은 그다음으로 실질적인 질문을 던졌습니다: "언제 투표를 하고 언제 그냥 한 번만 추측할지를 알려줄 수 있는 저렴하고 똑똑한 필터를 만들 수 있을까?"
그들은 완벽한 "오라클"(정답을 알고 있는 마법 같은 안내자)을 상상했습니다. 만약 이 오라클이 각 문제를 보고 "이 문제에는 64번 투표하세요"라고 말하거나, "저 문제에는 그냥 한 번만 추측하세요"라고 말할 수 있다면, 모델들의 점수는 14~17 퍼센트 포인트나 향상될 수 있었을 것입니다. 이는 엄청난 도약입니다!
하지만 연구진은 이 마법 같은 오라클을 대체할 수 있는 저렴한 대안으로서 두 가지 실제적인 "검증기 없는(verifier-free)" 신호를 테스트했습니다:
- 합의 게이트(The Agreement Gate): "답들이 서로 충분히 일치한다면, 투표를 믿으라."
- 엔트로피 게이트(The Entropy Gate): "컴퓨터가 '불확실'해 보이면(높은 엔트로피) 투표하지 말고, '확실'해 보이면(낮은 엔트로피) 투표하라."
결과는 어땠을까요? 두 게이트 모두 실패했습니다.
두 방법 모두 마법 같은 오라클의 잠재력에 근처에도 가지 못했습니다. 사실, 이 게이트들을 사용하는 것은 단순히 64번 투표하는 것과 비교했을 때 점수를 전혀 개선하지 못했습니다. "합의 게이트"는 너무 쓸모가 없어서 차이를 거의 만들지 못했습니다(0.002 미만의 차이). "엔트로피 게이트" 역시 막다른 길이었습니다.
왜 이런 일이 일나?
논문은 문제가 단순하지만 좌절스럽다는 점을 설명합니다: 확신이 곧 정답은 아니라는 것입니다.
이러한 어려운 과학 문제에서 컴퓨터 모델들은 종종 틀린 답에 갇혀버립니다. 64개의 답을 생성할 때, 그들은 똑같은 틀린 답을 50번 생성할 수도 있습니다. 그러면 "다수결"은 틀린 답에 대한 50표를 보고 "이것이 반드시 맞을 거야!"라고 말합니다. 컴퓨터는 자신 있게 틀리고 있는 것입니다.
연구진은 데이터를 살펴보고 Llama 모델에 대해 흥미로운 사실을 발견했습니다: 답들이 가장 많이 일치했던 문제들이 실제로는 정확도가 가장 낮았습니다. 컴퓨터가 스스로와 더 많이 일치할수록, 오히려 틀릴 가능성이 높았습니다. 이는 마치 친구 무리가 모두 형편없는 영화 줄거리에 동의하는 것과 같습니다. 더 많이 동의할수록, 그 줄거리가 엉터리라는 것을 더 잘 알게 되는 것과 같습니다.
이것이 의미하는 바
논문은 결론적으로, 이러한 특정 어려운 과학 문제들에 대해서는 "더 많이 생각하는 것"이나 "투표하는 것"이 도움이 될 것이라고 단순히 가정해서는 안 된다고 말합니다.
- 나쁜 소식: 컴퓨터의 동의 여부에 의존하여 그것이 맞는지 판단하려 한다면, 속을 수 있습니다. "다수"는 종-종 틀립니다.
- 좋은 소식: 우리는 왜 이것이 실패하는지 정확히 알고 있습니다(확신이 정확성을 추적하지 못함). 또한, 합의나 불확실성을 확인하는 것과 같은 간단한 트릭들이 해결책이 되지 못한다는 것도 알고 있습니다.
- 열린 질문: 연구진은 최신 "추론 특화(reasoning-native)" 모델(논리 설계를 위해 특별히 만들어진 초고성능 모델들)은 테스트하지 않았습니다. 그들은 이를 미래의 미스터리로 남겨두었습니다. 아마도 이 새로운 모델들은 역효과를 내지 않을지도 모릅니다. 아직은 알 수 없습니다.
요약하자면, 가장 어려운 과학 문제들에 있어서 컴퓨터에게 자신의 답에 투표하게 하는 것은 종종 자신의 실수를 고착화시키는 결과를 낳습니다. 진정한 이득을 얻으려면, 단순히 더 큰 목소리로 투표하는 것이 아니라, 작업을 검증할 수 있는 더 똑똑한 방법이 필요할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.