← 최신 논문
🤖 machine learning

On the Effect of Sampling Diversity in Scaling LLM Inference

본 논문은 LLM 추론 과정에서 의미 있는 프롬프트 다양성을 도입하는 것이 오류율을 낮춤으로써 Best-of-NN 스케일링 성능을 유의미하게 향상시킨다는 것을 입증하는 체계적인 이론적 및 경험적 분석을 제공하며, 또한 효과적인 샘플링 전략을 안내하기 위한 다양성-충실도 트레이드오프 원칙을 확립한다.

원저자: Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

게시일 2026-08-11
📖 6 분 읽기🧠 심층 분석

원저자: Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 정말 까다로운 퍼즐, 예를 들어 복잡한 수학 문제나 코드를 작성하는 것 같은 문제를 풀려고 노력 중이라고 상상해 보세요. 당신에게는 도움을 줄 수 있는 아주 똑똑한 로봇 친구(대규모 언어 모델)가 있습니다. 하지만 여기 함정이 하나 있습니다. 만약 당신이 로봇에게 똑같은 질문을 똑같은 방식으로 열 번 던진다면, 로봇은 거의 동일해 보이는 열 개의 답변을 내놓을 수도 있습니다. 그 답변들은 모두 똑같은 방식으로 틀렸거나, 혹은 모두 솔루션 공간의 똑같은 작은 구석에 갇혀버릴 수도 있습니다. 이것은 마치 친구에게 길을 열 번 물어봤는데, 친구가 루프에 빠져 생각하는 바람에 매번 똑같은 잘못된 길로 안내하는 것과 같습니다.

이를 해결하기 위해 과학자들은 "스케일링 추론(scaling inference)"이라는 기술을 발견했습니다. 로봇에게 딱 한 번만 묻는 대신, 여러 번 묻고 그중 가장 좋은 답을 고르는 방식입니다. 하지만 이 방식이 제대로 작동하려면, 로봇이 단순히 똑같은 경로를 반복하는 것이 아니라 다양한 경로를 탐색해야 합니다. 이를 위해 우리는 로봇의 사고에 약간 다르지만 여전히 관련성이 있는 힌트를 주어 자극을 주어야 합니다. 그러면 로봇은 훨씬 더 넓은 가능성의 세계를 탐색하고 정답을 찾아낼 확률이 높아집니다. 하지만 연구자들은 함정도 발견했습니다. 만약 모든 시도 중에서 가장 "인기 있는" 답변을 고르려고 한다면, 새로운 경로를 탐색하기 위해 들인 그 모든 노력이 사실상 사라져 버려 결과가 전혀 나아지지 않을 수도 있다는 것입니다.


위대한 아이디어 찾기: 왜 다양성을 섞는 것이 로봇의 사고를 더 낫게 만드는가

자, 당신에게는 아주 똑똑한 AI 로봇이 있습니다. 이 로봇은 이야기를 쓰거나, 수학을 풀거나, 코딩을 하는 데 탁월합니다. 하지만 가끔 어려운 질문을 던지면, 로봇은 틀에 박힌 생각에 갇히곤 합니다. 마치 개가 자신의 꼬리를 쫓는 것처럼, 똑같은 종류의 답변을 계속해서 생성하며 같은 원을 맴도는 것과 같습니다. AI의 세계에서는 이를 "다양성(diversity)"의 부족이라고 부릅니다.

이 논문의 연구자들은 다음과 같은 질문을 던졌습니다: 만약 우리가 로봇이 그 원에서 벗어나도록 강제한다면 어떤 일이 벌어질까? 질문을 하는 방식을 아주 조금만 비틀어서 다시 묻는다면 어떨까? 예를 들어, "엄격한 수학 선생님처럼 생각해보세요"라고 말하거나, "창의적인 작가처럼 생각해보세요"라고 하거나, 혹은 단지 문제를 표현하는 방식을 약간 다르게 바꾸는 것입니다. 이것을 "샘플링 다양성(sampling diversity)"이라고 합니다.

핵심 아이디어는 간단합니다. 만약 당신이 로봇에게 문제를 해결하는 100가지의 서로 다른 방법을 시도하라고 한다면, 그 100가지 방법이 서로 매우 다를수록, 적어도 그중 하나는 정답일 확률이 훨씬 높아집니다. 이것이 바로 "Best-of-N" 전략입니다: 여러 가지를 시도하고, 그중 가장 좋은 것을 고르는 것이죠. 하지만 백만 달러짜리 질문은 이것입니다: 어떻게 하면 그 100가지 답변을 터무니없지 않게 만들면서도 서로 다르게 만들 수 있을까?

스위트 스팟(Sweet Spot): 너무 지루하지도, 너무 이상하지도 않게

저자들은 완벽한 "넛지(nudge, 슬쩍 밀기)"를 찾기 위해 탐색을 거듭했습니다. 그들은 로봇의 생각을 흔들어 놓는 다양한 방법들을 테스트했습니다.

먼저, 그들은 무관한 아이디어를 시도했습니다. 로봇에게 수학 문제를 풀라고 하면서, 먼저 케이크 굽는 것에 대해 생각해보라고 하는 것과 같습니다. 그것은 그저 소음(noise)일 뿐입니다. 도움이 되지 않습니다. 로봇은 혼란에 빠지고, 답변은 더 나빠집니다.

그다음, 그들은 정확한 반복을 시도했습니다. 로bot에게 똑같은 단어를 사용하여 똑같은 질문을 열 번 던지는 것입니다. 그러면 로봇은 똑같은 답변을 열 번 내놓을 뿐입니다. 새로운 아이디어도 없고, 더 나은 결과도 없습니다.

하지만, 마침내 그들은 **스위트 스팟(Sweet Spot)**을 찾아냈습니다. 그들은 로봇에게 "과업에 정렬된(task-aligned)" 아이디어를 주는 실험을 했습니다. 수학 문제의 경우, "문제를 작은 단계로 나누어 생각해보세요"라거나 "특정 정리를 사용하는 것을 고려해보세요"라고 말할 수 있습니다. 이러한 힌트들은 로봇이 새로운 경로를 탐색하도록 만들 만큼 충분히 달랐지만, 여전히 수학 문제 자체와 관련이 있었습니다.

결과는 놀라웠습니다. 이 "딱 적당한" 힌트를 사용했을 때, 로봇의 성공률은 눈에 띄게 상승했습니다. 예를 들어, 'Dual'(두 번째 로봇이 아이디어를 생성하는 것을 돕는 방식)이라는 전략을 사용했을 때, 코딩 테스트인 HumanEval에서 일반적인 질문 방식보다 성공률이 4.7% 향상되었습니다. 수학 테스트인 MATH에서는 8.2% 향상되었으며, 추론 테스트인 MMLU-Pro에서는 **10.8%**나 뛰어올랐습니다.

이 논문은 "다양성-충실도 트레이드오프(diversity-fidelity trade-off)"가 존재한다고 제안합니다. 당신은 새로운 경로를 만들어낼 만큼 충분히 다른 힌트(다양성)를 주어야 하지만, 동시에 답변의 품질을 망칠 정도로 너무 달라져서는 안 됩니다(충실도). 이는 국에 향신료를 넣는 것과 같습니다. 약간 넣으면 맛있어지지만, 너무 많이 넣으면 먹을 수 없게 되고, 향신료를 전혀 넣지 않으면 지루해집니다.

함정: "투표"가 당신의 성공을 죽일 수 있는 이유

여기서 이야기에 반전이 일어납니다. 연구자들은 우리가 최종 답변을 어떻게 선택하는지도 살펴보았습니다. 보통 100개의 서로 다른 답변이 있다면, 우리는 이렇게 생각할 수 있습니다. "사람들이 가장 많이 동의하는 답이 무엇인지 보자!" 이것을 **다수결 투표(majority voting)**라고 합니다. 만약 100대의 로봇 중 51대가 "정답은 42입니다"라고 말한다면, 42가 맞겠죠?

논문은 말합니다: 잠깐만요.

그들은 만약 다수결 투표를 사용한다면, 답변들을 다양하게 만들기 위해 기울인 그 모든 노력이 헛수고가 될 수 있음을 수학적으로 증명했습니다. 왜일까요? 다수결 투표는 오직 가장 흔한 답변이 정답일 때만 작동하기 때문입니다. 하지만 답변을 다양하게 만든다면, 투표가 분산될 수 있습니다. 정답은 독특하고 훌륭할 수 있지만, 100번의 시도 중 단 5번만 나타나고, 틀린 답변이 20번 나타난다면, 다수결 투표는 틀린 답을 고르게 될 것입니다.

MATH 데이터셋을 이용한 실험에서, 그들은 다수결 투표를 사용할 때 이 화려한 다양성 기법들이 도움이 되지 않았으며, 때로는 상황을 더 악화시킨다는 것을 발견했습니다. 논문은 단 하나의 정답을 찾기 위해 다양성을 사용하려는 경우, 다수결 투표를 좋은 전략에서 명시적으로 제외합니다. 이는 모든 사람이 각자 독특한 의견을 내는 배심원단과 같습니다. 모두가 서로 다른 것에 투표한다면, 결코 결론에 도달할 수 없습니다.

이 마법은 언제 작동하는가?

연구자들은 단순히 요령을 찾는 데 그치지 않고, 이 효과가 유지되는지 확인하기 위해 모든 곳에서 테스트했습니다.

  • 온도(Temperature): 그들은 로봇이 "뜨거울 때"(매우 무작위적일 때)와 "차가울 때"(매우 엄격할 때)를 테스트했습니다. 다양성 기법은 두 경우 모두에서 작동하여, 기존의 온도 설정 위에 추가적인 상승 효과를 주었습니다.
  • 사고 단계(Thinking Steps): 로봇이 자신의 단계를 설명하는 "사고 사슬(Chain-of-Thought)" 방식에서도 테스트했습니다. 이 기법은 여전히 작동했으며, 어려운 코딩 테스트에서 **7.4%**의 상승을 보여주었습니다.
  • 누가 "생각하는가"?: 그들은 아이디어를 생성하는 데 서로 다른 로봇들을 사용했습니다. 그들은 더 똑똑한 "생각하는" 로봇이 전체 시스템을 더 좋게 만든다는 것을 발견했습니다.
  • 아이디어의 개수: 더 많은 고유한 아이디어를 주입할수록 결과가 더 좋았습니다. 100개의 서로 다른 아이디어를 사용하는 것이 단 1개를 사용하는 것보다 더 나았습니다.

하지만, 그들은 또한 이 기술이 약한 로봇들에게 가장 잘 작동한다는 점을 알아냈습니다. 만약 로봇이 이미 매우 똑똑하다면(가장 크고 강력한 모델들처럼), 추가적인 상승 폭은 작습니다. 이는 천재에게 지도를 주는 것과 같습니다. 그들은 아마 이미 길을 알고 있을 것이기 때문입니다. 하지만 똑똑하지만 천재는 아닌 로봇에게는, 그 지도가 큰 도움이 됩니다.

핵심 요약

이 논문은 AI 로봇으로부터 최대한의 성과를 얻으려는 모든 이들을 위한 가이드북입니다. 이 논문이 우리에게 알려주는 것은 다음과 같습니다:

  1. 다양성은 좋다: 로봇이 다양한 접근 방식을 시도하게 만드는 것은 정답을 찾는 데 도움이 됩니다.
  2. 넛지를 조심하라: 당신이 주는 힌트는 관련성이 있어야 합니다. 너무 이상하면 실패하고, 너무 지루하면 도움이 되지 않습니다.
  3. 그냥 투표하지 마라: 단 하나의 정답을 찾고자 한다면, 단순히 가장 인기 있는 것을 고르지 마세요. 모든 다양한 시도 중에서 단 하나의 가장 좋은 것을 고르세요.
  4. 이것은 도구이지 마법 지팡이가 아니다: 이 기술은 컴퓨팅 자원이 충분하고, 아직 완벽하지 않은 모델을 사용할 때 가장 잘 작동합니다.

저자들은 단순히 추측한 것이 아니라, 수백 번의 실험을 수행하고 이를 뒷받침할 수학적 이론을 구축했습니다. 그들은 질문하는 방식을 신중하게 섞음으로써, 더 크고 비싼 로봇을 만들지 않고도 AI를 더 똑똑하고, 빠르고, 신뢰할 수 있게 만들 수 있음을 보여주었습니다. 이는 때때로 정답을 찾는 가장 좋은 방법은 질문을 백 가지 다른 방식으로 던지는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →