Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation
이 논문은 추론 토큰 예산의 변화가 모델 성능과 순위를 유의미하게 변화시킨다는 점을 입증함으로써 대규모 언어 모델 순위가 안정적이라는 가정에 이의를 제기하며, 예산 조건부 평가 프로토콜이 필요함을 시사하는 비단조적 동작, 순위 역전, 그리고 모델 상보성을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 도서관에 있다고 상상해 보세요. 그곳의 책들은 거대 언어 모델(LLM)이라고 불리는 초지능 로봇들이 쓴 것입니다. 이 로봇들은 거의 모든 것을 읽을 수 있으며 수학, 과학, 역사에 관한 질문에 답할 수 있습니다. 오랫동안 사람들은 단순히 질문을 던지고 누가 먼저 정답을 맞히는지 보고 "최고의" 로봇을 뽑으려 했습니다. 그들은 만약 로봇 A가 한 가지 테스트에서 로봇 B보다 뛰어나다면, 어떤 상황에서도 항상 더 뛰어날 것이라고 가정했습니다. 그것은 마치 얼마나 많은 시간을 허용했는지는 신경 쓰지 않고, 누가 결승선을 먼저 통과했는지만 보고 경주를 심사하는 것과 같았습니다.
하지만 여기 반전이 있습니다. 이 로봇들은 즉각적으로 "생각"하는 것이 아닙니다. 그들은 긴 생각의 사슬처럼 단어를 하나씩 써 내려가며 답을 작성합니다. 이들이 얼마나 많은 단어를 쓸 수 있는지에 대한 제한을 '토큰 예산'이라고 부릅니다. 이것은 학생에게 시험을 치를 시간을 다르게 주는 것과 같습니다. 어떤 학생은 어려운 퍼즐을 풀기 위해 많은 시간이 필요할 수도 있고, 어떤 학생은 시간이 너무 많으면 혼란에 빠져 생각을 너무 많이 하다가 오히려 망칠 수도 있습니다. 과학자들의 큰 질문은 이것입니다. "우리가 시간 제한을 바꾼다면, '최고'의 로봇은 여전히 최고로 남을 것인가?" 즉, 생각할 시간을 얼마나 주느냐에 따라 승자가 바뀌는가 하는 점입니다. 이것이 바로 연구자들이 알아내고자 했던 것입니다.
"과잉 사고(Overthinking)" 문제: 왜 더 많은 시간이 항상 더 나은 것은 아닌가
이 연구에서 연구자들은 네 가지 서로 다른 AI 모델이 세 가지 까다로운 테스트(초등 수준 수학, 경시대회 수준 수학, 대학원 수준 과학 질문)에서 어떻게 수행되는지 확인하기 위해 대규모 실험을 설계했습니다. 그들은 단순히 모델을 실행시킨 것이 아니라, 특정 양의 "생각(토큰으로 측정)" 후에 강제로 멈추게 했습니다. 그들은 아주 적은 64 토큰(매우 짧은 생각 시간)부터 엄청나게 큰 4,096 토큰(많은 생각 시간)까지 일곱 가지의 서로 다른 제한을 설정하여 테스트했습니다.
그들이 발견한 것은 단 하나의 "최고" 모델이라는 개념이 신화라는 사실이었습니다. 모델의 순위는 그들에게 주어진 시간에 따라 완전히 뒤바뀌고 변했습니다.
"과잉 사고"의 놀라움
로봇에게 생각할 시간을 더 많이 주면 항상 정답을 맞히는 데 도움이 될 것이라고 생각할 수도 있습니다. 하지만 연구자들은 이상한 점을 발견했습니다. 때로는 모델에게 더 많은 토큰을 주는 것이 오히려 정답을 틀리게 만든다는 사실입니다. 그들은 이를 "과잉 사고(overthinking)"라고 부릅니다.
수학 문제를 풀 줄 아는 학생을 상상해 보세요. 만약 10분을 준다면, 그 학생은 정답을 정확히 적어낼 것입니다. 하지만 30분을 준다면, 학생은 스스로를 의심하기 시작하여 답을 바꾸고 결국 틀린 답을 내놓을 수도 있습니다. 연구 결과, 이 현상은 질문의 약 3%에서 19%에서 발생했습니다. 더욱 나쁜 것은 이것이 질문 자체의 문제가 아니라 각 로봇의 특성에 따른 문제였다는 점입니다. 한 모델을 "과잉 사고"에 빠뜨려 실패하게 만든 질문이 다른 모델에게는 완벽하게 괜찮을 수도 있었습니다. 이는 어떤 사람은 발표 준비 시간이 너무 길어지면 긴장하는 반면, 어떤 사람은 그 시간을 활용해 잘 해내는 것과 같습니다.
순위의 거대한 역전
이 때문에 경주의 "승자"는 계속해서 바뀌었습니다.
- 쉬운 수학 테스트(GSM8K)에서는, 중간 정도의 시간(256 토코)을 주었을 때 거대 모델(LLaMA-3.3 70B)이 챔피언이었습니다. 하지만 모델들에게 더 많은 시간(4,096 토큰까지)을 주자마자, 더 작은 모델(GPT-OSS 20B)이 선두를 차지하며 그 자리를 지켰습니다.
- 가장 어려운 과학 테스트(GPQA)에서는, 시간이 촉박할 때(256–512 토큰) 가장 작은 모델(LLaMA-3 8B)이 실제로 가장 뛰어났습니다. 그러나 시간이 흐르자 더 큰 모델들이 따라잡았고 결국 공동 1위를 차지했습니다.
이는 오늘날 어떤 리더보드에서 "모델 X가 최고다"라고 말한다면, 그 문장은 특정 시간 동안에만 유효하다는 것을 의미합니다. 시간 제한을 바꾸면 모델 X는 갑자기 최악의 모델이 될 수도 있습니다.
"오라클(Oracle)"의 격차: 왜 스마트한 스위치가 필요한가
연구자들은 또한 다음과 같이 물었습니다. "만약 우리가 모든 질문에 대해 완벽한 모델을 마법처럼 골라낼 수 있다면, 얼마나 더 잘할 수 있을까?" 그들은 모든 특정 질문과 시간 제한에 대해 최적의 모델을 선택하는 이론적인 "오라클(완벽한 선택기)"을 구축했습니다.
결과는 충격적이었습니다. 이 완벽한 선택기는 단일 최고의 모델을 단독으로 실행했을 때보다 과학 테스트에서 27.8 퍼센트 포인트 더 많은 정답을 맞혔습니다. 쉬운 수학 테스트에서도 그 격차는 상당했습니다(최대 16.9 포인트). 이는 단 하나의 로봇이 모든 것에 능숙할 수 없음을 증명합니다. 때로는 작은 로봇이 최고이고, 때로는 큰 로봇이 최고이며, 때로는 둘 다 틀릴 수도 있습니다.
스마트한 스위치를 만들 수 있을까?
연구팀은 질문을 보고 어떤 로봇이 답해야 할지를 결정하는 스마트한 시스템인 "라우터(router)"를 만드는 시도를 했습니다.
- 동일한 유형의 테스트 내에서: 수학 문제로 라우터를 학습시키고 수학 문제로 테스트했을 때, 라우터는 매우 잘 작동했습니다. "시간 제한"을 단서로 활용함으로써 올바른 로봇을 선택하는 데 도움을 주었고, 정확도를 1.6에서 5.7 포인트까지 향상시켰습니다.
- 서로 다른 테스트 간에: 하지만 동일한 라우터를 수학에서 과학 질문으로 전환하여 사용하려고 했을 때, 라우터는 혼란에 빠졌습니다. 수학에서 작동했던 "시간 제한" 단서들이 과학에서는 작동하지 않았습니다. 실제로 이러한 단서들을 사용하는 것이 도메인을 전환할 때 라우터의 성능을 1.2 포인트 더 떨어뜨렸습니다. 이는 "얼마나 많은 시간을 갖느냐"와 "정답을 맞히느냐" 사이의 관계가 과목마다 다르다는 것을 시사합니다.
시사점
이 논문의 핵심 교훈은 간단하지만 강력합니다. 단 하나의 "최고" AI 모델은 존재하지 않습니다. "어떤 모델이 최고인가?"라는 질문의 답은 전적으로 "그들에게 얼마나 오래 생각하도록 허용하느냐"에 달려 있습니다.
만약 당신이 AI에게 아주 짧은 시간만 줄 수 있는 스마트폰 앱을 만들고 있다면, 작고 빠른 모델이 당신의 챔피언이 될 수 있습니다. 만약 당신이 AI에게 몇 시간 동안 생각할 시간을 줄 수 있는 서버를 운영하고 있다면, 다른 더 큰 모델이 승자가 될 것입니다. 단 하나의 승자를 뽑아 모두에게 적용하는 기존의 방식은 깨졌습니다. 대신 우리는 이렇게 말해야 합니다. "모델 A는 짧은 답변에 좋고, 모델 B는 긴 답변에 좋으며, 때로는 너무 많은 시간을 주면 그들이 일을 그르칠 수도 있다"라고 말입니다.
연구자들은 미래에 단일 점수를 요구하는 대신, 다양한 시간 제한에 따라 모델이 어떻게 수행되는지를 보고하기 시작해야 한다고 제안합니다. 그리고 이 모델들을 효과적으로 사용하고 싶다면, 언제 작은 모델(빠른 생각가)을 부르고 언제 큰 모델(느린 생각가)을 불러야 할지 아는 스마트한 시스템이 필요합니다. 왜냐하면 승자는 시계가 돌아가기 시작하는 순간 바뀌기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.