← 최신 논문
📊 statistics

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

이 논문은 멱법칙(power-law) 기반 할당을 통해 기존 pass@k 샘플링의 수확 체감 현상을 완화함으로써, 정해진 예산 내에서 거대 언어 모델이 해결한 고유한 질문들의 커버리지를 최적화하는 쿼리 전략인 Reset-and-Discard (ReD)를 소개한다.

원저자: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 요약: "가성비 극대화": 고정된 예산 내에서 리셋 앤 디스카드(ReD)를 통한 대규모 언어 모델의 추론 성능 향상

큰 그림: "수수께끼 맞히기" 문제

당신에게는 커다란 수수께끼(질문) 주머니가 있고, 똑똑하지만 때로는 고집 센 친구(대규모 언어 모델 또는 LLM)로부터 정답을 얻기 위한 시도(추측)를 살 수 있는 제한된 돈이 있다고 상상해 보세요. 당신의 목표는 단 하나의 정말 어려운 수수께끼를 푸는 것이 아니라, 돈을 다 쓰기 전까지 가능한 한 '많은 종류의' 수수께끼를 푸는 것입니다.

이 논문은 사람들이 이 게임을 할 때 저지르는 흔한 실수를 다룹니다.

기존 방식: "고집 센 도박사" (완료될 때까지 풀기 - Solve-to-Completion)

현재 대부분의 사람들은 저자들이 **"완료될 때까지 풀기(Solve-to-Completion)"**라고 부르는 전략을 사용합니다.

  • 작동 방식: 수수께끼 #1을 선택합니다. 친구에게 답을 묻습니다. 만약 틀렸다면, 다시 묻습니다. 그리고 또 묻습니다. 계속해서 묻습니다. 친구가 수수께끼 #1을 맞힐 때까지 계속합니다. 그제서야 비로소 수수께끼 #2로 넘어갑니다.
  • 문제점: 어떤 수수께끼는 정말, 정말 어렵습니다. 친구는 수수께끼 #1에 매달려 50번의 시도를 할 수도 있습니다. 친구가 마침내 그것을 풀어냈을 때, 당신은 이미 50번의 시도를 써버린 상태입니다. 당신에게는 수수께끼 #2부터 #100까지 시도할 기회가 전혀 남아있지 않습니다. 당신은 어려운 것 하나를 해결했지만, 쉬운 것 99개를 놓친 것입니다.
  • 결과: 돈을 더 많이 쓸수록, 새로운 수수께끼를 해결하는 속도는 점점 더 느려집니다. 이는 마치 구멍 난 호스로 양동이를 채우려는 것과 같습니다. 더 세게 밀어붙일수록 실제로 들어오는 물의 양은 줄어듭니다.

새로운 방식: "너비 우선 탐색가" (리셋 앤 디스카드 / ReD - Reset-and-Discard)

저자들은 **리셋 앤 디스카드(ReD)**라고 불리는 새로운 전략을 제안합니다.

  • 작동 방식:
    1. 수수께끼 #1을 선택하고 친구에게 딱 한 번 묻습니다.
    2. 만약 맞혔다면, 축하하며 그 수수께끼를 버리고(Discard), 수수께끼 #2로 넘어갑니다.
    3. 만약 틀렸다면, 계속 붙들고 늘어지지 않습니다. 즉시 멈추고, 그 수수께끼를 일단 옆으로 치워둔 뒤, 수수께끼 #2로 넘어갑니다.
    4. 전체 목록을 돌며 각 수수께끼를 정확히 한 번씩(또는 몇 번) 묻습니다.
    5. 목록 전체를 한 바퀴 다 돌고 나면, 다시 처음으로 돌아가 아직 풀리지 않은 문제들을 다시 시도합니다.
  • 비유: 당신이 많은 작은 불들을 끄려는 소방관이라고 상상해 보세요. 한 곳의 고집스러운 불 앞에서 불이 꺼질 때까지 물을 뿌리고 있는 대신(주변의 다른 불들이 번지는 것을 무시한 채), 모든 불에 물을 조금씩 뿌립니다. 불이 꺼지면 그곳을 떠납니다. 만약 여전히 불이 타고 있다면, 나중에 다시 돌아옵니다.
  • 결과: 당신은 매우 빠르게 엄청난 수의 수수께끼를 해결합니다. 비록 가장 어려운 문제들을 즉시 해결하지는 못하더라도, 쉽거나 중간 난이도의 문제들을 먼저 해결하게 됩니다. 이는 훨씬 더 나은 "가성비(Bang for your buck)"를 제공합니다.

마법 뒤에 숨겨진 과학

이 논문은 왜 이 방식이 잘 작동하는지를 수학적으로 증명합니다.

  1. 멱법칙 (The Power Law): 저자들은 이러한 AI 모델들의 경우, 문제를 해결할 확률이 특정 수학적 패턴(멱법칙)을 따른다는 점을 발견했습니다. 기본적으로, 문제가 어려워질수록 해결하는 것은 기하급수적으로 더 어려워집니다.
  2. "수익 체감"의 덫: 기존의 "고집 센 도박사" 방식 아래에서는, 이 수학적 원리 때문에 돈을 더 많이 쓸수록 새로 해결되는 문제의 수는 점점 줄어듭니다.
  3. 해결책: "리셋 앤 디스카드" 방식은 이 덫을 깨뜨립니다. 매 시도(또는 몇 번의 시도) 후에 리셋함으로써, 이 느려지는 수익 체감 현상을 **꾸준한 선형 성장(Linear Growth)**으로 바꾼다는 것을 수학적으로 보여줍니다. 당신은 시도 횟수가 늘어나더라도 일정한 흐름으로 문제를 해결해 나갈 수 있습니다.

실험을 통한 주요 발견

저자들은 실제 AI 모델(Llama 및 GPT 등)을 사용하여 세 가지 유형의 과제를 테스트했습니다:

  • 코딩: 컴퓨터 프로그램 작성하기.
  • 수학: 수학 문장제 문제 풀기.
  • 추론: 복잡한 객관식 질문에 답하기.

발견한 내용:

  • 더 많은 해결: 동일한 비용(예산)으로, ReD는 기존 방식보다 훨씬 더 많은 고유한 문제들을 해결했습니다.
  • 더 저렴함: 특정 목표(예: 문제의 80% 해결)에 도달하기 위해, ReD는 더 적은 시도 횟수, 더 적은 컴퓨터 토큰, 그리고 더 적은 실제 비용을 필요로 했습니다.
  • 불완전한 검증기에서도 작동: 정답을 확인하는 시스템이 실수하더라도(맞았는데 틀렸다고 하거나, 틀렸는데 맞다고 하는 경우), ReD는 여전히 승리합니다.
  • 미래 예측: 저자들은 ReD를 사용하면, 수천 번의 비싼 테스트를 수행하지 않고도 AI가 얼마나 똑똑한지(그 AI의 '멱법칙 지수')를 알아낼 수 있다는 것을 보여주었습니다. 이는 마치 자동차의 전체 경주 시간을 측정하는 대신, 단 몇 초간 달리는 모습만 보고도 자동차의 속도를 짐작하는 것과 같습니다.

결론

고정된 예산 내에서 AI가 목록의 문제들을 풀게 하려면, 어려운 문제에 계속 매달리지 마세요. 대신, 모든 문제를 한 번씩 시도하고, 해결된 것은 버린 뒤, 놓친 문제들을 다시 돌아와서 시도하세요. 이 "리셋 앤 디스카드(Reset-and-Discard)" 전략은 같은 가격으로 훨씬 더 많은 문제를 해결하게 해주며, 느리고 답답한 과정을 효율적이고 고속인 기계처럼 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →