← 최신 논문
🤖 AI

CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing

이 논문은 생성과 검증 사이에 추론 자원을 동적으로 할당함으로써 테스트 시간 스케일링을 최적화하고, 전통적인 스케일링 방식에 비해 계산 비용을 크게 절감하면서 수학적 추론 벤치마크에서 최첨단 정확도를 달리는 컴퓨트 균형 라우팅 정책인 CoBa를 소개한다.

원저자: Yan Zhou, Yue Ouyang, Kaiyang Zheng, Suncheng Xiang

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Yan Zhou, Yue Ouyang, Kaiyang Zheng, Suncheng Xiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 까다로운 수수께력을 풀려고 노력하고 있다고 상상해 보세요. 당신에게는 사용할 수 있는 에너지가 한정되어 있고, 이 에너지를 사용하는 세 가지 방법이 있습니다. 새로운 답을 생각하거나, 이미 가지고 있는 답을 재확인하거나, 아니면 그냥 "좋아, 다 됐어, 이게 내 최선의 추측이야"라고 말하는 것입니다. 오랫동안 어려운 문제(수학 퍼즐 같은)를 풀기 위해 컴퓨터를 사용하는 사람들은 이 중 하나를 반복하면서 계속 "더 열심히 노력하라"는 지시를 받아왔습니다. 그들은 백 개의 서로 다른 답을 생성한 뒤 가장 인기 있는 것을 고르거나, 혹은 아주 똑똑하지만 느린 로봇 판사에게 모든 답을 확인하도록 엄청난 양의 에너지를 쓰기도 합니다. 문제는 이것이 마치 호두를 깨기 위해 대형 망치를 사용하는 것과 같다는 점입니다. 답이 명확하다면, 그것을 백 번 확인하는 것은 낭비입니다. 만약 답을 찾기가 매우 어렵다면, 무작정 추측하는 것만으로는 결코 답을 찾지 못할 수도 있습니다. 핵심적인 질문은, 우리가 어떻게 제한된 에너지를 사용하여 배터리를 소진하지 않고 정답을 얻을 것인가 하는 점입니다.

여기서 CoBa라고 불리는 새로운 아이디어가 등장합니다. CoBa를 작업자 팀의 스마트한 매니저라고 생각해 보세요. 모든 작업자에게 똑같은 일을 하라고 지시하는 대신, CoBa는 상황을 관찰하고 다음에 취할 가장 최선의 단계를 결정합니다. 작업자들이 쉽고 명확한 답에 이미 동의하고 있다면, CoBa는 "좋아, 멈춰! 끝났어"라고 말합니다. 만약 그들이 혼란스러워한다면, CoBa는 "아이디어를 두 명에게 더 요청하자"라고 말할 수 있습니다. 하지만 만약 그들이 정말 어려운 문제에 막혀 있다면, CoBa는 "좋아, 가장 괜찮은 아이디어 두 개를 엄선해서 최고의 전문가 판사에게 보내서 확인하자"라고 말합니다. 연구진들이 이를 수천 개의 수학 문제에 테스트한 결과, CoBa는 스마트한 매니저가 됨으로써 "브루트 포스(모든 것을 시도하는 방식)" 방법들과 같은 높은 점수를 얻으면서도, 훨씬 더 적은 양의 비싼 "에너지 단위(parameter-weighted tokens라고 불리는)"를 사용했습니다. 이는 마치 똑같이 맛있는 식사를 하면서 재료는 절반만 사용하는 것과 같습니다.

문제점: "다다익선"의 함정

한동안 AI를 문제를 해결하는 데 더 똑똑하게 만드는 가장 좋은 방법은 단순히 더 많은 컴퓨팅 파워를 쏟아붓는 것이었습니다. 더 나은 답을 원한다면, AI에게 더 많은 솔루션을 생성하라고 요구했습니다. 확신을 얻고 싶다면, 두 번째 AI에게 그 모든 것을 확인하도록 했습니다. 이것은 마치 바늘을 찾기 위해 천 명의 사람을 데려와 건초더미 전체를 뒤지게 하는 것과 같습니다. 바늘이 바로 눈앞에 놓여 있을 때조차 말이죠. 이 방식은 효과는 있지만, 엄청나게 비싸고 느립니다.

이 논문은 이러한 "일률적인(one-size-fits-all)" 접근 방식이 낭비적이라고 주장합니다. 어떤 문제는 쉬워서 빠르게 훑어보기만 하면 되지만, 어떤 문제는 깊은 사고가 필요합니다. 그러나 기존의 방식들은 모든 문제를 동일하게 취급했습니다. 그들은 단순한 수학 질문에도 복잡한 올림피아드 수준의 퍼즐과 똑같은 엄청난 양의 에너지를 썼습니다. 저자들은 이 문제를 해결하기 위해 '테스트 시간 스케일링(테스트 중에 AI가 더 깊이 생각하게 만드는 것)'을 자원 배분 문제로 전환하고자 했습니다. 그들은 다음과 같이 물었습니다. "정해진 에너지 예산이 주어졌을 때, 다음 에너지 단위를 새로운 아이디어를 생성하는 데 써야 할까, 기존의 것을 확인하는 데 써야 할까, 아니면 그냥 멈춰야 할까?"

해결책: 스마트 매니저 (CoBa)

저자들은 AI의 두뇌를 조절하는 교통 통제관 역할을 하는 CoBa(Compute-Balanced test-time scaling)를 소개했습니다. 작동 방식은 다음과 같습니다:

  1. 웜업(Warm-up): 먼저, Co-Ba는 AI에게 작고 다양한 답의 집합을 생성하도록 요청합니다(마치 두 친구에게 아이디어를 묻는 것과 같습니다). 이것이 "웜업" 단계입니다.
  2. 저렴한 확인(Cheap Check): 다음으로, 모든 답에 대해 빠르고 에너지가 적게 드는 확인 과정을 거칩니다. 이것은 친구에게 "이게 맞는 것 같아?"라고 묻는 것과 같습니다. 빠르고 저렴합니다.
  3. 결정(Decision): 저렴한 확인 결과에 따라, Co-Ba는 선택을 내립니다:
    • 중단(Stop): 모두가 동의하고 저렴한 확인 결과가 확신을 가진다면, CoBa는 즉시 멈춥니다. 에너지를 낭비할 필요가 없습니다.
    • 추가 생성(Generate More): 만약 답들이 제각각이라면, 더 많은 옵션을 얻기 위해 몇 가지 아이디어를 더 요청합니다.
    • 강력 검증(Strong Verify): 만약 몇몇 유망한 답들이 있지만 여전히 불확실하다면, Co-Ba는 오직 그 특정 후보들만 "슈퍼 판사"(훨씬 더 강력하고 비싼 AI 모델)에게 보내 심도 있고 철저한 확인을 받습니다.

이것이 핵심적인 차이점입니다. 모든 것을 슈퍼 판사에게 확인하는 대신, Co-Ba는 가장 흥미로운 후보들만을 보냅니다. 이를 통해 값비싼 에너지를 실제로 필요한 순간에만 집중할 수 있습니다.

결과: 더 열심히가 아닌, 더 똑똑하게

연구진은 표준 학교 수학부터 매우 어려운 경시대회 수준의 퍼즐(AIME 및 AMC 등)에 이르는 3,000개 이상의 수학 문제에 이 시스템을 테스트했습니다. 그들은 Co-Ba를 기존의 "브루트 포스" 방식들과 비교했습니다.

  • 큰 승리: 가장 뛰어난 버전인 Co-Ba-Routed-Strong은 **85.13%**의 정확도를 달성했습니다. 이는 자기 평가 가중 투표(self-evaluation weighted voting) 방식을 사용한 가장 비싼 방법의 점수인 **85.20%**나, "best-of-16" 다수결 투표 방식의 **85.12%**와 거의 동일한 수준입니다.
  • 절감 효과: 놀라운 점은 바로 여기 있습니다. 그 높은 점수를 얻기 위해 비싼 방식들은 엄청난 양의 컴퓨팅 파워를 사용했습니다. 반면 Co-Ba-Routed-Strong은 자기 평가 방식보다 49.1% 적은 parameter-weighted token을 사용했으며, best-of-16 방식보다는 58.9% 적은 양을 사용했습니다.
  • 트레이드오프(Trade-off): 논문은 16개의 답을 생성하고 가장 흔한 것을 고르는 "best-of-16" 방식이 아주 미세하게(0.01 포인트) 더 정확했지만, 실행 비용이 2.43배 더 많이 들었다고 언급했습니다. Co-Ba는 대부분의 실질적인 용도에서 그 미세한 정확도 향상이 엄청난 비용을 감수할 만큼의 가치가 있지는 않다고 제안합니다.

이것이 미래에 의미하는 바

이 논문은 AI의 미래가 단순히 더 크고 강한 모델을 만드는 것에 있지 않다고 시사합니다. 그것은 우리가 가진 자원을 얼마나 똑똑하게 사용하느냐에 달려 있습니다. 저자들은 가장 큰 병목 현상이 항상 '확인' 과정에 있는 것이 아니라, 때로는 AI가 처음에 제대로 된 답을 내놓지 못하는 것(즉, 초기 아이디어의 부재)에 있다는 것을 발견했습니다. 가장 어려운 문제들(AIME 2025 등)의 경우, 초기 "아이디어 풀"에 정답이 포함되어 있지 않다면 가장 똑똑한 매니저라도 정답을 찾아낼 수 없었습니다.

하지만 대다수의 문제에 대해 Co-Ba는 우리가 에너지를 낭비하는 것을 멈출 수 있음을 보여주었습니다. "트리아지(triage, 우선순위 분류)" 시스템(모두를 위한 저렴한 확인, 그리고 까다로운 것들만을 위한 비싼 확인)을 사용함으로써, 우리는 큰 비용을 들이지 않고도 최선의 결과를 얻을 수 있습니다. 이 논문은 이 접근 방식이 '오라클 갭(AI가 정답을 알았을 때 할 수 있는 능력과 실제로 하는 능력 사이의 차이)'을 유용한 신호로 바꾸어 준다고 결론짓습니다. 만약 AI가 실패한다면, 이제 우리는 정확히 어디를 살펴봐야 할지 알 수 있습니다. 너무 일찍 멈춘 것일까요? 잘못된 후보를 확인한 것일까요? 아니면 애초에 더 나은 아이디어를 생성해야 했던 것일까요?

요약하자면, Co-Ba는 AI의 세계에서 타이밍과 타겟팅이 원초적인 힘만큼이나 중요하다는 것을 가르쳐 줍니다. 얼마나 열심히 생각하느냐가 아니라, 언제 깊이 생각하고 언제 멈춰야 하는지를 아는 것이 핵심입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →