← 최신 논문
💬 NLP

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models

이 논문은 대규모 생성, 행동 클러스터링, 순위 매기기, 라운드 로빈 제출 전략을 결합한 확장 가능한 'GenCluster' 프레임워크를 통해 오픈 가중치 모델 (gpt-oss-120b) 로 최초로 IOI 2025 금메달 수준을 달성하고 투명하고 재현 가능한 추론 평가의 새로운 기준을 제시한다고 주장합니다.

원저자: Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

게시일 2026-04-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏆 "GENCLUSTER": 오픈소스 AI 가 세계 최고 코딩 대회에서 금메달을 딴 비결

이 논문은 **"AI 가 어떻게 엄청난 양의 연습을 통해, 비싼 유료 AI 보다 뛰어난 성능을 내는가?"**에 대한 이야기입니다. NVIDIA 연구팀이 개발한 **'GENCLUSTER'**라는 새로운 방법을 소개하며, 공개된 모델 (오픈소스) 로도 국제 정보올림피아드 (IOI) 에서 금메달을 딸 수 있음을 증명했습니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 배경: 왜 이 연구가 중요한가요?

과거에는 AI 가 코딩 문제를 풀 때 'HumanEval' 같은 쉬운 시험지만 썼습니다. 하지만 AI 가 너무 잘하게 되자, 이제는 **국제 정보올림피아드 (IOI)**처럼 인간 최상위권 코더들이 치르는 아주 어렵고 복잡한 대회로 기준을 옮겼습니다.

  • 현재 상황: 구글, 오픈AI 같은 거대 기업들은 비싼 '비밀 무기 (폐쇄형 AI)'로 금메달을 땄다고 발표했지만, 그 비법은 공개하지 않았습니다.
  • 문제점: 우리가 자유롭게 쓸 수 있는 '오픈소스 AI'들은 아직 그들보다 뒤처져 있었습니다.
  • 해결책: 연구팀은 "모델 자체를 더 똑똑하게 만드는 게 아니라, 시험 보는 동안 (테스트 시간) 얼마나 많은 계산 자원을 쓰느냐에 집중했다"고 말합니다.

2. GENCLUSTER 의 핵심 전략: "수만 명의 연습생으로 한 명을 뽑는다"

이 시스템은 마치 수만 명의 연습생 (후보 솔루션) 을 뽑아, 그중에서 진짜 스타 (정답) 를 찾아내는 프로세스와 같습니다. 4 단계로 이루어져 있습니다.

1 단계: 대량 생산 (Parallel Generation)

  • 비유: 한 문제를 풀 때, AI 에게 "너는 5,000 가지의 다른 해법을 생각해 봐!"라고 시킵니다.
  • 실제: AI 가 같은 문제를 5,000 번 풀게 하여 5,000 개의 코드를 만들어냅니다. 대부분은 틀리겠지만, 그중에는 정답이 섞여 있을 것입니다.

2 단계: 행동 그룹화 (Behavioral Clustering)

  • 비유: 만든 5,000 개의 코드를 실행해 봅니다. 이때 "이 코드는 A 라는 입력값에 대해 X 라는 답을 냈고, 저 코드는 똑같이 X 를 냈네? 이 둘은 같은 부류야!"라고 분류합니다.
  • 실제: 서로 다른 입력값을 주고 코드를 실행해, 출력 결과가 똑같은 코드끼리 묶어줍니다. (예: "틀린 코드들", "부분 점수 코드들", "정답 코드들"로 그룹화)
  • 효과: 5,000 개를 하나하나 볼 필요 없이, 비슷한 행동 패턴을 가진 그룹으로 줄여줍니다.

3 단계: 토너먼트 순위 결정 (Tournament Ranking)

  • 비유: 각 그룹에서 대표 선수 한 명을 뽑아, 서로 대결을 시킵니다. "너희 두 팀 중 누가 더 똑똑해 보여?"라고 AI 심판 (LLM) 에게 물어보고 승자를 가립니다.
  • 실제: 그룹 대표 코드를 서로 비교하며 승패를 결정하고, 가장 많이 이긴 그룹이 최상위 랭킹에 오릅니다.

4 단계: 전략적인 제출 (Round-Robin Submission)

  • 비유: 대회 규칙상 한 문제당 50 번만 제출할 수 있습니다. 가장 어려운 문제부터 시작해서, 순위가 높은 그룹의 코드를 하나씩 번갈아 가며 제출합니다.
  • 실제: 제한된 50 번의 기회 안에 가장 확률이 높은 코드들을 효율적으로 제출하여 점수를 극대화합니다.

3. 놀라운 결과: 오픈소스의 승리

연구팀은 이 방법을 적용해 gpt-oss-120b라는 공개된 모델을 사용했습니다.

  • 결과: 이 모델은 IOI 2025 대회에서 금메달 (Gold Medal) 기준을 달성했습니다.
  • 의미: 비싼 유료 모델 없이, 공개된 모델과 똑같은 방법론 (GENCLUSTER) 만으로도 세계 최고 수준의 성과를 낼 수 있다는 것을 증명한 첫 사례입니다.
  • 확장성: AI 가 더 많은 연산 자원 (컴퓨팅 파워) 을 쓸수록 점수가 계속 오르는 것을 확인했습니다. 즉, "더 많이 생각하게 하면 더 똑똑해진다"는 것을 입증했습니다.

4. 한계점 (현실적인 조언)

물론 이 방법이 만능은 아닙니다.

  • 엄청난 비용: 5,000 개의 코드를 만들고 심판까지 시키려면 엄청난 전기세와 서버 비용이 듭니다. (약 73 억 토큰 사용)
  • 가짜 테스트의 위험: AI 가 직접 만든 테스트 데이터라, 아주 드문 오류를 놓칠 수 있습니다.
  • 심판의 실수: AI 심판이 코드의 "긴 설명"이나 "스타일"에 속아 잘못된 코드를 정답으로 오인할 수도 있습니다.

📝 요약

이 논문은 **"AI 가 똑똑해지는 비결은 모델 자체를 더 크게 만드는 것뿐만 아니라, 시험 시간에 얼마나 많은 시도를 하고, 그중에서 가장 좋은 것을 잘 골라내느냐에 달려있다"**는 것을 보여줍니다.

마치 수만 명의 연습생 (생성) 을 모아, 행동 패턴으로 분류 (클러스터링) 하고, 토너먼트로 우승자를 가려 (랭킹) 최종 대표를 뽑는 (제출) 과정으로, 공개된 AI 가 비싼 AI 를 따라잡을 수 있는 새로운 길을 열었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →