← 최신 논문
💬 NLP

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

ScaleBox 는 자동화된 특수 판정기 생성, 세분화된 병렬 실행, 그리고 다중 노드 조정을 통해 기존 샌드박스의 한계를 해결하는 고정밀 확장 가능 코드 검증 시스템으로, 이를 통해 대규모 언어 모델을 위한 대규모 코드 학습 및 평가의 정확성과 효율성을 크게 향상시킵니다.

원저자: Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

게시일 2026-05-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇(대형 언어 모델)을 마스터 프로그래머로 가르친다고 상상해 보세요. 가르치기 위해 수천 개의 코딩 퍼즐을 주고 이를 해결하도록 요청합니다. 하지만 로봇이 퍼즐을 실제로 올바르게 해결했는지 어떻게 알 수 있을까요?

여기서 ScaleBox가 등장합니다. ScaleBox를 이 코딩 퍼즐들을 위한 초강력, 초고속, 그리고 놀라울 정도로 공정한 채점 시스템으로 생각하세요.

이전 방식이 왜 고장 났고 ScaleBox가 이를 어떻게 고치는지 간단한 비유를 통해 설명한 이야기입니다:

1. 문제: "경직된 채점자" vs "창의적 해결자"

과거 이러한 코딩 시스템은 **"정확한 일치 (Exact Match)"**라는 방법을 사용했습니다. 정답지와 완전히 같은 방식으로 답안이 작성되었는지만 확인하는 선생님을 상상해 보세요.

  • 결함: 퍼즐이 "10 을 더하는 임의의 두 숫자를 제시하라"고 요청하고 정답지가 "5 + 5"라고 적혀 있는데, 로봇이 "1 + 9"라고 작성하면 이전 시스템은 이를 틀린 것으로 표시합니다.
  • 현실: 코딩에서는 문제를 해결하는 올바른 방법이 여러 가지인 경우가 많습니다. 이전 시스템은 수학이 완벽함에도 불구하고 "5+5" 대신 "1+9"를 썼다는 이유로 학생을 낙제시킨 채점자처럼 행동했습니다. 이는 로봇을 혼란스럽게 만들어, 실제로는 성공하고 있음에도 실패했다고 생각하게 했습니다.

2. 해결책: "스마트 심판 (Special Judges)"

ScaleBox는 **Special Judges(스페셜 저지)**라는 새로운 기능을 도입합니다.

  • 비유: 경직된 채점자 대신 축구 경기의 스마트 심판을 상상해 보세요. 심판은 점수만 보는 것이 아니라 플레이를 지켜봅니다. 로봇이 문제를 해결하는 창의적이고 유효한 방법 (예: "1+9") 을 찾으면, 스마트 심판은 논리를 검토하고 그것이 작동함을 확인한 뒤, **"골! 인정한다!"**라고 말합니다.
  • 작동 원리: ScaleBox는 까다로운 문제들을 위해 이러한 스마트 심판을 자동으로 생성합니다. 단순히 글자를 매칭하는 것이 아니라 코드가 실제로 작동하는지 확인합니다. 이로 인해 로봇이 잘못된 "실패"로 혼란을 겪는 것을 막아줍니다.

3. 병목 현상: "교통 체증"

구식 시스템의 두 번째 문제는 속도였습니다. 모든 장난감을 하나씩 검사해야 하는 한 명의 느린 작업자가 있는 공장을 상상해 보세요. 수천 개의 로봇이 동시에 학습하려고 할 때 공장은 막히게 됩니다.

  • 결함: 이전 시스템은 모든 것을 단일 라인에서 실행하려고 시도하여 거대한 교통 체증을 유발했습니다. 강력한 컴퓨터 (GPU) 들은 느린 컴퓨터 (CPU) 들이 따라오지 못해 기다리는 동안 대기 상태에 머물렀습니다.
  • 고침: ScaleBox는 거대한 다차선 고속도로를 건설하는 것과 같습니다. 작업을 분할하여 수천 개의 테스트가 여러 컴퓨터에서 정확히 동시에 발생할 수 있도록 합니다. 유휴 자원 (빈 차선) 을 활용하여 시간 낭비가 없도록 합니다.

4. 결과: 더 나은 로봇

저자들은 이 새롭고 공정하며 빠른 시스템을 사용하여 로봇 (Qwen3-8B) 에게 코딩을 가르치는 방식으로 ScaleBox 를 테스트했습니다.

  • 발생한 일: 로봇이 경직된 채점자로 인한 "거짓 실패"를 받지 않게 되면서 훨씬 더 빠르게 학습했습니다. 더 안정적이고 자신감 있게 되었습니다.
  • 점수: 표준 코딩 챌린지 (LiveCodeBench) 에서 테스트했을 때, ScaleBox 로 훈련된 로봇은 구식 경직된 시스템으로 훈련된 로봇보다 훨씬 높은 점수를 받았습니다.

요약

ScaleBox는 다음 두 가지 작업을 수행하여 AI 에게 코딩을 가르치는 것을 더 좋게 만드는 새로운 인프라입니다:

  1. 더 공정합니다: 책에 있는 하나의 특정 정답뿐만 아니라 모든 올바른 해결책을 수용하는 "스마트 심판"을 사용합니다.
  2. 더 빠릅니다: 교통 체증 없이 수천 개의 코드 검사가 즉시 발생할 수 있도록 테스트를 위한 고속도로를 건설합니다.

그 결과, 혼란스러운 잡음이 아닌 정확한 피드백을 받기 때문에 코딩을 더 효과적으로 학습하는 더 똑똑하고 안정적인 AI 가 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →