← 최신 논문
💻 computer science

Immersion in the GitHub Universe: Scaling Coding Agents to Mastery

이 논문은 600 만 개의 풀 리퀘스트를 처리하여 10 만 개의 검증된 소프트웨어 엔지니어링 데이터셋 'ScaleSWE'를 구축하고, 이를 기반으로 학습된 에이전트가 SWE Bench Verified 에서 64% 의 해결률을 기록하며 기존 모델 대비 약 3 배의 성능 향상을 보였음을 제시합니다.

원저자: Jiale Zhao, Guoxin Chen, Fanzhe Meng, Minghao Li, Jie Chen, Hui Xu, Yongshuai Sun, Wayne Xin Zhao, Ruihua Song, Yuan Zhang, Peng Wang, Cheng Chen, Jirong Wen, Kai Jia

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiale Zhao, Guoxin Chen, Fanzhe Meng, Minghao Li, Jie Chen, Hui Xu, Yongshuai Sun, Wayne Xin Zhao, Ruihua Song, Yuan Zhang, Peng Wang, Cheng Chen, Jirong Wen, Kai Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏗️ 1. 문제: "코딩을 가르치기엔 교재가 너무 부족해!"

지금까지 AI 코딩 도우미들은 훌륭한 코딩 실력을 보여주지만, 실제 복잡한 문제를 해결하는 능력은 아직 부족했습니다. 그 이유는 무엇일까요?

  • 비유: imagine 하세요. 우리가 요리사를 가르치려고 할 때, '요리 이론서'만 100 권 주고 끝내면 어떨까요? 학생은 이론은 알지만, 실제 불을 켜고 재료를 다듬는 '현장 감각'은 전혀 없습니다.
  • 현실: AI 코딩을 가르치기 위한 '실제 현장 데이터 (실제 GitHub 의 문제 해결 기록)'는 매우 드뭅니다. 기존 데이터들은 너무 단순하거나, 실제 실행 환경이 없어서 AI 가 "이게 맞나?"를 검증할 수 없었기 때문입니다.

🤖 2. 해결책: "스스로 교재를 만드는 3 인조 로봇 팀 (Scale-SWE)"

연구팀은 AI 가 스스로 600 만 개의 실제 코드 수정 기록 (Pull Request) 을 분석해서, AI 가 배울 수 있는 고품질 교재 10 만 개를 만들어냈습니다. 이를 위해 **3 명의 전문 로봇 (에이전트)**이 팀을 이루었습니다.

이 3 인조 팀의 역할은 다음과 같습니다:

  1. 환경 설정 로봇 (EBA): "실험실 세팅"

    • 역할: 각 프로젝트마다 필요한 소프트웨어와 도구들을 설치하고, 실행 가능한 '가상 실험실 (Docker)'을 만듭니다.
    • 비유: 요리사가 요리를 시작하기 전에, 필요한 냄비, 가스레인지, 식재료를 모두 준비하고 부엌을 깨끗하게 정리하는 일입니다. 프로젝트마다 부엌 환경이 다 다르기 때문에 이 로봇이 하나하나 맞춰줍니다.
  2. 시험 문제 제작 로봇 (UCA): "정답과 오답을 만드는 시험지"

    • 역할: "이 코드가 고쳐지기 전에는 실패하고, 고쳐지면 통과해야 하는 테스트"를 자동으로 만듭니다.
    • 비유: 요리사가 만든 요리가 '맛있으면 통과 (Pass)', '맛없으면 실패 (Fail)'하는 기준을 정하는 것입니다. AI 가 코드를 고쳤을 때 정말로 문제를 해결했는지, 아니면 다른 것을 망가뜨린 건지 확인하는 '시험지'를 만드는 거죠.
  3. 문제 설명 작성 로봇 (PSWA): "명확한 지시서 쓰기"

    • 역할: 복잡한 코드 수정 기록을 보고, "여기서 어떤 문제가 있었는지"를 사람이 읽기 쉽게, 하지만 정답을 누설하지 않는 방식으로 설명합니다.
    • 비유: 요리사가 "소금 좀 더 넣으세요"라고만 말하지 않고, "이 요리는 너무 싱겁고, 소금 1 스푼을 넣으면 완벽해집니다"라고 문제 상황만 정확히 묘사하는 것입니다. (정답인 '소금 1 스푼'을 미리 알려주면 안 되니까요.)

🚀 3. 결과: "AI 의 코딩 실력이 3 배로 뻥튀기!"

이렇게 만든 거대한 데이터 (Scale-SWE-Data) 로 AI 를 훈련시켰습니다.

  • 기존 AI: 100 개의 문제 중 22 개만 해결 (22% 성공률).
  • 훈련된 AI (Scale-SWE-Agent): 100 개의 문제 중 64 개를 해결 (64% 성공률).
  • 비유: 코딩 실력이 '초급자' 수준에서 '숙련된 주니어 개발자' 수준으로 급성장한 것입니다. 기존에 없던 3 배나 더 똑똑해진 셈입니다.

💡 4. 왜 이것이 중요한가요?

기존에는 사람이 일일이 데이터를 정리하거나, AI 가 가상의 문제를 만들어냈는데, 이 연구는 **"실제 GitHub 에 있는 600 만 개의 실제 수정 기록"**을 활용했습니다.

  • 핵심 메시지: AI 를 진짜 코딩 전문가로 만들려면, 실제 현장 (Real-world) 에서 일어난 복잡한 일들을 많이 경험하게 해야 한다는 것입니다.
  • 이 연구는 AI 가 단순히 코드를 짜는 것을 넘어, 실제 소프트웨어 개발 과정 (환경 설정, 테스트, 버그 수정) 을 스스로 해결할 수 있는 능력을 키우는 새로운 길을 열었습니다.

🌟 한 줄 요약

"AI 코딩 도우미를 가르치기 위해, 3 명의 로봇 팀이 600 만 개의 실제 현장 기록을 분석해 10 만 개의 '실전 교재'를 만들었고, 그 결과 AI 의 코딩 실력이 3 배나 뛰어나게 성장했습니다!"

이제 AI 는 더 이상 책만 보고 공부하는 학생이 아니라, 실제 현장에서 부딪혀보며 성장하는 '현역 개발자'가 되어가고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →