Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning
이 논문은 고품질 커리큘럼과 점진적 롤아웃 탐색을 활용하여 JEE 및 NEET 와 같은 경쟁적인 STEM 시험에서 우수한 성능과 더 높은 토큰 효율성을 달성하는 GPT-OSS-20B 기반의 강화 학습 훈련 언어 모델인 Aryabhata 2 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 GPT-OSS-20B라는 이름의 천재적이지만 약간 산만한 학생이 있다고 상상해 보세요. 이 학생은 방대한 도서관의 책을 읽었고 많은 사실을 알고 있지만, 인도에서 가장 어려운 대학 입학 시험과 같은 까다롭고 다단계 수학 또는 과학 문제를 풀라고 요청하면 때로는 장황하게 말하거나 혼란스러워하거나 정답을 적는 데 너무 많은 시간을 보냅니다. 그들은 정답을 맞출 수도 있지만, 그렇게 하기 위해 많은 '잉크'(컴퓨터 토큰)를 사용하는데, 이는 비싸고 느립니다.
이 논문의 저자들은 더 큰 뇌(더 큰 모델)를 구매하지 않고도 이 학생을 챔피언 문제 해결사로 만들고 싶어 했습니다. 그들은 **아리아바타 2(Aryabhata 2)**라는 새로운 학생을 만들었습니다.
그들이 어떻게 했는지 간단한 비유를 통해 설명해 드리겠습니다:
1. 훈련장: 엄격한 코치
표준 훈련이 하는 것처럼 단순히 학생에게 더 많은 책을 읽게 하는 대신, 연구원들은 **강화 학습(Reinforcement Learning)**을 사용하는 엄격한 코치처럼 행동했습니다.
- 보상 시스템: 퍼즐을 정확하게 풀고 명확하게 설명할 때만 점수를 얻는 비디오 게임을 상상해 보세요. 학생이 정답을 틀리면 점수는 0 점입니다. 정답은 맞췄지만 한 단락으로 설명하면 될 것을 10 페이지 분량의 에세이를 작성하면 점수가 낮아집니다.
- '심판': 코치는 학생의 말만 믿지 않았습니다. 그들은 모든 단계를 확인하기 위해 초지능적인 '심판'(다른 AI) 을 사용했습니다. 수학이 맞지 않거나 논리에 결함이 있으면 정답은 즉시 거부되었습니다.
2. 커리큘럼: 쉬운 것부터 불가능한 것까지
연구원들은 학생을 즉시 깊은 물속으로 던지지 않았습니다. 그들은 3 단계 훈련 캠프를 구축했습니다:
- 1 단계 (포맷팅): 먼저, 학생에게 펜을 올바르게 잡는 법을 가르쳤습니다. 정답이 깔끔하게 보이고 특정 구조를 따르도록 하는 데 중점을 두었습니다.
- 2 단계 (연마): 그런 다음, 학생에게 수천 개의 연습 문제를 주었습니다. 학생이 나아질수록 코치는 문제를 더 어렵게 만들었습니다. 학생이 계속 70% 를 맞췄다면, 코치는 훨씬 더 까다로운 질문으로 교체했습니다.
- 3 단계 (와일드카드): 마지막으로, 학생에게 동일한 어려운 문제를 해결하는 여러 가지 다른 방법을 동시에 시도하게 했습니다. 마치 학생에게 미로를 해결하기 위해 128 개의 서로 다른 경로를 동시에 시도해 보라고 요청하는 것과 같습니다. 이는 그들이 이전에 보지 못했던 교묘한 단축경을 발견하는 데 도움이 되었습니다.
3. 비밀 소스: "확장된 탐색"
일반적으로 AI 를 훈련할 때 한 번 문제를 풀도록 요청할 수 있습니다. 하지만 아리아바타 2 는 모든 단일 질문에 대해 많은 다른 시도를 생성하도록 훈련되었습니다.
- 비유: 범죄를 해결하는 형사를 생각해 보세요. 하나의 감에만 의존하는 대신, 형사는 단서를 찾기 위해 128 개의 서로 다른 팀을 파견합니다. 단 한 팀이라도 올바른 단서를 찾으면 사건은 해결됩니다. 이 방법은 모델이 정답에 이르는 '황금 경로'를 훨씬 더 빠르고 신뢰성 있게 찾도록 도왔습니다.
4. 결과: 더 빠르고, 더 똑똑하며, 더 날렵함
그들이 아리아바타 2 를 JEE 와 NEET 와 같은 실제 시험과 AIME 와 같은 초고난도 수학 대회에서 테스트했을 때, 결과는 인상적이었습니다:
- 더 높은 정확도: 이는 '부모' 모델 (GPT-OSS-20B) 보다 더 많은 문제를 정확하게 해결했으며, 훨씬 더 크고 비싼 일부 모델까지도 능가했습니다.
- '토큰' 절감: 이것이 가장 큰 승리입니다. 원래 모델은 종종 길고 구불구불한 설명을 작성했습니다. 아리아바타 2 는 간결함을 배우게 되었습니다. 동일한 (또는 더 나은) 결과를 얻기 위해 최대 64% 적은 단어(토큰) 를 사용했습니다.
- 비유: 이전 모델이 완벽한 샷을 찾기 위해 100 장의 사진을 찍는 관광객이었다면, 아리아바타 2 는 한 번의 클릭으로 완벽한 샷을 찍는 프로 사진작가와 같습니다.
결론
이 논문은 매우 구체적이고 고품질의 연습 문제 세트와 스마트한 다단계 훈련 방법을 사용하여 표준 200 억 파라미터 AI 를 전문화된 STEM 추론 전문가로 변모시켰다고 주장합니다. 똑똑해지기 위해 거대한 모델이 될 필요는 없었습니다. 올바른 종류의 연습과 좋은 행동을 어떻게 보상해야 하는지 정확히 아는 코치만 필요했습니다.
그들이 주장하지 않은 것:
이 논문은 이 AI 가 인간 교사를 대체하거나 의학적 상태를 진단하거나 일반적인 대화에 사용될 수 있다고 주장하지 않습니다. 이는 경쟁 시험에서 발견되는 과학, 수학, 공학 문제를 해결하도록 특별히 설계되었으며, 이러한 특정 과목에 대한 매우 효율적인 튜터 역할을 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.