Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode
이 논문은 28T 토큰으로 사전 학습된 Looped Transformer 아키텍처와 고급 RL 학습을 갖춘 컴팩트한 3B 파라미터 일반 에이전틱 모델인 Nanbeige4.2-3B를 소개하며, 이 모델은 강력한 추론 능력을 유지하면서 다양한 에이전틱 벤치마크에서 Qwen3.5-9B 및 Gemma4-12B와 같은 훨씬 더 큰 모델들을 유의미하게 능가합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 거대하고 매우 똑똑한 도서관과 같은 세상이 있다고 상상해 보십시오. 오랫동안 이 도서관에서 정말 좋은 답을 얻는 유일한 방법은 도서관을 점점 더 크게 만들고, 더 많은 책(데이터)과 더 많은 선반(파라미터)을 채워 넣는 것이었습니다. 아이디어는 단순했습니다. 천재를 원한다면 거대한 뇌가 필요하다는 것이었죠. 하지만 만약 여러분이 주머니에 쏙 들어가는 크기의 천재를 만들 수 있다면 어떨까요? 이것이 현재 인공지능 분야의 핵심 질문입니다. 우리는 거대하고 에너지를 많이 소비하는 거인들만큼 복잡한 문제를 잘 해결할 수 있는 작고 효율적인 AI 모델을 만들 수 있을까요?
이 과제를 이해하기 위해, AI 모델을 한 명의 학생이라고 생각해 보십시오. '추론형' 학생은 수학과 논리 퍼즐에 능숙한 반면, '에이전트형(agentic)' 학생은 계산기를 사용하거나, 인터넷을 검색하거나, 보고서를 쓰는 등 실제로 무언가를 '수행'하는 데 능숙합니다. 보통 작은 학생들은 한 가지에는 뛰어나지만 다른 하나에는 서툽니다. 그들은 컴퓨터는 못 쓰지만 수학은 잘하는 천재일 수도 있고, 버튼은 잘 누르지만 작업 뒤에 숨겨된 논리는 파악하지 못하는 학생일 수도 있습니다. 이 연구의 목표는 단 하나의 작은 학생이 거대한 뇌를 필요로 하지 않고도 논리와 실행 모두의 달인이 될 수 있도록 훈련할 수 있는지 확인하는 것입니다.
여기서 Nanbeige4.2-3B가 등장합니다. Nanbeige LLM Lab에서 선보인 이 새로운 모델은 이 퍼즐을 풀고자 합니다. 이 모델을 '소형 범용 에이전트'라고 생각하십시오. 자신의 크기에 갇히기를 거부하는 30억 개의 파라미터를 가진 아주 작은 뇌입니다. 연구진은 모델을 더 똑똑하게 만들기 위해 반드시 더 크게 만들 필요는 없으며, 단지 뇌를 더 효율적으로 사용하는 법을 가르치면 된다는 것을 발견했습니다.
비결: "루프(Looped)" 뇌
Nanbeige4.2-3B가 사용하는 첫 번째 기술은 **루프드 트랜스포머(Looped Transformer)**라는 영리한 구조적 해킹입니다. 표준 AI 모델을 30개의 스테이션이 있는 공장 조립 라인이라고 상상해 보십시오. 데이터(질문 등)가 스테이션 1, 2, 3을 거쳐 30번까지 진행된 후 작업이 끝납니다. 공장을 더 똑똑하게 만들기 위해 보통은 스테이션을 더 추가하여 공장을 더 크고 비싸게 만듭니다.
하지만 Nanbeige는 공장은 작게 유지하되 노동자들이 더 열심히 일하게 만드는 방식을 택했습니다. 새로운 스테이션을 추가하는 대신, 그들은 '루프'를 구축했습니다. 데이터가 30개의 스테이션을 한 번 통과한 후, 다시 처음으로 돌아가 동일한 30개의 스테이션을 두 번째로 통과하게 만든 것입니다. 이는 마치 학생이 어려운 문단을 읽고 나서, 첫 번째 읽을 때 놓친 세부 사항을 잡기 위해 그 문단을 다시 한번 읽는 것과 같습니다. 이 '루프' 덕 모델은 새로운 부품을 추가하지 않고도 정보를 훨씬 더 깊이 있게 처리할 수 있습니다. 논문에서는 기존 모델에 단순히 루프를 추가하는 것이 아니라, 이 루프를 적용하여 모델을 처음부터(from scratch) 훈련시키는 것이 성공의 핵심이었다고 밝혔습니다.
소형 천재를 훈련시키기
뇌를 구축한 후, 연구진은 이를 가르쳐야 했습니다. 연구진은 단순히 모델에게 무작위 지식을 주입한 것이 아니라, 스포츠 팀의 훈련 일정처럼 세 단계로 구성된 엄격한 훈련 캠프를 만들었습니다.
1단계: 기초 다지기 (사전 학습, Pre-training)
직업을 배우기 전, 모델은 28조 개의 토큰(단어 또는 단어의 일부와 같은 텍스트 덩어리)으로 이루어진 방대한 도서관을 읽었습니다. 연구진은 모델이 강력한 논리적 근간을 가질 수 있도록 이 읽기 목록에 수학, 코드, 과학을 대거 포함시켜 특별히 조정했습니다.
2단계: 실전 연습 (지도 미세 조정, Supervised Fine-Tuning)
다음으로, 모델에게 실제로 '하는 법'을 가르쳤습니다. 연구진은 '궤적(trajectories)'이라 불리는, 문제 해결 과정을 단계별로 기록한 방대한 컬렉션을 만들었습니다. 이는 단순한 질문이 아니라 고장 난 컴퓨터 프로그램을 고치거나, 어지러운 사무실을 정리하거나, 다양한 도구를 사용하여 정보를 찾는 것과 같은 복잡한 시나리오였습니다.
- 전략: 짧고 논리적인 문제(64K 컨텍스트)에서 시작하여 점차 길고 복잡한 작업(최대 256K 토큰)으로 나아갔습니다.
- 필터링: 아무 답변이나 받아들이지 않았습니다. 만약 모델이 긴 작업 도중 실수를 하면, 어떻게 복구하는지도 가르쳤습니다. 연구진은 "이봐, 3단계에서 실수했지만, 4단계에서 이를 바로잡을 수 있도록 거기서 일어난 일을 잊지 마"라고 알려주는 '손실 마스크(loss mask)'를 사용했습니다. 이를 통해 모델은 완벽할 뿐만 아니라 회복 탄력성을 갖도록 훈련되었습니다.
3단계: 코치의 휘슬 (강화 학습, Reinforcement Learning)
마지막으로, 모델의 행동을 다듬기 위해 강화 학습(RL) 기법을 사용했습니다. 이는 마치 코치가 선수를 지켜보며 좋은 움직음에는 점수를 주고 나쁜 움직임에는 점수를 깎는 것과 같습니다.
- 중언부언 방지: 연구진은 모델이 가끔 루프에 빠져서 같은 말을 반복하거나 너무 오래 떠드는 현상을 발견했습니다. 그들은 모델이 작업이 완료되면 멈추도록 훈련하여, 답변을 더 짧고 효율적으로 만들었습니다.
- 길이 제어: 어려운 수학 문제의 경우 모델이 필요한 만큼 충분히 생각하도록 허용했습니다. 하지만 쉬운 문제의 경우에는 너무 오래 걸리면 벌점을 주었습니다. 이를 통해 모델은 할 수 있을 때는 간결하게, 필요할 때는 철저하게 행동하도록 강제되었습니다.
- 행동 보상: 도구를 올바르게 사용하면 추가 점수를 주고, 같은 실수를 두 번 하면 점수를 깎았습니다. 이는 모델이 길고 복잡한 작업에서 안정적인 성능을 내도록 도왔습니다.
결과: 작지만 강하다
그렇다면 이 작은 30억 파라미터 모델이 실제로 효과가 있을까요? 결과는 놀라울 정도로 강력합니다. 테스트 결과, Nanbeige4.2-3B는 훨씬 더 큰 모델들을 상대로도 충분히 버텨냈을 뿐만 아니라 종종 승리했습니다.
- 거인들을 이기다: 개인 비서로서의 능력(사무 업무 처리, 도구 사용, 코딩 등)을 측정하는 테스트에서, Nanbeige4.2-3B는 90억 개 및 120억 개의 파라미터를 가진 모델보다 뛰어난 성과를 보였습니다. 예를 들어, 소프트웨어 버그 수정 테스트인 SWE-bench Verified에서 **63.6%**를 기록하며, 90억 파라미터의 Qwen3.5(53.1%)와 120억 파라미터의 Gemma4(44.2%)를 앞질렀습니다.
- 추론 능력: 크기 때문에 두뇌 능력을 희생하지 않았습니다. GPQA-Diamond와 같은 어려운 수학 및 과학 테스트에서 **87.4%**를 기록하며 더 큰 모델들보다 높은 점수를 받았습니다.
- 실제 활용: OpenClaw라는 실제 '개인 비서' 환경에 배치되었을 때, 이 모델은 일상적인 업무, 사무 워크플로우, 심층 연구 등을 더 큰 모델들보다 더 잘 수행하며 실험실용 모델이 아닌 실용적인 도구임을 증명했습니다.
이것이 의미하는 바
이 논문은 모델을 똑똑하게 만들기 위해 반드시 더 크게 만들어야 한다는 생각에 명시적으로 반박합니다. 적절한 구조(루프), 적절한 데이터(28T 토큰의 고품질 혼합), 그리고 적절한 훈련 방법(단계별 RL)이 있다면, 작은 모델도 거대한 뇌가 필요하다고 여겨졌던 '에이전트적' 능력을 달성할 수 있음을 시사합니다.
하지만 저자들은 이것이 이 특정 모델 크기와 구조에 대한 성과임을 주의 깊게 언급합니다. 이 모델이 모든 AI 문제를 영원히 해결할 것이라고 주장하는 것은 아닙니다. 대신, 이 접근 방식이 새로운 문을 열었다고 제안합니다. 이제 우리는 클라우드의 슈퍼컴퓨터 없이도 개인용 컴퓨터에서 로컬로 실행되며, 복잡하고 다단계적인 작업을 처리할 수 있는 작고 효율적인 AI 비서를 구축할 수 있게 되었습니다. 미래는 더 큰 뇌를 만드는 것이 아니라, 더 작은 뇌가 어떻게 루프를 통해 생각할 수 있는지를 가르치는 데 있을 것이라고 그들은 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.