← 최신 논문
💬 NLP

Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning

본 논문은 자기 증류 점진적 학습, 병렬 인식 정책 최적화, 그리고 재구성된 실행 엔진을 통해 대규모 언어 모델이 자가 진화를 통해 진정한 병렬 추론 능력을 획득하도록 하는 교사 없는 프레임워크인 네이티브 병렬 추론기 (NPR) 를 소개하며, 이를 통해 autoregressive 디코딩으로 되돌아가지 않고도 상당한 성능 향상과 최대 4.6 배의 추론 속도 향상을 달성합니다.

원저자: Tong Wu, Yang Liu, Jun Bai, Zixia Jia, Shuyi Zhang, Ziyong Lin, Yanting Wang, Song-Chun Zhu, Zilong Zheng

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tong Wu, Yang Liu, Jun Bai, Zixia Jia, Shuyi Zhang, Ziyong Lin, Yanting Wang, Song-Chun Zhu, Zilong Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 재능 있지만 매우 전통적인 학생이 있다고요. 이 학생은 문제 해결에 뛰어나지만, 책을 왼쪽에서 오른쪽으로 읽듯이 한 단계씩 해결합니다. 그들은 결코 앞을 내다보지 않으며, 결코 두 가지 다른 해결책을 동시에 시도하지 않습니다. 이것이 현재 대부분의 AI 모델이 작동하는 방식입니다: 그들은 직선적으로 생각합니다.

이 논문은 Native Parallel Reasoner(NPR, 네이티브 병렬 추론기) 라는 새로운 시스템을 소개합니다. NPR 을 책을 읽는 학생이 아니라, 단일 방에서 일하는 탐정 팀으로 생각하세요. 탐정 A 가 단서를 끝낼 때까지 탐정 B 가 기다리는 대신, 그들은 모두 미스터리의 서로 다른 부분을 동시에 해결한 후 사건을 해결하기 위해 함께 모입니다.

다음은 이 논문이 이 "팀"이 세 가지 주요 단계를 통해 어떻게 함께 일하도록 가르쳤는지 설명한 내용입니다:

1. 현재 AI 의 문제점

저자들은 현재 AI 가 병렬적으로 사고하려 할 때 세 가지 큰 두통이 있다고 말합니다:

  • 잘못된 도구: AI 를 실행하는 데 사용되는 소프트웨어 엔진은 직선을 위해 설계되었습니다. 이를 분기하도록 강요하는 것은 기차 선로에서 자동차를 운전하려는 것과 같습니다; 이는 고장 나거나 멈춥니다.
  • 낭비되는 노력: 병렬 사고에 대한 초기 시도는 어색했습니다. 다섯 명의 사람에게 수학 문제를 해결하라고 요청했지만, 그들이 필기용지를 공유하는 대신 각자가 문제를 처음부터 다시 써야 했던 것과 같습니다. 이는 그들을 더 느리게 만들었지, 더 빠르게 만들지 않았습니다.
  • "선생님"의 함정: 이전 방법들은 학생에게 병렬 사고를 보여주는 초지능 "선생님" AI 에 의존했습니다. 하지만 학생은 단순히 선생님의 직선적 사고를 모방하여 이를 병렬 형식에 억지로 끼워 넣었습니다. 걷기만 하는 사람에게 "더 빨리 걸으라"고 말하며 마라톤을 뛰게 하려는 것과 같았습니다. 그들은 새로운 이동 방식을 고안해 낼 수 없었습니다.

2. 해결책: 3 단계 훈련 캠프

NPR 시스템은 교사가 필요 없이 AI 가 진정한 병렬 사고자가 되도록 가르칩니다. 그들은 AI 가 스스로 가르치는 "자기 증류 (self-distilled)" 방식을 사용합니다.

  • 1 단계: 규칙 학습 ("형식" 단계)
    AI 를 혼란스러운 예술가로 상상해 보세요. 이 단계에서 연구자들은 보상 시스템을 제공합니다: "만약 당신이 그림을 특정하고 조직적인 격자에 그리면 금별을 받습니다. 무작위로 낙서하면 벌점을 받습니다." AI 는 아직 문제를 어떻게 해결할지 알지 못합니다; 그것은 단지 자신의 생각을 "Map-Process-Reduce"(계획 -> 실행 -> 요약) 형식이라는 구조화된 "지도"로 조직하는 법을 배울 뿐입니다. 그것은 병렬 사고의 형태를 배웁니다.

  • 2 단계: 워밍업 ("연습" 단계)
    이제 AI 가 규칙을 알았으니, 연습을 시작합니다. 연구자들은 AI 가 수천 개의 답변을 생성하게 하지만, 나쁜 것들 (틀리거나 규칙을 따르지 않는 것들) 은 버립니다. 완벽하고 구조화된 답변만 유지하여 AI 를 "파인튜닝 (fine-tune)"하는 데 사용합니다. 이는 코치가 팀에게 완벽한 포메이션을 암기할 수 있도록 연습 세션에서 최고의 플레이만 보여주는 것과 같습니다.

  • 3 단계: 실제 경기 ("강화" 단계)
    이것이 큰 도약입니다. AI 는 이제 어려운 문제를 해결해야 하는 실제 경기장에 투입됩니다. 그것은 다양한 병렬 전략을 시도합니다. 만약 빠르게 해결책을 찾으면 보상을 받습니다. 만약 막히면 다른 분기를 시도하도록 배웁니다. 결정적으로, 연구자들은 AI 가 "하나씩" 사고하는 방식으로 다시 미끄러지지 않도록 하고, 팀이 공간 부족에 시달리지 않도록 메모리를 관리하는 "NPR 엔진"(새로운 유형의 소프트웨어) 이라는 특별한 심판을 구축했습니다.

3. 결과: 더 빠르고 더 똑똑해짐

이 논문은 이 새로운 "탐정 팀"을 수학 경시대회와 논리 퍼즐과 같은 여덟 가지 유형의 어려운 추론 테스트에서 테스트했습니다.

  • 진정한 병렬성: 때로는 병렬인 척하지만 실제로는 직선적으로 사고하는 다른 모델들 (가짜) 과 달리, NPR 은 100% 진정한 병렬 사고를 수행했습니다. 결코 속이지 않았습니다.
  • 속도: 실제로 병렬로 사고했기 때문에 훨씬 더 빨랐습니다. 가장 어려운 문제에서 기존 직선 모델보다 4.6 배 더 빠릅니다. 이는 한 사람이 목적지까지 걸어가는 것과 여러 대의 자동차가 동시에 그곳으로 운전해 가는 것의 차이와 같습니다.
  • 정확도: 인간 교사나 다른 병렬 방법으로 훈련된 모델들보다 더 많은 문제를 정확하게 해결했습니다.

핵심 교훈

이 논문은 AI 가 자신의 주의를 분할하고 여러 경로를 동시에 작업하는 방법을 스스로 가르치게 함으로써, 복잡한 퍼즐을 해결하는 데 더 똑똑할 뿐만 아니라 훨씬 더 빠른 AI 를 만들 수 있다고 주장합니다. 그들은 단순히 AI 가 병렬처럼 보이게 강요한 것이 아니라, 마침내 올바르게 운동된 근육처럼 네이티브 (본질적) 인 병렬 사고 능력을 진화시키도록 도왔습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →