← 최신 논문
💬 NLP

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

이 논문은 다양한 모델 규모와 배포 환경 전반에 걸쳐 각 방식의 상호 보완적인 강점을 활용함으로써 우수한 처리량과 정확도를 달성하기 위해 자기회귀(autoregressive), 확산(diffusion), 그리고 자기 추측(self-speculation) 디코딩을 단일 아키텍처 내로 통합한 삼중 모드 언어 모델인 Nemotron-Labs-Diffusion을 소개한다.

원저자: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Nor
게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 이야기를 쓰려고 하는데, 두 가지 서로 다른 방식이 있다고 상상해 보세요.

옛날 방식 (자기회귀, Autoregressive): 이것은 문장을 왼쪽에서 오른쪽으로 엄격하게 한 단어씩 써 내려가는 것과 같습니다. 당신은 "그(The)"를 쓰고, 그다음엔 "무엇이 올까?"라고 생각한 뒤 "고양이(cat)"를 씁니다. 그다음 "무엇이 올까?"라고 생각하고 "앉았다(sat)"를 씁니다. 매우 정확하고 문법 규칙을 완벽하게 따르지만, 현재 단어를 끝내기 전까지 다음 단어를 쓸 수 없기 때문에 느립니다. 마치 키보드를 치는 한 사람이 다음 키 입력을 기다리며 한 글자씩 타이핑하는 것과 같습니다.

새로운 방식 (확산, Diffusion): 이것은 문단 전체를 한꺼번에 쓰되, 일부 단어가 빠져 있거나 뒤섞여 있는 초안을 가진 것과 같습니다. 그런 다음 동시에 여러 단어를 한꺼번에 수정합니다. 이 방식은 여러 단어를 동시에 처리하기 때문에 훨씬 빠릅니다. 하지만 엄격한 왼쪽에서 오른쪽으로의 규칙을 따르지 않기 때문에, 이야기가 가끔 앞뒤가 맞지 않거나 이상하게 들릴 수 있습니다.

논문의 핵심 아이디어:
NVIDIA의 연구진은 Nemotron-Labs-Diffusion이라는 "슈퍼 모델"을 만들었습니다. 이 모델은 하나의 뇌 안에서 상황에 따라 세 가지 다른 모드로 전환할 수 있는 **맥가이버 칼(Swiss Army Knife)**이라고 생각하면 됩니다.

세 가지 모드

  1. "엄격한 작가" 모드 (AR 모드):

    • 작동 방식: 옛날의 느린 방식과 똑같이 작동합니다. 단어를 하나씩 차례대로 씁니다.
    • 사용 시점: 동시에 많은 사람이 이야기를 요청할 때(높은 동시성) 사용합니다. 신뢰할 수 있으며 문법을 완벽하게 유지합니다.
    • 논문의 주장: 이 모델은 다른 모드들을 수행할 줄 알면서도, 기존의 가장 뛰어난 모델들만큼 완벽한 문장을 쓰는 능력을 갖추고 있습니다.
  2. "빠른 수정가" 모드 (Diffusion 모드):

    • 작동 방식: 한꺼번에 여러 단어를 추측하고 병렬로 수정합니다.
    • 사용 시점: 속도가 필요하거나 모델이 혼자 작업하거나 아주 적은 수의 사람과 함께 작업할 때 사용합니다.
    • 논문의 주장: 이 모드는 믿을 수 없을 정도로 빠르지만, 보통 "엄격한 작가"만큼 정확하지는 않습니다. 그러나 이 새로운 모델은 속도를 높이면서도 높은 정확도를 유지할 수 있을 만큼 똑똑합니다.
  3. "초안 작성 및 검토" 모드 (Self-Speculation):

    • 작동 방식: 이것이 이 논문의 핵심 비법입니다. 모델 안에 "빠른 뇌"와 "신중한 뇌"가 함께 작동한다고 상상해 보세요.
      • **빠른 뇌(Diffusion)**가 추측한 문장 전체의 초안을 빠르게 작성합니다.
      • **신중한 뇌(AR)**가 그 추측들을 즉시 검토합니다. 만약 신중한 뇌가 동의하면, 모델은 그 단어들을 한꺼번에 수락합니다. 만약 동의하지 않으면, 실수를 바로잡고 다음 단계로 넘어갑니다.
    • 논문의 주장: 이것은 개인용 사용(예: 노트북 사용)에서 승자입니다. 기존의 "한 단어씩 처리하는" 방식보다 훨씬 빠르며, 경쟁사들이 사용하는 다른 "추측" 방식보다도 더 빠릅니다. 이는 자신의 작업물을 즉시 편집할 수 있는 속독가와 같습니다.

이것이 왜 중요한가 (아하! 모먼트)

  • 서로 싸우지 않고 서로를 돕습니다: 연구진은 "엄격한 작가"와 "빠른 수정가"가 적대적인 관계가 아님을 발견했습니다. 실제로 모델에게 엄격한 작가가 되는 법을 먼저 가르치는 것이 나중에 더 나은 빠른 수정가가 되는 데 도움이 됩니다. 이는 마치 걷기를 배우기 전에 뛰는 법을 배우는 것과 같습니다. 걷기 훈련이 모델에게 방향 감각(문법)을 제공하여, 달리다가 넘어지지 않도록 도와주는 것입니다.
  • 경쟁자보다 뛰어납니다: 이 새로운 모델을 현재 최고의 모델들(Qwen 등)과 테스트했을 때, 새로운 모델은 지능 수준을 동일하게 유지하면서도 단일 단계에서 토큰(단어)을 생성하는 속도가 6배 더 빨랐습니다. 강력한 최신 칩 위에서는 실제 업무를 처리하는 속도가 4배 더 빨랐습니다.
  • 속도를 높일 여지는 여전히 남아 있습니다: 연구진은 "빛의 속도(Speed of Light)" 분석을 수행했습니다. 그들은 "만약 우리가 완벽한 시스템을 가지고 있다면, 이 모델이 이론적으로 도달할 수 있는 가장 빠른 속도는 얼마인가?"라고 물었습니다. 그들은 현재의 "초안 작성 및 검토" 방식이 이미 훌륭하지만, 이론적 최대 속도와는 여전히 76.5%의 격차가 있다는 것을 발견했습니다. 이는 이 기술이 완전히 새로운 발명을 필요로 하지 않고도 미래에 훨씬 더 빨라질 수 있는 발전 가능성이 크다는 것을 의미합니다.

결론

이 논문은 느리고 완벽한 작가, 빠르고 병렬적인 추측가, 그리고 초안을 작성하고 즉시 스스로 검토하는 하이브리드 모델이 될 수 있는 단일 AI 모델을 소개합니다. 이 모델은 속도와 정확도 중 하나를 선택할 필요가 없음을 증명하며, 최선의 결과를 얻기 위해 두 가지 장점을 모두 활용할 수 있는 모델을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →