← 최신 논문
💬 NLP

Nemotron-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context

Nemotron-TwoTower는 컨텍스트 처리와 디노이징을 두 개의 특화된 타워로 분리하는 새로운 블록 단위 자기회귀 확산 아키텍처를 도입하여, 자기회귀 베이스라인 품질의 98.7%를 유지하면서도 생성 처리량을 2.42배 더 빠르게 달성했습니다.

원저자: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 긴 이야기를 쓰려고 노력 중이라고 상상해 보세요. 하지만 당신에게는 엄격한 규칙이 하나 있습니다. 당신은 오직 한 번에 한 단어씩만 쓸 수 있으며, 이전 단어가 완전히 끝날 때까지 다음 단어를 시작할 수 없다는 규칙입니다. 이것이 대부분의 현재 AI 언어 모델(이를 "자기회귀(Autoregressive)" 모델이라고 부릅니다)이 작동하는 방식입니다. 마치 실수는 전혀 하지 않지만 문장을 완성하는 데 한참이 걸리는, 매우 신중하고 느린 타자처럼 말이죠.

이제 새로운 방법을 상상해 보세요. 문장 전체를 한 번에 타이핑하고, 그 문장을 살펴본 다음, 모든 단어의 실수를 동시에 수정하는 방법입니다. 이 방식은 더 빠르지만, 보통 AI가 한꺼번에 모든 것을 고치려다 보니 혼란을 느껴 이야기의 품질이 떨어지곤 합니다.

Nemotron-TwoTower는 이 두 가지 세계의 장점만을 취하려는 새로운 발명품입니다. 즉, 한 번에 한 단어씩 쓰는 방식의 높은 품질과, 한 번에 전체를 타이핑하는 방식의 속도를 모두 잡으려는 것입니다.

이것이 어떻게 작동하는지, 간단한 비유를 통해 설명하겠습니다.

두 개의 타워: 사서와 편집자

연구진은 두 명의 팀원이 협력하는 것과 같은 두 개의 뚜렷한 "타워"(AI의 부분)를 구축했습니다.

  1. 동결된 컨텍스트 타워 (사서):

    • 역할: 이 부분은 지금까지의 이야기를 알고 있는 "전문가"입니다. 이는 동결된(고정된) 사전 학습된 AI입니다. 마치 이야기의 처음부터 끝까지 단어 하나하나를 읽어 내려가는 엄격한 사서와 같습니다.
    • 업무: 이 부분은 변하지 않습니다. 그저 지금까지 쓰인 모든 것을 완벽하고 체계적으로 기록할 뿐입니다. 사서는 다른 타워에게 "여기 지금까지의 이야기 맥락이 있습니다"라고 알려줍니다.
    • 중요성: 동결되어 있기 때문에, 이 모델이 기반으로 하고 있는 거대한 300억 파라미터 모델의 원래 지능과 지식을 그대로 유지합니다. 결코 잊거나 혼란스러워하지 않습니다.
  2. 학습 가능한 디퓨전 디노이저 타워 (편집자):

    • 역할: 이 부분은 "빠른 작업자"입니다. 학습이 가능하며 변화할 수 있는 AI입니다.
    • 업무: 단어를 하나씩 쓰는 대신, 현재 비어 있는(마스킹된) 16개 단어의 블록을 가져옵니다. 그리고 "사서"의 노트를 보고 16개의 빈칸을 한꺼번에 채우려고 시도합니다.
    • 과정: 즉시 완벽하게 해내지는 못합니다. 일단 추측을 한 다음, 자신의 추측과 사서의 노트를 대조하며 단어들을 다듬어 나갑니다. 이 과정을 반복하여(반복적 수행) 블록 안의 단어들이 깨끗하고 말이 되도록 만듭니다.
    • 마법: 16개의 단어를 동시에 보고 함께 수정할 수 있기 때문에, 한 번에 하나씩 쓰는 것보다 훨씬 빠릅니다.

이들이 함께 작동하는 방식 (조립 라인)

공장의 조립 라인을 상상해 보세요:

  1. 사서가 프롬프트와 이미 작성된 단어들을 읽으며, 이야기의 완벽한 정신적 지도를 유지합니다.
  2. 편집자가 빈 종이 뭉치(16개 단어 길이)를 집어 듭니다.
  3. 편집자가 사서에게 묻습니다. "다음에 무엇이 오나요?" 그러면 사서는 맥락을 제공합니다.
  4. 편집자는 16개의 빈칸을 채우고, 자신의 작업을 확인하며 오류를 수정합니다.
  5. 편집자가 16개의 단어가 괜찮다고 확신하면, 이 단어들은 "확정(commit)"됩니다.
  6. 사서는 이 새로운 16개의 단어를 포함하여 자신의 정신적 지도를 업데이트합니다.
  7. 편집자는 다음 16개 단어 뭉치를 집어 들고, 이 순환 과정이 반복됩니다.

결과: 속도 vs 품질

이 논문은 이 시스템이 "최적의 지점(sweet spot)"을 달성했다고 주장합니다.

  • 속도: 기존의 한 단어씩 쓰는 방식보다 2.42배 더 빠릅니다. 마치 달팽이에서 스프린터로 바뀐 것과 같습니다.
  • 품질: 원래 모델 품질의 **98.7%**를 유지합니다. 속도를 얻기 위해 지능을 크게 희생하지 않았습니다.
  • 효율성: 이 새로운 "편집자" 타워를 약 2.1조 개의 단어로 학습시켰는데, 이는 원래의 "사서"를 학습시키는 데 사용된 25조 개의 단어에 비해 아주 적은 양입니다. 즉, AI 전체를 처음부터 다시 가르칠 필요 없이, 단지 편집자가 사서의 노트를 사용하는 법을 가르치기만 하면 된다는 뜻입니다.

이전 시도들과 다른 점

이전의 시도들은 단 하나의 뇌가 두 가지 일을 모두 하도록 만들었습니다. 즉, 이야기를 기억하는 일과 단어를 수정하는 일을 동시에 수행하게 했습니다. 논문은 이것이 마치 한 사람에게 완벽한 기억 유지자가 되는 동시에 빠른 편집자가 되라고 요구하는 것과 같으며, 너무 과한 업무량 때문에 결국 두 가지 일 모두 완벽히 해내지 못한다고 주장합니다.

두 개의 타워(하나의 동결된 타워와 하나의 학습 가능한 타워)로 역할을 분리함으로써, 각 부분이 가장 잘할 수 있는 일을 하게 만들었습니다. 사서는 완벽함을 유지하고, 편집자는 빨라집니다.

"확신" 기법

이 시스템에는 스마트한 기능인 "확신 기반 언마스킹(confidence unmasking)"이 있습니다.

  • 만약 편집자가 특정 단어에 대해 매우 확신한다면, 즉시 그 단어를 확정합니다.
  • 만약 확신이 없다면, 그 단어를 빈칸(마스크)으로 남겨두고 다음 편집 단계에서 다시 수정하도록 합니다.
  • 이는 이미 맞다고 알고 있는 단어를 재확인하는 데 시간을 낭비하지 않고, 까다로운 부분을 다듬는 데 더 많은 시간을 쓰게 함을 의미합니다.

요약

Nemotron-TwoTower는 AI 텍스트 생성의 품질을 떨어뜨리지 않으면서 훨씬 빠르게 만드는 방법입니다. 이는 "이야기를 기억하는 일"(느리지만 완벽함 유지)과 "다음 단어 뭉치를 쓰는 일"(반복적이지만 빠르게 수행)을 분리함으로써 가능해졌습니다. 그 결과, 이 시스템은 기존의 느린 방식만큼이나 훌륭하게 이야기를 쓰면서도, 거의 두 배 이상 빠르게 글을 써냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →