← 최신 논문
💬 NLP

Training Hybrid Block Diffusion Language Models with Partial Bidirectionality

본 논문은 양방향 마마(Mamba) 스캐닝을 활성 디노이징 블록으로 제한하여 정확한 캐싱을 가능하게 함으로써, 기존의 전체 시퀀스 및 어텐션 기반 확산 베이스라인 모델들보다 우수한 퍼플렉시티(perplexity)와 현저히 높은 롱 컨텍스트 추론 처리량을 달나성하는 하이브리드 확산 언어 모델인 BDLM Mamba-H를 소개한다.

원저자: Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 긴 이야기를 쓰려고 한다고 상상해 보세요. 하지만 당신에게는 엄격한 규칙이 하나 있습니다. 오직 방금 쓴 마지막 몇 페이지만을 기억할 수 있다는 것입니다. 문장을 하나 쓸 때마다, 당신은 공책의 맨 처음으로 다시 걸어가서 지금까지 쓴 모든 단어를 읽은 다음, 다음에 무엇을 쓸지 결정해야 합니다.

이것이 바로 현재의 "대규모 언어 모델(LLM, AI 챗봇)"이 긴 문맥을 다룰 때 겪는 어려움입니다. 대화가 길어질수록, AI는 새로운 단어를 하나 생성할 때마다 전체 기록을 매번 "다시 읽어야" 합니다. 이는 매우 느리고 많은 에너지를 낭비하게 만듭니다. 마치 매 걸음마다 점점 더 무거워지는 배낭을 메고 마라톤을 하는 것과 같습니다.

이 논문은 이러한 문제를 해결하기 위해 AI가 "기억하고" "생각하는" 방식을 바꾸는 새로운 방법인 BDLM Mamba-H라는 새로운 학습법을 소개합니다.

다음은 쉬운 비유를 사용한 상세 설명입니다.

1. 문제점: "무거운 배낭"

현재의 AI 모델은 질문에 답하기 전에 매번 교과서 전체를 다시 읽어야 하는 학생과 같습니다.

  • 문제점: 이야기가 길어질수록 "배 backpack"(기억)은 너무 무거워집니다. 컴퓨터는 실제로 생각(연산)하는 시간보다 데이터를 옮기는 데(메모리 대역폭) 더 많은 시간을 소비하게 됩니다.
  • 기존의 해결책: 일부 연구자들은 다른 종류의 메모리(Mamba라고 불리는)를 사용하여 배낭을 더 가볍게 만들려고 시도했습니다. 다른 이들은 한 번에 한 단어씩 쓰는 대신 여러 문장을 한꺼번에 쓰는 방식(Block Diffusion)을 시도했습니다.
  • 결함: 연구자들이 이 두 가지 아이디어를 결합하려고 했을 때, 문제가 발생했습니다. "Mamba" 메모리 시스템은 제대로 작동하기 위해 이야기 전체를 역방향으로 훑어봐야 했습니다. 하지만 전체 이야기를 역방향으로 훑어보면, 이미 완료한 부분에 대한 "책갈피"를 저장할 수 없습니다. 매번 모든 것을 다시 읽어야만 합니다.

2. 해결책: "로컬 역방향 스캔 (Local Reverse Scan)"

저자들은 영리한 묘수를 제안합니다. 현재의 단락 안에서만 뒤를 돌아보는 것입니다.

당신이 챕터별로 책을 쓰고 있다고 상상해 보세요.

  • 기존 방식 (전체 역방향): 새로운 문장을 쓰기 위해, 당신은 매번 마지막 페이지부터 첫 번째 페이지까지 책 전체를 다시 읽습니다.
  • 새로운 방식 (BDLM Mamba-H):
    1. "깨끗한" 부분: 한 챕터가 끝나면, 그 챕터를 안전한 금고에 넣습니다. 그리고 그 챕터에 대한 간단한 "요약 카드"(캐시)를 만듭니다. 당신은 다시는 금고를 열 필요가 없으며, 단지 요약 카드만 사용하면 됩니다.
    2. "활성" 부분: 현재 챕터를 쓰는 동안에는, 문장들이 잘 흐르는지 확인하기 위해 해당 챕터 내에서 앞뒤로 훑어볼 수 있습니다.
    3. 마법 같은 점: 당신이 현재 챕터 내부에서만 뒤를 돌아보기 때문에, 완료된 챕터들의 요약 카드는 업데이트될 필요 없이 유효하게 유지됩니다.

3. 결과: 속도와 지능

연구진은 이 새로운 방식이 기존 방식들에 비해 지능을 유지하면서도 속도를 높이는 두 가지 주요 목표를 달 수 있는지 테스트했습니다.

  • 지능적인가? 네. 표준 독해 테스트(C4-en)를 통해 테스트했을 때, 새로운 모델(BDLM Mamba-H)은 작은 규모의 모델들(8,700만 파라미터) 사이에서 가장 높은 점수를 받았습니다. 모델을 더 크게 만들었을 때도(3억 5,000만 파라미터), 다른 최상위 모델들과 대등한 수준의 지능을 유지했습니다.
  • 빠른가? 엄청난 차이가 있습니다.
    • 중간 길이(65,000 단어)에서, 새로운 모델은 기존의 "전체 역방향" 방식보다 19.7배 더 빨랐습니다.
    • 매우 긴 길이(262,000 단어)에서, Mamba를 사용하지 않는 기존의 가장 뛰어난 "블록" 방식보다 3.7배 더 빨랐습니다.

핵심 요약

이 새로운 모델을, 완성된 챕터를 다시 읽을 필요가 없도록 책갈피를 만들어 두면서도, 동시에 현재 챕터를 자유롭게 편집할 수 있게 된 작가라고 생각하십시오.

텍est 블록 내에서만 "뒤를 돌아보는 것"을 제한함으로써, AI는 메모리 트래픽에 발이 묶이지 않고 매우 긴 이야기를 생성할 수 있습니다. 이 논문은 이것이 긴 문맥을 처리하기 위한 실용적이고 강력한 구조임을 입증하며, 모든 기록을 매번 다시 처리하지 않고도 속도와 고품질의 글쓰기를 모두 가질 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →