← 최신 논문
🤖 machine learning

BlockGen: Flexible Blockwise Sequence Modeling with Hybrid Samplers

이 논문은 마스크드 확산(masked diffusion)과 균일 상태 확산(uniform-state diffusion)을 AR 정보 기반의 예측자-교정자(predictor-corrector) 샘플링과 결합한 유연한 블록 단위 시퀀스 모델링 프레임링인 BlockGen을 소개하며, 적은 단계의 블록별 생성에서는 균일 확산이 마스크드 확산보다 우수한 성능을 보이지만 샘플링 단계와 특정 블록 크기가 증가함에 따라 그 성능 격차가 좁혀지거나 역전된다는 것을 입증한다.

원저자: Justin Deschenaux, Caglar Gulcehre

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Justin Deschenaux, Caglar Gulcehre

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기를 쓰려고 하는데, 두 가지 서로 다른 방식이 있다고 상상해 보세요.

옛날 방식 (자기회귀 방식 - Autoregressive): 당신은 왼쪽에서 오른쪽으로 한 번에 한 단어씩 글을 씁니다. 일단 단어를 쓰면, 그것을 확정 짓고 다음 단어로 넘어갑니다. 이 방식은 빠르고 신뢰할 수 있지만, 첫 문장에서 실수를 하면 전체를 다시 쓰지 않고는 쉽게 되돌려 고칠 수 없습니다. 또한, 한 번에 한 단어씩만 쓸 수 있기 때문에 긴 이야기를 완성하는 데 시간이 오래 걸립니다.

새로운 방식 (확산 방식 - Diffusion): 당신이 무작위한 횡설수설(예: "xkq#z@!")로 가득 찬 페이지에서 시작한다고 상상해 보세요. 이때 똑똑한 편집자가 페이지 전체를 한꺼번에 보면서 몇몇 단어를 의미가 통하도록 수정하려고 노력합니다. 그다음 편집자는 다시 한번 보고 몇 단어를 더 고칩니다. 이 과정을 반복하며 횡설수설을 서서히 하나의 이야기로 만들어 갑니다. 이 방식은 페이지 전체를 조망하며 어디든 틀린 부분을 고칠 수 있다는 장점이 있습니다. 하지만, 이렇게 "한꺼번에" 작업하는 것은 보통 더 느리며, 최종 결과물이 옛날 방식만큼 완벽하지 않을 수도 있습니다.

최근 연구자들은 세 번째 방법인 **블록 단위 방식 (Block-by-Block)**을 찾아냈습니다. 이 방식은 한 번에 한 단어씩 쓰거나 페이지 전체를 한꺼번에 고치는 대신, 문단과 같은 작은 덩어리(chunk) 단위로 이야기를 쓰고(또는 고치고) 진행합니다. 문단 1을 완성하여 확정 지은 다음, 문단 2로 넘어가는 식입니다. 이 방식은 옛날 방식의 속도와 새로운 방식의 유연함을 모두 제공합니다.

이 논문이 해결하는 문제

저자인 저스틴 데셰노(Justin Deschenaux)와 칼가르 굴체레(Caglar Gulcehre)는 사람들이 이 "블록 단위" 모델을 테스트할 때 두 가지 큰 문제를 범하고 있다는 점을 발견했습니다.

  1. "무작위 추측" 문제: 모델이 문단에서 실수를 했을 때, 기존의 수정 방식들은 그냥 무작위로 단어를 골라 고쳤습니다. 이는 마치 선생님이 학생에게 "네 에세이에서 아무 단어나 하나 골라서 고쳐봐"라고 말하는 것과 같습니다. 특정 문장이 말이 안 된다는 것을 짚어주는 것이 아니라 말이죠.
  2. "일률적 적용" 문제: 이전 연구들은 이 모델들을 테스트할 때 항상 하나의 특정 블록 크기(예: 항상 16단어 단위)만을 사용했습니다. 하지만 어떤 작업에는 4단어 블록이 더 적합할 수 있고, 어떤 작업에는 32단어 블록이 더 적합할 수도 있습니다. 아무도 이들을 섞어서 시도해 보지 않았습니다.

해결책: BlockGen

그들은 BlockGen이라는 새로운 시스템을 만들었습니다. 이것은 다양한 길이의 문단을 다룰 수 있는 매우 유연한 작가라고 생각하면 됩니다.

  • 크기 혼합하기: 모델이 16단어 덩어리만 쓰도록 학습시키는 대신, 1단어, 2단어, 4단어부터 16단어 또는 32단어까지 다양한 크기를 혼합하여 학습시켰습니다.
  • 마법 같은 기술: 모델이 이 모든 다양한 크기를 쓰는 법을 배웠기 때문에, 모델은 하나의 비밀을 깨달았습니다. 바로 단일 단어를 완벽하게 쓰는 법(옛날의 "자기회귀" 방식처럼)을, 문단 전체를 고치는 법만큼이나 잘 할 수 있게 된 것입니다. 이를 통해 모델은 스스로의 "검증기(verifier)" 역할을 할 수 있게 되었습니다.

새로운 전략: ARPC ("똑똑한 편집자")

이 논문은 ARPC(Autoregressive-Informed Predictor-Corrector, 자기회귀 정보 기반 예측-교정기)라는 새로운 텍스트 생성 방식을 소개합니다.

작동 방식은 다음과 같은 창의적인 비유로 설명할 수 있습니다:
당신이 "블록 단위" 방식으로 문단을 쓰고 있다고 상상해 보세요. 당신은 문단 전체의 초안을 작성합니다.

  1. 첫 번째 단계: 모델이 전체 문단을 빠르게 작성합니다.
  2. "똑똑한 체크": 문단을 확정 짓기 전에, 모델은 자신의 작업물을 빠르게 살펴봅니다. 그리고 스스로에게 묻습니다. "만약 내가 (옛날의 믿음직한 방식처럼) 한 단어씩 썼다면, 여기에는 어떤 단어를 썼을까?"
  3. 교정: 만약 모델의 이 "한 단어씩 쓰는" 예측값이 방금 쓴 내용과 크게 다르다면, 모델은 해당 단어가 틀렸을 가능성이 높다는 것을 인지합니다. 그리고 오직 그 특정 단어들만을 다시 씁니다.

이는 단순히 무작위로 단어를 골라 다시 쓰던 기존 방식보다 훨씬 똑똑합니다. 이는 선생님이 "아무 단어나 하나 고쳐봐"라고 말하는 것과 "동사가 잘못 쓰인 그 문장을 고쳐라"라고 말하는 것의 차이와 같습니다.

연구 결과

저자들은 수학 문제(GSM8K)와 일반적인 글쓰기(OpenWebText)를 대상으로 테스트를 진행했습니다.

  1. "Uniform" 대 "Masked" 논쟁: 확산(diffusion)의 세계에는 두 가지 주요 "편집자" 유형이 있습니다.

    • Masked (마스크형): 편집자는 단어를 특수한 "빈칸(blank)" 토큰으로만 대체할 수 있습니다. 빈칸이 채워지면 그것은 확정됩니다.
    • Uniform (균등형): 편집자는 언제든 어떤 단어를 다른 단어로 바꿀 수 있습니다.
    • 이전의 발견: 페이지 전체를 한꺼번에 고칠 때는 "Uniform" 편집자가 더 나았습니다.
    • BlockGen의 발견: 블록 단위로 작업할 때, 단순한 과정을 거친다면 여전히 "Uniform" 편집자가 더 낫습니다. 하지만, 새로운 "똑똑한 체크"(ARPC)를 사용할 경우, 고품질 작업(수학 등)에서는 "Masked" 편집자가 더 정밀하기 때문에 실제로 약간 더 우수해집니다.
  2. 속도 대 품질: "똑똑한 체크"(ARPC)를 사용하면 모델이 옛날의 느린 "한 단어씩 쓰는" 작가들의 품질에 훨씬 더 가깝게 도달하면서도, 덩어리째로 고치기 때문에 훨씬 빠르게 작업할 수 있습니다.

  3. 트레이드오프 (절충점): 이 논문은 이 유연한 모델을 훈련하는 것이 표준 모델보다 더 많은 비용(더 많은 컴퓨터 연산 능력)이 든다는 점을 인정합니다. 또한, 그들의 모델은 아직 오늘날 빅테크 기업들이 사용하는 거대 AI 모델들보다 규모가 작으므로, 이 방식이 모든 가능한 작업에 통용된다고 주장할 수는 없습니다.

요약하자면

이 논문은 다양한 크기의 덩어리로 글을 쓰는 법을 배우는 유연한 AI인 BlockGen을 소개합니다. 이 모델은 다양한 크기의 덩어리를 다루는 유연함과, 모델 자신의 지식을 활용해 틀린 부분만을 찾아내어 고치는 "똑똑한 체크"(ARPC) 시스템을 결합함으로써, 한 단어씩 쓰는 것보다 빠르면서도 정확도는 대등하고, 기존의 "전체 수정" 방식보다 똑똑한 방법을 만들어냈습니다. 그들은 "Uniform" 방식이 일반적으로 강력하지만, 이 스마트한 교정법을 사용할 경우 "Masked" 방식이 복잡한 작업에서 놀라울 정도로 경쟁력을 갖게 된다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →