Rethinking the Generation Order of Block Diffusion Language Models
이 논문은 블록 확산 언어 모델의 내재적인 좌에서 우로의 정렬을 활용하여 순수 자기회귀 디코딩에 비해 품질 저하를 최소화하면서도 더 빠른 생성 속도를 달성하는 훈련이 필요 없는 샘플링 방법인 병렬 자기회귀 디코딩(PARD)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 오랫동안 이를 수행하는 가장 좋은 방법은 사람이 책을 읽는 것처럼 왼쪽에서 오른쪽으로 한 번에 한 단어씩 로봇이 쓰게 만드는 것이었습니다. 이 방식은 "자기회귀(autoregressive)" 생성이라고 불리며, 매우 신뢰할 수 있지만 타자기로 소설을 치는 한 명의 사람처럼 매우 느릴 수 있습니다. 최근 과학자들은 "디퓨전(diffusion, 확산)"이라 불리는 새로운 방법을 발견했습니다. 이는 마치 화가가 노이즈로 뒤덮인 빈 캔버스에서 시작하여 점진적으로 노이즈를 제거하며 선명한 그림을 만들어내는 것과 같습니다. 이 새로운 방식은 로봇이 한 번에 여러 단어를 추측할 수 있게 하여, 잠재적으로 훨씬 더 빠르게 글을 쓸 수 있게 해줍니다. 하지만 여기에는 함정이 있습니다. 이 "노이즈 제거" 방식은 유연성 면에서는 뛰어나지만, 때때로 단어의 순서에 대해 혼란을 느껴 횡설수설하는 결과를 낳기도 합니다. 연구자들의 큰 과제는 "타자기의 논리적 흐름을 잃지 않으면서 어떻게 화가의 속도를 얻을 것인가?"입니다.
이 논문은 블록 디퓨전 언어 모델(Block Diffusion Language Models, BDLM)이라고 불리는 더 최신의 "노이즈 제거" 모델들을 살펴봄으로써 바로 그 퍼즐을 다룹니다. 저자인 카이 순 호우(Kai Syun Hou)와 제임스 곽(James Kwok)은 놀라운 사실을 발견했습니다. 이 모델들이 비록 어떤 순서로든 단어를 추측할 수 있도록 설계되었음에도 불구하고, 예상보다 훨씬 더 기존의 오래된 방식인 왼쪽에서 오른쪽으로 가는 타자기처럼 "생각"한다는 것입니다. 그들은 이 모델들이 엄격하게 왼쪽에서 오른쪽 방향을 따르도록 강제하면서도, 동시에 몇 단어를 한꺼번에 추측할 수 있도록 허용하면 완벽한 절충점을 찾을 수 있다는 것을 발견했습니다. 그들은 이 새로운 방법을 PARD(Parallel Autoregressive Decoding, 병렬 자기회귀 디코딩)라고 부릅니다. 이것은 마치 순서대로 쓰기로 합의한 작가 팀과 같습니다. 다만 한 사람이 문장을 완전히 끝낼 때까지 다음 사람이 기다리는 대신, 그들은 자신들이 충분히 확신할 수 있다면 다음 몇 단어를 동시에 완성하기 위해 모두 달려드는 방식입니다. 결과적으로 로봇은 기존의 느린 방식보다 훨씬 빠르게 글을 쓰면서도, 이야기는 여전히 논리적이고 높은 품질을 유지합니다.
"노이즈 제거" 로봇의 이야기
이것이 왜 중요한지 이해하기 위해, 두 가지 서로 다른 방식으로 로봇이 문장을 쓰려고 시도하는 모습을 그려봅시다.
옛날 방식 (자기회귀): 로봇이 한 번에 한 글자씩 이야기를 쓰는 것을 상상해 보세요. 로봇은 "T", 그 다음 "h", 그 다음 "e", 그 다음 " "를 씁니다. 현재 단어를 마칠 때까지 다음 단어를 쓸 수 없습니다. 매우 신중하고 실수가 거의 없지만, 느립니다. 마치 소설을 타이핑하는 한 명의 사람과 같아서, 첫 페이지를 마칠 때까지 마지막 페이지를 타이핑할 수 없습니다.
새로운 방식 (디퓨전): 이제 모든 단어가 물음표(또는 "마스크")로 대체된 문장에서 시작하는 로봇을 상상해 보세요. 로봇의 임무는 전체 문장을 보고 빠진 단어들을 추측하는 것입니다. 로봇은 반드시 순서대로 추측할 필요가 없습니다. 마지막 단어를 먼저 추측한 다음, 첫 번째 단어, 그다음 중간 단어를 추측할 수도 있습니다. 이것은 화가가 지저분하고 흐릿한 캔버스를 보며 최종 이미지를 파악하려고 노력하는 것과 같습니다. 이 방식의 장점은 속도입니다. 로봇은 문장의 많은 부분을 동시에 수정할 수 있습니다. 단점은 만약 로봇이 문장의 시작 부분보다 끝부분을 먼저 추측한다면, 맥락을 잘못 파악하여 엉터리를 만들어낼 수 있다는 것입니다.
한동안 과학자들은 로봇이 최선의 경로를 찾아낼 수 있기를 바라며 어떤 순서로든 단어를 추측하게 하여 이 "노이즈 제거" 로봇을 작동시키려 노력했습니다. 하지만 이 논문의 저자들은 이상한 점을 발견했습니다. 그들은 새로운 유형의 로봇인 **블록 디퓨전 언어 모델(BDLM)**을 테스트했습니다. 이 로봇들은 텍스트의 덩어리(블록) 단위로 작동하도록 훈련되었으며, 다음 덩어리를 추측하는 데 도움을 받기 위해 이전 덩어리의 깨끗한 텍스트를 사용한다는 점에서 특별합니다.
결정적인 발견: 로봇은 순서를 선호한다
저자들은 이 로봇들이 실제로 어떻게 행동하는지 알아보기 위해 일련의 실험을 수행했습니다. 그들은 표준 "노이즈 제거" 로봇(LLaDA)과 더 새로운 "블록" 로봇(SDAR)을 비교했습니다.
그들은 표준 로봇이 정말로 무작위 순서로 단어를 추측하는 것을 좋아한다는 것을 발견했습니다. 하지만 새로운 블록 로봇은 매우 다르게 행동했습니다. 이 로봇은 어떤 순서로든 단어를 추측할 수 있음에도 불구하고, 자연스럽게 예전의 타자기 로봇처럼 왼쪽에서 오른쪽으로 추측하는 것을 선호했습니다.
이를 증명하기 위해, 그들은 로봇의 "확신도(confidence)"를 살펴보았습니다. 로봇에게 다음 단어를 추측하라고 요청하면, 보통 각 가능성에 대한 "확신도 점수"를 갖게 됩니다. 저자들은 블록 로봇의 경우, 가장 확신이 높은 추측이 거의 항상 남은 문장의 맨 앞부분에 있는 단어들이라는 것을 발견했습니다. 마치 로봇에게 비밀스러운 습관이 있는 것 같습니다: "나는 마음대로 움직일 수 있지만, 정말로 왼쪽에서부터 시작하는 것이 가장 편안해."
그들은 심지어 왜 이런 일이 발생하는지 설명하기 위해 수학적 계산도 수행했습니다. 그들은 훈련 과정 중에 블록 로봇이 문장의 왼쪽 부분이 이미 작성되어 있고 오른쪽 부분만 추측해야 하는 수많은 예시를 본다는 것을 깨달았습니다. 이것은 정확히 예전의 "타자기" 로봇이 학습하는 방식입니다. 반면, 표준 "노이즈 제거" 로봇은 단어들이 곳곳에 빠져 있는 문장들로 훈련받기 때문에, 왼쪽 부분을 먼저 의존하는 법을 배우지 못합니다. 블록 로봇은 이런 방식으로 훈련되었기 때문에, "왼쪽에서 오른쪽으로" 가고 싶어 하는 것입니다.
해결책: PARD (작가 팀)
그렇다면 블록 로봇이 자연스럽게 왼쪽에서 오른쪽으로 가고 싶어 한다면, 왜 그냥 왼쪽에서 오른쪽으로 가게 두지 않을까요? 문제는 만약 엄격하게 왼쪽에서 오른쪽으로만 간다면, 여러 단어를 한꺼번에 추측하여 얻는 속도의 이점을 잃게 된다는 점입니다. 그러면 다시 느려집니다.
저자들은 PARD(Parallel Autoregressive Decoding, 병렬 자기회귀 디코딩)라는 영리한 해결책을 고안했습니다.
여러 명의 작가가 함께 이야기를 써 내려가는 그룹을 상상해 보세요.
- 규칙: 그들은 반드시 왼쪽에서 오른쪽으로 순서대로 써야 합니다.
- 반전: 다음 사람이 시작하기 전에 한 사람이 단어를 끝내기를 기다리는 대신, 그들은 모두 다음 몇 단어를 봅니다. 만약 그들이 다음 단어에 대해 매우 확신한다면, 그 단어를 씁니다. 만약 그 다음 단어에 대해서도 매우 확신한다면, 그 단어도 씁니다.
- 안전망: 만약 두 번째 단어에 대해 확신이 없다면, 그들은 멈춥니다. 그들은 단순히 빠르게 하기 위해 두 번째 단어를 억지로 추측하지 않습니다. 확신이 생길 때까지 기다립니다.
이것이 PARD가 하는 일입니다. PARD는 로봇의 확신도 점수를 확인합니다. 만약 로봇이 첫 번째 마스킹된 단어에 대해 확신한다면, 그것을 씁니다. 그런 다음 로봇이 다음 단어에 대해서도 확신이 있는지 즉시 확인합니다. 만약 그렇다면, 그것도 씁니다. 이 과정을 통해 로봇이 확신하는 단어들의 "접두사(prefix)"를 써 내려가며, 확신이 없는 단어에 도달할 때까지 계속 진행합니다.
결과: 빠르고 정확함
저자들은 이 새로운 방법을 세 가지 다른 블록 로선 모델과 코딩 및 수학 문제 풀기를 포함한 여섯 가지 작업에서 테스트했습니다.
- 속도: PARD는 예전의 "타자기" 방식보다 훨씬 빨랐습니다. 어떤 경우에는 한 모델에서 3.64배 더 빨랐습니다. 이 모델은 느린 방식의 70 토큰/초에 비해 초당 최대 152 토큰의 속도로 텍고를 작성했습니다.
- 품질: 속도가 빨라졌음에도 불구하고, PARD가 쓴 이야기와 코드는 무작위 순서로 단어를 추측하려 했던 다른 빠른 방식들만큼이나 좋았고, 종종 더 뛰어났습니다. 실제로 SDAR 모델에서 PARD는 무작위 순서 방식보다 더 나은 81.1%의 코딩 테스트 점수를 기록했습니다(무작위 방식은 75.0%).
- 비교: PARD를 어떤 단어를 추측할지 결정하기 위해 복잡한 규칙을 사용하는 다른 화려한 "빠른" 방식들과 비교했습니다. 복잡한 방식들이 무작위로 뛰어다니며 퍼즐을 푸는 것 같다면, PARD는 퍼즐의 가장자리 조각부터 맞추며 푸는 것과 같았으며, 이것이 이 특정 로봇들에게는 가장 효율적인 경로임이 밝혀졌습니다.
이것이 왜 중요한가
이 논문은 이러한 새로운 "블록" 로봇들에게는 "어떤 순서로든 추측한다"는 옛날 아이디어가 실제로는 최선의 방법이 아니라는 점을 시사합니다. 이 로봇들은 훈련 방식 때문에 자연스럽게 왼쪽에서 오른쪽으로 생각하는 경향이 있습니다. 그 경향을 존중하면서 확신이 있을 때만 병렬적인 속도를 추가함으로써, 우리는 두 마리 토끼를 잡을 수 있습니다. 즉, 작가 팀의 속도와 신중한 타자의 정확성을 모두 얻는 것입니다.
저자들은 이것이 "훈련이 필요 없는(training-free)" 방법이라는 점을 주의 깊게 언급합니다. 그들은 로봇을 재훈련하거나 뇌 구조를 바꾸지 않았습니다. 단지 로봇에게 글을 쓰는 방식을 바꿨을 뿐입니다. 이는 이 방법이 기존 모델에서 지금 바로 사용할 수 있는 매우 실용적인 도구임을 의미합니다.
요약하자면, 이 논문은 때때로 앞으로 나아가는 가장 빠른 방법은 직선으로 움직이는 것을 기억하되, 자신이 어디로 가는지 확신할 때 더 큰 발걸음을 내딛는 것임을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.