← 최신 논문
💬 NLP

Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

본 논문은 이산 상태 공간의 구축을 중심으로 하는 이산 확산 모델을 위한 통합된 개념적 프레임워크를 제안함으로써, 기존의 공식들을 통일하고, 설계상의 트레이드오프를 명확히 하며, 향후 연구 방향을 안내한다.

원저자: Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yanka
게시일 2026-08-26
📖 5 분 읽기🧠 심층 분석

원저자: Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yankai Chen, Fengran Mo, Jikun Kang, Bowei He, Dawn Song, Philip S. Yu, Xue Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 단어를 쓴 뒤 결코 뒤돌아보거나 이미 쓴 내용을 수정하지 못한 채, 오직 다음 단어를 하나씩 배치하며 이야기를 써 내려가는 모습을 상상해 보십시오. 이것이 현재 대부분의 현대적 텍p 생성 컴퓨터 프로그램이 작동하는 방식입니다. 이들은 문장을 왼쪽에서 오른쪽으로 구축하며, 단어가 나타나는 즉시 그 단어에 확정적으로 전념합니다. 이 방식은 빠르고 신뢰할 수 있지만, 근본적인 결함이 있습니다. 만약 글쓴이가 초반에 실수를 하거나, 이야기의 시작 부분을 바꿔야 할 만큼 극적인 반전이 필요해진다면, 시스템은 처음부터 다시 시작하지 않고서는 이를 고칠 수 없습니다. 이는 돌아올 수 없는 일방통행로와 같습니다.

오랫동안 과학자들은 전역적인 계획(global planning)을 세우고, 전체적인 그림이 명확해짐에 따라 결정을 수정할 수 있는 능력을 갖춘, 데이터를 생성하는 다른 방법을 찾아왔습니다. 이미지와 소리의 세계에서 '디퓨전(diffusion)'이라 불리는 기술은 이미 이 문제를 해결했습니다. 이 기술은 완전히 뒤섞인 혼란스러운 상태에서 시작하여, 단계적으로 점진적으로 정돈함으로써 선명한 이미지나 소리가 나타나게 하는 방식으로 작동합니다. 이 과정은 매 단계마다 전체 그림을 살펴보기 때문에, 오류를 수정하고 구도를 조정할 수 있습니다. 그러나 텍사, 코드, 그리고 색상의 부드러운 음영이 아닌 글자나 단어와 같은 불연속적인 기호들로 이루어진 이산적(discrete) 데이터에 이 "정돈하는" 방식을 적용하는 것은 매우 어려운 일로 드러났습니다. 이미지를 위해 작동하는 규칙들이 단어에는 직접적으로 적용되지 않으며, 이를 강제로 적용하려 했던 이전의 시도들은 종종 횡설수설하거나 낮은 품질을 초래했습니다.

맥길 대학교, 모하메드 빈 자이드 인공지능 대학교 등을 포함한 여러 기관의 연구진으로 구성된 대규모 팀의 새로운 종합 연구는 이러한 이산적 디퓨전 모델을 이해하고 개선하는 통일된 방법을 제시합니다. 연구진은 이러한 모델을 잘 작동하게 만드는 핵심이 단순히 정돈 알고리즘 자체에 있는 것이 아니라, 원시 데이터가 어떻게 그 기초적인 구성 요소인 '토큰(tokens)'으로 먼저 분해되는지에 달려 있다고 주장합니다. 그들은 문장, 단백질 사슬, 또는 분자 구조를 어떻게 조각낼 것인가를 결정하는 것이 가장 중요한 설계 선택이며, 그 다음에 일어나는 모든 일을 결정한다고 제안합니다. 이 초기 분해 과정을 단순한 설정 단계가 아닌 핵심적인 설계 요소로 다룸으로써, 연구팀은 코드를 작성하는 것부터 새로운 약물을 설계하는 것에 이르기까지 다양한 분야에서 이 모델들이 어떻게 작동하는지 설명하는 단일 프레임워크를 만들어냈습니다.

이 새로운 프레임워크의 핵심은 단순하지만 강력한 아이디어입니다. 즉, 데이터가 토큰화되는 방식이 데이터를 손상시키는 "노이즈"의 성격과 컴퓨터가 이를 복구하기 위해 해결해야 할 과제의 난이도를 결정한다는 것입니다. 익숙한 텍스트의 세계에서 단어들은 흔히 출현 빈도에 따라 더 작은 조각들로 나뉩니다. 하지만 이산적 디퓨전을 위해 연구진은 이 조각들의 크기와 구조가 매우 중요하다는 것을 발견했습니다. 만약 조각들이 너무 작으면, 컴퓨터는 너무 많은 미세한 부분들로 이루어진 거대한 퍼즐을 풀어야 합니다. 만약 조각들이 너무 크면, 모델은 적절한 조합을 예측하는 데 어려움을 겪습니다. 연구는 서로 다른 유형의 데이터가 서로 다른 접근 방식을 필요로 한다는 점을 명시합니다. 예를 들어, 언어의 경우 가장 좋은 접근법은 종종 단어를 가리고(masking) 모델에게 빈칸을 채우도록 요청하는 것이며, 이는 현대적인 컴퓨터 아키텍처의 강점을 활용하는 방법입니다. 반면, 단백질이나 DNA와 같은 과학적 데이터의 경우, 분자의 자연스러운 구조 자체가 가이드 역할을 제공합니다. 연구진은 아미노산이나 화학 결합 사이의 알려진 관계를 사용하여 "정돈" 과정을 안내하는 것이, 모든 오류를 동일하게 취급하는 것보다 훨씬 더 나은 결과를 가져온다는 것을 보여줍니다.

이 논문은 이전에 서로 단절되어 보였던 방대한 양의 기존 방법들을 하나로 모읍니다. 모델이 토큰의 변화를 설명하기 위해 전이 행렬(transition matrix)을 사용하는지, 데이터의 일부를 숨기기 위해 마스킹 전략을 사용하는지, 혹은 확률을 측정하기 위해 스코어 기반 접근법을 사용하는지 여부에 관계없이, 이 모든 것이 동일한 근본 구조의 변형임을 보여줍니다. 연구진은 모든 이산적 디퓨전 모델을 네 가지 필수적인 부분, 즉 데이터를 손상시키는 방법, 이를 복구하는 법을 배우는 신경망, 네트워크 학습에 사용되는 수학적 목표, 그리고 최종 출력을 생성하는 알고리즘으로 분해합니다. 이 공통된 렌즈를 통해 팀은 성공적인 모델과 실패한 모델 사이의 많은 차이점이 이 네 가지 부분이 특정 유형의 데이터와 어떻게 매칭되는지에 달려 있음을 밝혀냈습니다.

가장 중요한 발견 중 하나는 이러한 모델들이 전체적인 그림을 보는 작업에 탁월하다는 점입니다. 마음을 바꿀 수 없는 왼쪽에서 오른쪽으로 쓰는 방식과 달리, 이 모델들은 반복적으로 출력을 정제할 수 있습니다. 이들은 거친 초안에서 시작하여, 약점을 식별하고, 이후의 과정에서 이를 개선할 수 있습니다. 이는 문서의 누락된 섹션을 채우거나, 주변 맥락을 유지하면서 텍스트를 편집하거나, 모든 부분이 완벽하게 맞물려야 하는 화학 분자와 같은 복잡한 구조를 생성하는 작업에 특히 강력합니다. 연구는 이러한 특정 작업들에 있어, 재검토하고 전역적으로 계획할 수 있는 능력이 현재의 표준 모델들이 쉽게 복제할 수 없는 독보적인 장점임을 강조합니다.

그러나 연구진은 이것이 기존의 왼쪽에서 오른쪽으로 가는 방식이 쓸모없어졌음을 의미하는 것은 아니라고 주의를 기울입니다. 새로운 모델은 전체 시퀀스를 여러 번 처리해야 하기 때문에, 한 번에 한 단어씩 빠르게 생성할 수 있는 기존 방식보다 종종 더 느립니다. 연구는 미래가 아마도 기존 방식의 속도와 새로운 방식의 계획 및 수정 능력이 결합된 하이브리드 시스템에 있을 것이라고 제안합니다. 예를 들어, 어떤 시스템은 빠른 모델을 사용하여 계획을 초안하고, 디퓨전 모델을 사용하여 세부 사항을 정제하고 모든 것이 일관되게 유지되도록 할 수 있습니다.

또한 이 논문은 이러한 모델을 대규모로 작동시키기 위한 실질적인 과제들을 다룹니다. 모델을 효율적으로 학습시키는 방법, 품질 저하 없이 생성 과정을 가속화하는 방법, 그리고 결과가 실제로 좋은지 평가하는 방법을 논의합니다. 연구진은 기존 모델을 위해 설계된 표준적인 성공 측정 방식들이 이러한 새로운 시스템의 고유한 강점과 약점을 포착하는 데 종종 실패한다고 지적합니다. 그들은 반복적인 과정의 특성을 고려하여, 모델이 정제 단계마다 얼마나 개선되는지를 추적하는 것과 같이 성능을 측정하는 새로운 방법들을 제안합니다.

궁극적으로 이 연구는 차세대 인공지능을 위한 로드맵을 제공합니다. 데이터가 어떻게 표현되는지가 그것을 생성하는 알고리즘만큼 중요하다는 점을 명확히 함으로써, 연구진은 개선을 위한 새로운 길을 열었습니다. 그들은 언어의 문법, 코드의 구문, 또는 분자의 화학적 구조와 같이 특정 도메인의 요구 사항에 맞춰 토큰화 과정을 정교하게 설계함으로써, 이러한 모델들을 훨씬 더 효과적으로 만들 수 있음을 보여주었습니다. 이 연구는 모든 문제를 해결했다고 주장하는 것이 아닙니다. 모델이 어떻게 확장(scale)될 수 있는지, 그리고 기존 방식처럼 맥락으로부터 어떻게 학습할 수 있는지에 대해 여전히 열린 질문들이 남아 있음을 인정합니다. 그러나 통합된 프레임워크를 제공함으로써, 연구진은 이 분야를 고립된 실험들의 집합에서 생성형 인공지능을 향한 일관되고 강력한 새로운 접근법으로 진화시키는 명확한 언어와 공유된 구조를 제시하였습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →