← 최신 논문
🤖 machine learning

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

본 논문은 사전 학습된 자기회귀 모델을 균일 노이즈 확산(uniform-noise diffusion)으로 직접 적응시키기 위해 다양한 이산 확산 목적 함수들 사이의 연결을 구축하는 통합 프레임워크인 UNIFUSION을 제안하며, 이를 통해 생성 품질과 다운스트림 태스크 정확도 모두에서 최첨단 성능을 달성한다.

원저자: Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 오랫동안 로봇에게 이를 가르치는 가장 좋은 방법은 인간이 문장을 타이핑하는 것처럼 왼쪽에서 오른쪽으로 한 번에 한 단어씩 쓰도록 가르치는 것이었습니다. 이 방법은 "자기회귀(autoregressive)" 학습이라고 불리며, 속도가 빠르고 로봇이 많은 언어 규칙을 배울 수 있다는 점에서 매우 훌륭합니다. 하지만 이 방식에는 큰 결함이 있습니다. 로봇이 한 단어를 쓰고 나면, 그 단어를 다시 되돌아가서 수정할 수 없다는 점입니다. 만약 로봇이 첫 번째 문장에서 실수를 한다면, 과거를 수정할 수 없기 때문에 이야기 전체를 망칠 수도 있습니다.

최근 과학자들은 "이산 확산(discrete diffusion)"이라는 다른 접근 방식을 시도했습니다. 이 방식은 단어별로 쓰는 대신, 섞이거나 노이즈가 섞인 완전한 문장에서 시작하여, 로봇이 문장이 완벽해질 때까지 한 번에 한 단어씩 고쳐나가는 법을 배우는 것입니다. 이것은 마치 지저ታ난 방을 천천히 정리하는 것과 같습니다. 문제는 이러한 새로운 "정리하는" 로봇들 대부분이 처음부터 새로 학습되어, 기존의 "단어별" 로봇들이 이미 가지고 있던 모든 언어 지식을 낭비한다는 점입니다. 게다가, 많은 새로운 로봇들은 단어를 "마스크"(검은 상자처럼) 뒤에 숨기는 특정 유형의 노이즈를 사용합니다. 이는 로봇이 숨겨진 부분만 고칠 수 있고, 이미 보이는 단어들은 고칠 수 없음을 의미합니다. 큰 질문은 이것이었습니다. "우리가 똑똑한 사전 학습된 '단어별' 로봇을 가져와서, 숨겨진 단어뿐만 아니라 이미 보이는 단어들까지 포함하여 어떤 단어도 고칠 수 있는 강력한 '정리하는' 로봇으로 즉시 바꿀 수 있을까?"

"Unifusion"이라는 제목의 이 논문은 그렇다고 답하며, 그 방법을 보여줍니다. 연구진은 다양한 "정리하는" 로봇들이 사용하는 수학 공식이 서로 다름에도 불구하고, 이들이 모두 근본적으로 동일한 문제, 즉 단어가 한 상태에서 다른 상태로 얼마나 빨리 변해야 하는지(역율, reverse rate)를 예측하려 한다는 것을 발견했습니다. 그들은 이 서로 다른 방법들이 모두 같은 언어의 다른 방언을 말하고 있을 뿐이라는 점을 깨달음으로써, 보편적인 번역기를 만들어냈습니다. 이 번역기는 표준 "단어별" 모델(예: GPT-2)의 지식을 가져와 이를 "균등 노이즈(uniform-noise)" 확산 모델로 직접 적응시킬 수 있게 해줍니다.

이 새로운 모델인 Unifusion의 핵심 혁신은 단어를 마스크 뒤에 숨길 필요가 없다는 것입니다. 대신, 구글 문서에서 단어를 편집하는 것처럼 문장의 모든 단어를 편집 가능한 상태로 취급합니다. 연구진은 1억 2,400만 개의 파라미터를 가진 버전과 3억 5,500만 개의 파라미터를 가진 두 가지 버전의 사전 학습된 모델을 사용하여 이들을 "정리하는" 예술가로 훈련시키는 실험을 진행했습니다. 그들은 모델에게 생각할 시간(단계 수를 16에서 256으로 증가)을 더 많이 줄수록 텍스트의 품질이 꾸준히 향상된다는 것을 발견했습니다.

256단계의 최대치에서, 작은 모델(Unifusion-S)은 97.783의 "생성 퍼플렉서티(generative perplexity, 모델이 생성한 텍스트에 대해 느끼는 혼란도를 측정하는 지표)"를 달성했으며, 더 큰 모델(Unifusion-M)은 71.516에 도달했습니다. 더 중요한 것은, 이 모델들이 단순히 유창한 텍스트를 작성할 뿐만 아니라, 높은 "유니그램 엔트로피(unigram entropy)"를 유지했다는 점입니다. 이는 텍스트가 다양하며, 동일한 구절이나 패턴을 반복하는 데 갇히지 않았음을 뜻하는 전문적인 표현입니다. 실제로 256단계에서, Unifusion과 같은 크기의 다른 어떤 모델도 유창성과 다양성을 동시에 능가하지 못했습니다.

또한 이 논문은 이 직접적인 변환 방식이 "단어별"에서 "마스크 확산"으로, 그리고 다시 "균등 확산"으로 가려는 기존의 방식보다 더 효과적이라는 것을 보여주었습니다. 중간 단계를 건너뜀으로써, Unifusion은 훨씬 더 효율적으로 동일한 높은 품질에 도달했습니다. 실제 세상의 논리 퍼즐과 상식 질문(WinoGrande 및 SIQA 등)에 대한 테스트에서도, 이 새로운 확산 모델들은 자신과 같은 크기의 다른 모든 확산 모델보다 뛰어난 성능을 보였으며, 이는 이 모델들이 단순히 노이즈를 치우는 법을 배운 것이 아니라 원래의 "단어별" 훈련에서 얻은 똑똑한 추론 능력까지 유지했음을 증명합니다.

요약하자면, Unifusion은 식재료를 하나씩 넣으며 요리하는 데 익endo 있는 숙련된 셰프에게, 자신의 수년간의 요리 경험을 버리지 않고도 전체 국물 맛을 보고 한꺼번에 조절하는 새로운 기술을 가르치는 것과 같습니다. 그 결과, 문장 전체를 한 번에 편집하는 법을 배움으로써 유창하면서도 창의적으로 다양한 텍스트를 생성할 수 있는 모델을 탄생시켰습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →