← 최신 논문
💬 NLP

Token Time Continuous Diffusion for Language Modeling

이 논문은 토큰별 시간 스케줄링을 활용하여 노이즈를 토큰으로 결정론적으로 매핑함으로써 기존의 이산 모델 대비 조건부 생성과 고속 추론에서 우수한 성능을 달성하는 연속 공간 확산 언어 모델인 Token Time Continuous Diffusion(TTCD)을 소개한다.

원저자: Parikshit Bansal, Sujay Sanghavi

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Parikshit Bansal, Sujay Sanghavi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 오랫동안 이 작업을 수행하는 가장 좋은 방법은 로봇이 한 번에 한 단어씩 추측하게 만드는 것이었습니다. 마치 현재의 칸에 들어갈 정답만 볼 수 있는 낱말 맞추기 퍼즐을 푸는 것과 같았죠. 이 방식은 잘 작동하지만, 로봇이 단어 하나를 쓸 때마다 멈춰서 생각해야 하기 때문에 속도가 느립니다. 최근 과학자들은 "디퓨전(diffusion)"이라는 다른 접근 방식을 시도했습니다. 문장 전체를 한꺼번에 추측하는 대신, 정지 화면 같은 노이즈로 가득 찬 페이지에서 시작하여 이를 천천히 깨끗하게 닦아내어 단어가 나타나게 하는 방식입니다. 이는 진흙탕물이 서서히 맑은 연못으로 변하는 과정을 지켜보는 것과 같습니다.

하지만 문제가 하나 있습니다. 페이지 전체를 매우 빠르게(단 몇 단계 만에) 정화하려고 하면 로봇이 혼란에 빠집니다. 로봇은 여러 단어를 동시에 결정하려고 하지만, 이들을 한꺼번에 바라보기 때문에 실수를 저지릅니다. 이는 마치 조각 조각을 한 움큼 집어 들고 나서 각 조각이 어디에 들어갈지 한꺼번에 추측하며 퍼즐을 맞추려는 것과 같습니다. 한 곳에 맞는 조각을 먼저 찾은 다음 다음 단계로 넘어가는 것이 아니라 말이죠. 이 논문은 이 난장판을 해결할 수 있는 새로운 방법을 소개하며, 각 단어에 자신만의 개인적인 스케줄을 부여함으로써 로봇이 더 빠르고 더 정확하게 글을 쓸 수 있도록 해줍니다.


논문: 토큰 타임 연속 디퓨전 (Token Time Continuous Diffusion, TTCD)

이 논문의 저자인 파릭시트 반살(Parikshit Bansal)과 수제이 상하비(Sujay Sanghavi)는 **토큰 타임 연속 디퓨전(TTCD)**이라는 새로운 방법을 제안합니다. 이들의 아이디어는 모든 문장의 단어에 각자의 개인용 스톱워치를 주는 것과 같습니다.

이전의 "디퓨전" 모델에서는 문장 전체를 하나의 그룹처럼 취급했습니다. 모두가 동시에 노이즈 상태에서 시작하여 정확히 같은 순간에 명확한 단어가 되어야 했습니다. 저자들은 이것이 문제였다는 점을 깨달았습니다. 현실 세계에서는 어떤 단어(예: "the" 또는 "I")는 맞히기 쉽지만, 어떤 단어(예: 특정 이름이나 복잡한 동사)는 어렵습니다. 쉬운 단어들이 어려운 단어들을 기다리게 만드는 것은 속도를 늦출 뿐만 아니라, 속도를 높이려 할 때 오류를 발생시킵니다.

TTCD는 규칙을 바꿉니다. 문장 전체를 위한 하나의 전역 시계 대신, 각 단어는 자신만의 "토큰 타임(token time)"을 갖습니다.

  • 쉬운 단어들: 모델이 단어에 대해 확신이 높다면(불확실성이 낮다면), 이 단어는 빠른 경로를 갖습니다. 노이즈에서 명확한 단어로 빠르게 이동합니다.
  • 어려운 단어들: 모델이 혼란스러워한다면, 그 단어는 천천히 움직이며 스스로를 파악하는 데 시간을 들입니다.

교사가 질문을 던지는 교실을 상상해 보세요. 기존 시스템에서는 학급 전체가 정확히 같은 초에 손을 들어야 합니다. 한 학생이 느리면 모두가 기다려야 하죠. TTCD 시스템에서는 답을 아는 학생들이 즉시 손을 들고, 생각 중인 학생들은 몇 초 더 걸리더라도 나중에 손을 듭니다. AI인 교사는 누가 무엇을 알고 있는지 확인하고, 그 정보를 사용하여 다른 학생들이 답을 더 빨리 찾을 수 있도록 돕습니다.

테스트 방법

이 "개인별 스케줄" 아이디어가 효과가 있는지 확인하기 위해, 연구진은 두 가지 매우 다른 방식으로 테스트를 진행했습니다.

  1. 스도쿠 테스트: 모델에게 9x9 스도쿠 퍼즐을 풀게 했습니다. 이는 엄격한 논리가 필요하기 때문에 아주 좋은 테스트입니다. 숫자 하나만 틀려도 퍼즐 전체가 실패하기 때문입니다.

    • 결과: 모델이 단 2단계만으로 퍼즐을 풀려고 했을 때, 기존 방식들은 12% 미만의 성공률을 보이며 처참하게 실패했습니다. 그러나 새로운 TTCD 방식은 스도쿠의 **31.51%**를 정확하게 풀어냈습니다. 이 방식만이 속도를 유지하면서도 무너지지 않고 문제를 해결할 수 있었습니다.
  2. 이야기 테스트: 모델이 이야기를 얼마나 잘 쓸 수 있는지 확인하기 위해 인터넷 텍ек스트(OpenWebText)의 방대한 양으로 모델을 학습시켰습니다. 연구진은 이 방식을 더 똑똑한 스승으로부터 배우는 "증류(distilled, 더 빠르게 만들기 위해 학습된 방식)"된 모델을 포함한 다른 최고 수준의 모델들과 비교했습니다.

    • 결과:1~4단계 내에 텍스트를 생성해야 하는 테스트에서, TTCD는 다른 모델들보다 더 높은 품질의 글을 만들어냈습니다. 텍스트가 반복되거나 엉뚱한 소리를 하지 않으면서도 다양하고 흥미로운 내용을 유지할 수 있었습니다. 논문은 모델의 일반적인 품질은 타 모델과 대등하지만, "조건부 생성(conditional generation)"—즉, 시작 문장(프롬프트)을 주었을 때 이야기를 이어가는 능력—에 있어서는 경쟁 모델들보다 훨씬 뛰어나다고 언급합니다.

발견한 점 (그리고 발견하지 못한 점)

저자들은 자신들의 "토큰별 시간(per-token time)" 아이디어가 특정 문제, 즉 "팩터라이제이션 문제(factorization problem)"를 해결한다고 확신합니다. 이는 충분한 생각 없이 여러 단어를 동시에 추측하려고 할 때 모델이 저지르는 실자를 뜻하는 전문 용어입니다. 단어들이 각기 다른 속도로 "정화" 과정을 마칠 수 있게 함으로써, TTCD는 이 함정을 피합니다.

하지만 이 논문은 이 방식이 모든 것을 해결하는 마법의 탄환이라고 주장하지는 않습니다.

  • 규모(Scale): 테스트에 사용된 모델은 1억 6천만 개의 파라미터를 가진 상대적으로 작은 규모였습니다. 저자들은 이 기술이 현재의 거대 AI 모델들과 진정으로 경쟁하려면 10억 개의 파라미터 규모로 키워야 한다는 점을 인정했습니다.
  • 속도 대 품질: TTCD는 높은 속도(적은 단계)에서 훌륭하지만, 이 논문이 모든 속도에서 절대적으로 최고라고 주장하는 것은 아닙니다. 더 느린 다단계 시나리오에서는 다른 모델들도 성능이 근접했습니다.
  • "지름길(Shortcut)": 모델을 더 빠르게 만들기 위해, 그들은 "자기 증류(self-distillation, 혹은 '지름길 모델')"라는 기술을 사용했습니다. 이를 통해 고품질을 유지하면서도 단 몇 단계 만에 텍스트를 생성할 수 있는 버전의 TTCD를 만들 수 있었습니다.

결론

이 논문은 우리가 AI에게 글쓰기를 가르치는 방식이 반드시 경직된, 일률적인 과정일 필요는 없다는 점을 시사합니다. 각 단어에 자신만의 속도를 부여함으로써—확신이 있는 단어는 질주하게 하고, 확신이 없는 단어는 조깅하게 함으로써—AI는 더 빠르고 더 정확하게 글을 쓸 수 있습니다. 이는 혼란스럽고 노이즈 가득한 난장판을 잘 조직된 경주로 바꾸는 영리한 수정이며, 때로는 모두가 각자의 속도로 움직이게 하는 것이 앞으로 나아가는 최선의 방법임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →