← 최신 논문
💬 NLP

LESS Is More: Mutual-Stability Sampling for Diffusion Language Models

이 논문은 상호 안정성 규칙을 통해 토큰 확정(token commitment)을 동적으로 결정함으로써 디퓨전 거대 언어 모델의 효율성과 정확도를 크게 향상시키고, 고정 예산 디코딩 대비 역과정 단계(reverse steps)를 72.1% 줄이는 학습이 필요 없는 모델 불가지론적 적응형 샘플러인 \textsc{LESS}를 소개한다.

원저자: Amr Mohamed, Guokan Shang, Michalis Vazirgiannis

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amr Mohamed, Guokan Shang, Michalis Vazirgiannis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 개념: "타이핑하는 동안 수정하기" 문제

당신이 이야기를 쓰고 있다고 상상해 보세요. 하지만 왼쪽에서 오른쪽으로 한 단어씩 타이핑하는 대신(표준적인 AI 방식), 모든 단어가 마스크 뒤에 숨겨진 빈 페이지에서 시작합니다. 당신은 한 번에 모든 마스크 안에 무엇이 들어갈지 추측한 다음, 이야기가 말이 될 때까지 그 추측을 반복해서 다듬어야 합니다.

이것이 **확산 언어 모델(Diffusion Language Models, dLLMs)**이 작동하는 방식입니다. 이 모델들은 문장 전체를 한꺼번에 볼 수 있기 때문에(마치 초안을 편집하는 것처럼) 강력합니다(단순히 이전 단어를 바탕으로 다음 단어를 예측하는 것보다 뛰어납니다).

문제점:
현재 이러한 모델의 작동 방식은 마치 시험을 치르는 학생이 수학 문제는 10분 만에 풀고 역사 문제는 5분 만에 끝낼 수 있음에도 불구하고, 반드시 시험 시간 256분을 꽉 채워 써야만 하는 상황과 같습니다.

  • 이미 완벽한 답을 계속 "재검토"하며 시간을 낭비합니다.
  • 시간이 다 되어 멈춰야 한다는 규칙 때문에, 아직 답이 확정되지 않았음에도 너무 일찍 잘못된 답을 확정 지어버리기도 합니다.

이 논문은 LESS(Mutual-Stability Sampling)라는 새로운 방법을 소개합니다. 이는 마치 똑똑한 감독관처럼 행동합니다. 학생이 정해진 시간이 다 될 때까지 기다리는 대신, 특정 질문에 대해 정답이라고 확신하는 그 즉시 작업을 멈출 수 있게 해줍니다.


LESS의 작동 원리: "3단계 체크" 규칙

논문은 모델의 "확신도(confidence)"(모델이 스스로 얼마나 확신하는지)만을 믿어서는 안 된다고 주장합니다. 때때로 모델은 매우 확신하지만 틀릴 수도 있고, 매 순간 생각을 바꿀 수도 있기 때문입니다.

특정 단어(또는 토큰)를 언제 더 이상 다듬지 않고 멈출지 결정하기 위해, LESS는 **결합 안정성 규칙(Joint Stability Rule)**을 사용합니다. 이것은 답을 "확정(lock in)"하기 전의 3단계 보안 점검과 같습니다.

  1. 확신도 체크 (The Confidence Check): "확실합니까?"
    • 모델은 자신의 최우선 추측이 정답이라는 것에 대해 높은 확신을 가져야 합니다.
  2. 지속성 체크 (The Persistence Check): "최근에 마음을 바꿨습니까?"
    • 모델은 지난 몇 번의 검토 단계 동안 동일한 최우선 단어를 선택했어야 합니다. 만약 "고양이"와 "강아지" 사이를 계속 왔다 갔다 한다면, 아직 안정적인 상태가 아닙니다.
  3. 변동성 체크 (The Motion Check): "전체적인 그림이 진정되고 있습니까?"
    • 이것이 이 논문의 핵심 혁신입니다. 논문은 **젠슨-샤논 발산(Jensen-Shannon Divergence, JSD)**이라는 수학 도구를 사용합니다.
    • 비유: 당신이 흐릿한 사진을 보고 있다고 상상해 보세요. 설령 당신이 90%의 확률로 그것이 개라고 확신하더라도, 배경의 사진이 여전히 흔들리고 흐릿하다면 그 답을 확정해서는 안 됩니다. JSD는 정답 주변의 "흐릿함"이 멈췄는지 측정합니다. 가능한 단어들의 분포가 여전히 변하고 있다면, 그 답은 안정적인 것이 아닙니다.

결과: 세 가지 조건이 모두 충족될 때만 단어가 "언마스킹(unmasked)"(드러나고 확정됨)됩니다.


이것이 왜 중요한가

연구진은 Dream-7B, LLaDA-8B, LLaDA-1.5-8B 등 세 가지 서로 다른 AI 모델을 대상으로 수학, 코딩, 일반 상식을 포함한 7가지 작업에서 LESS를 테스트했습니다.

연구 결과:

  • 적은 노력, 동일하거나 더 나은 품질: LESS는 표준 방식보다 72% 적은 단계를 사용하여 작업을 마칠 수 있었습니다.
  • 빠른 속도: AI가 "재검토"를 덜 하기 때문에 작업을 훨씬 빠르게 완료합니다. 테스트에서 수학 문제를 푸는 데 걸리는 시간을 약 19초에서 단 5초로 단축했습니다.
  • 더 똑똑한 결정: 단순히 확신이 있다고 해서 답을 확정해 버리는 다른 방법들과 달리, LESS는 답이 정말로 안정적이 될 때까지 기다립니다. 이는 어려운 수학 및 코딩 작업에서 다른 "무료(재학습이 필요 없는)" 방법들보다 오히려 정확도를 향상시켰습니다.

"LESS is More" 비유

표준적인 AI 디코딩 과정을 조각가가 돌 블록을 깎아 나가는 과정이라고 생각해 보세요.

  • 기존 방식: 조각가는 상황에 상관없이 정확히 100번을 깎으라는 명령을 받습니다. 그들은 이미 매끄러운 부분에 20번을 더 깎거나(노력 낭비), 혹은 50번만 깎았는데 제한에 걸려 거친 부분을 그대로 두는(지저분한 결과) 상황을 겪을 수 있습니다.
  • LESS 방식: 조각가는 조각의 각 부분을 관찰합니다. 특정 부분이 매끄럽고, 안정적이며, 정이 더 이상 흔들리지 않는다고 판단되면, 그 특정 부분에 대한 작업을 멈추고 다음으로 넘어갑니다. 그들은 전체 조각을 완성하는 데 총 횟수는 줄이면서도, 결과물은 종종 더 깔끔하게 만들어냅니다.

요약된 주장

논문은 단어를 "확정"하는 결정을 온라인 중단 문제(online stopping problem)(실시간 안정성에 기반하여 중단 시점을 결정하는 것)로 취급함으로써, LESS가 다음과 같은 성과를 낼 수 있다고 주장합니다:

  1. 계산 단계를 70% 이상 줄임.
  2. 텍스트 생성 시간을 단축함.
  3. 수학 및 코딩과 같은 복잡한 작업에서 정확도를 유지하거나 향상시킴.
  4. 이 모든 것을 AI 모델을 재학습할 필요 없이 수행함 (디코딩 방식에 대한 "플러그 앤 플레이" 업데이트).

저자들은 단순히 확신(confidence)보다 **안정성(stability)**이 더 중요하다는 결론을 내렸습니다. 단어가 확정되기 전에 그것이 진정으로 "안착"할 때까지 기다림으로써, 더 적은 컴퓨팅 자원으로 더 나은 결과를 얻을 수 있다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →