← 최신 논문
💬 NLP

Drifting Objectives for Refining Discrete Diffusion Language Models

본 논문은 비대칭적 정제를 위해 범주형 예측을 소프트 토큰 특징으로 승격시켜 이산 확산 언어 모델에 연속적인 드리프트 원리를 적용하는 새로운 학습 목표인 TokenDrift 를 소개하며, 이는 낮은 샘플링 단계에서 생성 품질을 크게 향상시킵니다.

원저자: Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기를 쓰는 로봇을 상상해 보세요. 이 로봇은 **이산 확산 언어 모델 (Discrete Diffusion Language Model, DDLM)**이라고 불리며, 인간처럼 한 단어씩 작성하지 않습니다. 대신, 온통 말도 안 되는 글 (또는 "노이즈") 로 가득 찬 페이지로 시작해, 단계별로 천천히 정리해 나갑니다. 그렇게 해서 마침내 의미가 통하게 됩니다.

보통 아주 훌륭한 이야기를 얻기 위해서는 이 로봇이 텍스트를 정리하는 데 많은 작은 단계가 필요합니다. 만약 시간이나 비용을 아끼기 위해 일찍 멈추게 하면, 이야기는 종종 무너져 버려서 nonsensical 하거나 반복적이게 됩니다.

이 논문의 저자들은 다음과 같은 간단한 질문을 던졌습니다: 텍스트를 정리하는 방식을 바꾸거나 더 많은 시간을 주지 않고도, 이 로봇이 더 빠르고 더 좋은 이야기를 쓰도록 가르칠 수 있을까요?

그들의 답은 TokenDrift라는 새로운 학습 방법입니다. 이것이 어떻게 작동하는지 일상적인 비유를 통해 설명해 보겠습니다:

1. 문제: "단단한" 벽 대 "부드러운" 벽

텍스트 세계에서는 단어들이 "고양이"나 "개"와 같은 뚜렷한 블록들입니다. "고양이"의 절반과 "개"의 절반을 가질 수는 없습니다.

  • 문제점: 그들이 사용하려던 새로운 학습 방법 ( "Drifting"이라고 함) 은 목표 쪽으로 부드럽게 미끄러질 수 있는 매끄럽고 연속적인 세계에서 가장 잘 작동합니다. 하지만 텍스트가 단단한 블록으로 이루어져 있기 때문에 로봇은 부드럽게 "미끄러질" 수 없습니다. 로봇이 특정 단어 ( "단단한" 선택) 를 고르면 수학이 무너지고, 로봇은 자신의 실수에서 배울 수 없게 됩니다.

2. 해결책: "흐릿한 렌즈" (Soft-Token Lift)

이를 해결하기 위해 저자들은 Soft-Token Lift라는 트릭을 고안했습니다.

  • 비유: 로봇이 하나의 특정 단어를 선택하는 대신, 사전 위에 흐릿하고 반투명한 렌즈를 들어 올린다고 상상해 보세요. 이 렌즈를 통해 로봇은 "고양이"를 50% 선명하게, "개"를 30% 선명하게, "쥐"를 20% 선명하게 봅니다.
  • 도움되는 이유: 이 "흐릿한" 시선은 매끄럽고 수학적으로 친화적입니다. 로봇이 아직 하나의 단단한 선택에 완전히 몰입하지 않고도 올바른 단어들의 "끌림"을 느낄 수 있게 해줍니다. 이는 학습 수학이 시스템을 통과할 수 있게 하는 다리를 만들어 줍니다.

3. 학습: "자석과 반발체" (Drifting)

로봇이 이 흐릿한 렌즈를 통해 바라보기 시작하면, 저자들은 "Drifting" 기법을 적용합니다.

  • 비유: 로봇이 들판에 서 있다고 상상해 보세요.
    • 끌림: 인터넷의 데이터인 좋은 실제 이야기 쪽으로 로봇을 끌어당기는 자석들이 있습니다.
    • 반발: 로봇 자신의 실수인 나쁜 로봇 생성 이야기 쪽으로 로봇을 밀어내는 자석들이 있습니다.
  • 목표: 로봇은 좋은 이야기 쪽으로 끌어당기고 나쁜 이야기 쪽으로 밀어내는 방향으로 움직이는 법을 배웁니다. 이는 로봇을 더 나은 결과로 이끄는 "드리프트"를 만들어냅니다.

4. 결과: 더 좋은 이야기, 같은 시간

저자들은 이 방법을 두 가지 다른 유형의 텍스트 생성 로봇에서 테스트했습니다.

  • 설정: 그들은 이미 학습된 기존 로봇들을 가져왔습니다. 로봇의 두뇌나 작성 방식을 변경하지 않고, 새로운 "Drifting" 방법을 사용하여 *학습 계획 (학습 목적)*만 변경했습니다.
  • 결과: 제한된 수의 단계 (엄격한 예산) 로 쓰도록 강요받았을 때, TokenDrift로 학습된 로봇들은 훨씬 더 나은 텍스트를 생성했습니다.
    • 한 유형의 로봇에서는 로봇이 평소처럼 연습하도록 내버려 둔 경우와 비교해 텍스트의 질이 89% 향상되었습니다.
    • 로봇이 이전과 동일한 수의 단계를 취했음에도 불구하고, 텍스트는 더 일관성 있고, 덜 반복적이며, 더 의미가 통했습니다.

요약

TokenDrift를 학생을 코칭하는 새로운 방식으로 생각하세요. 단순히 "더 열심히 하라"고 말하는 것 (이는 일반적인 학습이 하는 일) 대신, 이 방법은 그들에게 자석 지도를 제공합니다. 이 지도는 좋은 예시 쪽으로 부드럽게 끌어당기고 나쁜 예시 쪽으로 밀어내지만, 이를 학생이 알파벳의 경직된 규칙에 갇히지 않고 방향을 이해할 수 있게 해주는 "흐릿한 렌즈"를 통해 수행합니다.

이 논문은 새로운 로봇을 전혀 만들거나 생각할 시간을 더 주지 않고도, 학습 방식을 변경함으로써 이러한 텍스트 생성 로봇들을 훨씬 더 효율적이고 고품질로 만들 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →