← 최신 논문
💬 NLP

Lost in Interpolation: Why Predictive Feedback Fails in Diffusion Language Models

이 논문은 기존의 마스크된 확산 언어 모델(Masked Diffusion Language Models)에서 사용되는 유클리드 선형 보간법이 이들의 초구형 임베딩 공간과 기하학적으로 불일치함을 식기별하고, 수렴성을 저하시키지 않으면서도 생성 품질과 퍼플렉시티를 크게 향상시키는 구면 선형 보간법을 사용하는 구면 소프트 마스킹(Spherical Soft-Masking, S-SM)을 제안한다.

원저자: Lavanya Nigam, Ishaan Bansal, Aryan Sood, Vidit Aggarwal, Gaurav Kumar Nayak

게시일 2026-08-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lavanya Nigam, Ishaan Bansal, Aryan Sood, Vidit Aggarwal, Gaurav Kumar Nayak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 하지만 인간처럼 단어 하나하나를 써 내려가게 하는 대신, 모든 단어가 "MASK(마스크)" 뒤에 숨겨진 빈 페이지를 줍니다. 로봇의 임무는 페이지 전체를 훑어보고, 빈칸에 들어갈 단어를 추측한 다음, 하나씩 천천히 드러내는 것입니다. 이것이 "디퓨전 언어 모델(Diffusion Language Model)"이라 불리는 AI가 작동하는 방식입니다. 이것은 혼란스러운 상태에서 시작하여 점진적으로 그림을 선명하게 만들어가는, 역방향으로 진행되는 "단어 맞히기" 게임과 같습니다.

이 게임을 더 빠르고 똑똑하게 만들기 위해, 연구자들은 "소프트 마스킹(soft-masking)"이라는 기술을 사용합니다. 로봇이 단순히 "이 단어는 '고양이'라고 확신해" 또는 "아니야, 계속 마스크 상태로 둬"라고 말하는 대신, "이 단어가 '고양이'일 확률은 80%, '강아지'일 확률은 20%라고 생각해"라고 말할 수 있게 하는 것입니다. 이들은 자신의 추측을 하나로 섞어서 다음 라운드를 위한 새로운, 모호한 힌트를 만들어냅니다. 여기서 핵심적인 질문은 이 논문이 다루는 문제입니다. 이 추측들을 수학적으로 어떻게 섞을 것인가? 대부분의 사람들은 로봇의 뇌가 평평하고 직선적인 지도와 같다고 가정하며 구식 방식으로 해왔습니다. 하지만 만약 로봇의 뇌가 거대한 구형의 지구본처럼 휘어져 있다면 어떨까요?


보간법의 미스터리: 길을 잃다 (The Lost in Interpolation Mystery)

이 논문의 저자들인 인도 공과대학교 루르키(IIT Roorkee) 팀은 이러한 AI 모델 내부의 "뇌"가 어떤 모양인지 조사하기로 했습니다. 그들은 이 모델들이 단어를 저장하는 방식이 종이처럼 평평한 것이 아니라, 구체의 표면처럼 휘어져 있다는 사실을 발견했습니다.

AI의 어휘를 거대한 보이지 않는 지구본이라고 생각해 보세요. 모든 단어는 이 공의 표면 위에 있는 하나의 점입니다. AI가 추측을 할 때, 그것은 지구본 위의 한 지점을 가리킵니다. 문제는 추측을 섞는 표준적인 방법(이를 "선형 보간" 또는 LERP라고 부릅니다)이 지구본을 평평한 지도처럼 취급한다는 점입니다. 만약 당신이 평면 지도 위에서 두 도시 사이를 직선으로 긋는다면, 당신은 지구의 중심을 관통하게 될지도 모릅니다. 하지만 당신이 지구 표면을 따라 걷고 있다면, 반드시 지면의 곡선을 따라가야 합니다. 이 논문은 표준적인 방법이 AI를 지구 중심을 통과하게 강요하고 있으며, 이는 모델을 혼란스럽게 하고 속도를 늦추는 부자연스러운 경로라고 설명합니다.

"보간법의 미스터리" 발견 (The "Lost in Interpolation" Discovery)

연구진은 AI가 기존의 평면 직선 방식을 사용하여 예측을 섞으려고 할 때 "길을 잃는다"는 것을 발견했습니다. 그들은 "마스크 상태(빈칸)"와 "예측 상태(추측)" 사이의 각도를 측정했는데, 이 각도가 전체 훈련 과정 동안 73도로 일정하게 유지된다는 것을 발견했습니다. 또한 단어가 얼마나 흔하거나 드문지와 상관없이 단어 벡터의 "크기(또는 노름, norm)"가 거의 동일하게 유지된다는 점도 주목했습니다. 이 두 가지 단서는 AI가 평면이 아닌 하이퍼스피어(고차원 구체) 위를 걷고 있다는 것을 증명하는 발자국과 같습니다.

AI는 구체 위에 존재하기 때문에, 저자들은 정보를 섞기 위해 직선을 사용하는 것이 잘못된 도구라고 주장합니다. 그것은 마치 자를 대고 뉴욕과 런던 사이의 거리를 재는 것과 같습니다(지구본 위에 줄을 감아 재는 대신).

해결책: 구형 소프트 마스킹 (S-SM)

이 문제를 해결하기 위해 팀은 **구형 소프트 마스킹(Spherical Soft-Masking, S-SM)**이라는 새로운 방법을 발명했습니다. S-SM은 AI가 지구 중심을 통과하는 직선을 긋는 대신, 지구 표면을 따라 걷도록 강제합니다.

그 방법은 다음과 같습니다:

  1. 지구본 걷기: 추측들을 직선으로 평균 내는 대신, 그들은 "프레셰 평균(Fréchet mean)"이라는 특별한 수학적 기법을 사용하여 구 표면 위의 평균 지점을 찾았습니다.
  2. 곡선형 블렌딩: 그들은 SLERP(구형 선형 보간)라고 불리는 기술을 사용했습니다. 풍선 위의 두 점 사이에 팽팽하게 당겨진 줄이 있다고 상상해 보세요. SLERP는 풍선의 곡선을 따라 그 줄을 따라가며, 결코 표면을 떠나지 않습니다.
  3. 결과: 그들은 이 새로운 방법을 1억 6,900만 개의 파라미터를 가진 AI 모델에 테스트했습니다. 결과는 인상적이었습니다. 이 새로운 방법은 단순히 작동하는 것을 넘어, 더 잘 작동했습니다.

숫자가 말해주는 것

팀은 새로운 S-SM 방식을 기존의 표준 방식(TopK/LERP) 및 피드백이 전혀 없는 버전과 비교 실험했습니다. 그들은 다양한 "생각 시간"(NFE 버젯, 64에서 512 단계까지)을 가지고 테스트했습니다.

  • 더 나은 품질: 새로운 방법은 인간의 글쓰기에 훨씬 더 가까운 텍스트를 생성했습니다. 그들은 이를 MAUVE라는 점수로 측정했습니다. 높은 버젯(512 단계 등)에서 S-SM은 기존 방식보다 MAUVE 점수를 최대 2배 향상시켰으며, 표준 TopK/LERP 방식보다는 27.5%에서 56.1% 더 높았습니다.
  • 더 적은 실수: AI는 혼란스러운 오류를 덜 범했습니다. "생성 퍼플렉서티(generative perplexity, AI가 자신의 텍text에 대해 느끼는 놀라움의 척도)"는 베이스라인 대비 16.9%에서 19.6% 감소했습니다.
  • 트레이드오프 없음: 보통 AI를 더 똑똑하게 만들면 창의성이 떨어지기 마련입니다(반복적인 내용을 생성함). 하지만 저자들은 S-SM이 기존 방식과 동일한 "엔트로피(창의성과 무작위성의 척도)"를 유지한다는 것을 발견했습니다. 즉, 지루해지지 않으면서도 더 똑똑해진 것입니다.

기존 방식이 실패한 이유

이 논문은 평평한 직선 방식이 단순히 "괜찮은" 수준이 아니라 근본적으로 틀렸다는 점을 명시적으로 밝힙니다. 연구진이 "신뢰 가중치(confidence weight, AI가 자신의 추측을 얼마나 믿을지 결정하기 위해 학습하는 수치)"를 살펴보았을 때 흥리학적인 사실을 발견했습니다. 새로운 S-SM 방식 하에서 AI는 자신의 기하학적 피드백을 훨씬 더 많이 신뢰하는 법을 배웠으며, 약 0.056의 가중치에 도달했습니다. 반면 기존 방식은 0.030의 가치만을 신뢰했습니다. 이는 AI가 지구 중심을 통과하도록 강요받지 않을 때 더 큰 "확신"을 느꼈음을 시사합니다.

결론

이 논문은 단순히 새로운 아이디어를 제안하는 데 그치지 않고, AI의 뇌의 기하학적 구조가 구형이라는 강력한 증거를 제시하며, 우리가 그들에게 대화하는 데 잘못된 수학을 사용해 왔음을 보여줍니다. 직선 대신 곡선 경로(SLERP)를 사용함으로써, 저자들은 이러한 모델이 고유의 생동감을 잃지 않으면서도 더 나은 텍스트를 더 빠르게 생성할 수 있음을 입증했습니다. 이는 때때로 앞으로 나아가기 위해서, 직선으로 걷는 것을 멈추고 곡선을 따라가야 한다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →