← 최신 논문
🤖 machine learning

JLT: Clean-Latent Prediction in Latent Diffusion Transformers

본 논문은 저변이 방향을 더 잘 처리하고 ImageNet 256x256 생성 품질 (FID 2.50) 을 향상시켜 잠재 공간에서 속도 예측보다 깨끗한 잠재 예측이 더 우수함을 보여주는 잠재 확산 Transformer 인 JLT 를 소개하며, 이는 예측 대상이 상호 교환 가능한 대수적 매개변수화가 아닌 표현에 의존하는 기하학적 선택임을 시사합니다.

원저자: Funing Fu, Tenghui Wang, Junyong Cen, Qichao Zhu, Guanyu Zhou

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Funing Fu, Tenghui Wang, Junyong Cen, Qichao Zhu, Guanyu Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

완벽한 고양이 그림을 그리도록 로봇을 가르치려 한다고 상상해 보세요. 완성된 사진을 보여주는 대신, 흐릿하고 잡음이 섞인 고양이 버전을 보여주고 "이 모든 정적 아래에 있는 깨끗한 고양이는 어떻게 생겼을까?"라고 물어봅니다.

오랫동안 AI 연구자들은 그 질문을 어떻게 던져야 할지 논쟁해 왔습니다. 로봇이 제거해야 할 "잡음"을 추측하게 해야 할까요? 이미지가 변하는 "속도"를 추측하게 해야 할까요? 아니면 그냥 최종적인 깨끗한 그림을 직접 추측하게 해야 할까요?

이 논문, 제목은 JLT입니다. 이 논문은 로봇이 이미지의 압축되고 단순화된 버전 (잠재 공간이라고 함) 으로 작업할 때조차 최종 깨끗한 그림을 직접 추측하는 것이 최선의 방법이라고 주장합니다.

간단한 비유를 사용하여 그들의 발견을 다음과 같이 정리해 보겠습니다:

1. 설정: "압축된" 스케치패드

일반적으로 AI 모델은 원시 픽셀 (수백만 개의 작은 colored 점) 로 작업합니다. 이는 고해상도의 거대한 캔버스에 걸작을 그리려는 것과 같습니다. 느리고 지저분합니다.

속도를 높이기 위해 연구자들은 이미지를 더 작고 단순화된 코드, 즉 "스케치패드"로 변환하는 "압축기 (VAE)"를 사용합니다. AI 는 이 스케치패드에서 그리기를 배우고, 그 다음 디코더가 스케치를 완전한 사진으로 다시 변환합니다.

저자들이 던진 큰 질문은 이것입니다: 우리가 이 단순화된 스케치패드에서 작업할 때, AI 에게 무엇을 예측하게 하느냐는 여전히 중요할까요?

2. 경쟁자들: 잡음 대 깨끗한 이미지

저자들은 두 가지 유형의 AI 모델 간에 공정한 경기를 마련했습니다. 그들은 정확히 같은 "스케치패드", 정확히 같은 뇌 크기 (Transformer 아키텍처), 그리고 정확히 같은 훈련 시간을 사용했습니다. 유일한 차이는 그들에게 부여된 목표였습니다:

  • "속도" 주자 (DiT): 이 모델은 "최종 그림을 걱정하지 마. 이미지가 그곳으로 가려는 방향과 속도만 말해."라고 지시를 받았습니다. 이는 운전자에게 "얼마나 빠르게 가속하고 있니?"라고 묻는 것과 같습니다.
  • "깨끗한" 주자 (JLT): 이 모델은 "속도를 무시해. 지금 최종적이고 깨끗한 그림이 어떻게 생겼는지 말해."라고 지시를 받았습니다. 이는 운전자에게 "목적지는 어디니?"라고 묻는 것과 같습니다.

3. 경기 결과

결과는 명확했습니다: "깨끗한" 주자 (JLT) 가 압도적인 차이로 승리했습니다.

  • "깨끗한" 모델이 고양이를 그리려 할 때, 결과는 날카롭고 사실적이었습니다 (점수 2.50).
  • "속도" 모델이 시도했을 때, 결과는 더 흐릿하고 정확도가 낮았습니다 (점수 6.56).

수학적으로 "속도" 답변을 "깨끗한 그림" 답변으로 변환할 수 있음에도 불구하고 이 일이 발생했습니다. 저자들은 AI 가 질문에 답하는 방식이 최종 그림의 품질을 변화시킨다는 것을 발견했습니다.

4. 왜 "깨끗한" 주자가 승리했을까요? (비유)

이 논문은 "잡음"과 "신호"를 포함하는 교묘한 수학적 설명을 사용합니다.

"스케치패드"에 고양이 귀 모양처럼 매우 중요한 방향들과 작은 먼지 알갱이처럼 무작위 정적일 뿐인 방향들이 있다고 상상해 보세요.

  • "속도" 접근법은 모든 방향을 동일하게 취급합니다. 모든 것에 일정한 "바닥" 잡음을 추가합니다. 이는 우연히 작고 무작위인 먼지 알갱이들을 증폭시켜 시끄럽고 산만하게 만듭니다. 이는 배경 잡음까지 포함해 모든 것의 볼륨을 높이는 마이크와 같습니다.
  • "깨끗한" 접근법은 더 영리합니다. 일부 방향 (무작위 먼지 알갱이) 은 실제 데이터에 "신호"가 거의 없다는 것을 깨닫습니다. 따라서 자연스럽게 그 약한 방향들의 볼륨을 낮춥니다. 중요한 부분 (귀, 눈) 에 에너지를 집중하고 정적을 무시합니다.

간단히 말해: "깨끗한" 모델은 잡음을 무시하는 법을 배우는 반면, "속도" 모델은 우연히 잡음을 더 크게 만듭니다.

5. 결론

저자들은 AI 이미지 생성 세계에서 질문을 어떻게 구성하느냐가 그것을 답하는 뇌만큼이나 중요하다고 결론 내립니다.

이미지의 압축되고 단순화된 버전으로 작업하더라도, AI 에게 "변화의 속도를 예측하라"고 묻는 것보다 "깨끗한 결과를 예측하라"고 묻는 것이 기하학적으로 우월합니다. 이는 단순히 같은 수학을 다른 방식으로 쓰는 것이 아니라, 훨씬 더 좋은 그림으로 이어지는 근본적으로 다른 학습 방식입니다.

요약: 최고의 AI 예술을 원한다면 AI 를 더 똑똑하게 만들기만 하지 말고, AI 에게 그곳에 도달하는 과정이 아닌 최종 그림을 추측하도록 하세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →