← 최신 논문
💻 computer science

Rethinking Cross-Layer Information Routing in Diffusion Transformers

본 논문은 확산 변환기에서 전통적인 잔차 가산을 대체하여 정보 흐름 문제를 완화하고, ImageNet 생성 품질과 학습 효율성을 크게 향상시키며 미세 조정 중 고주파 세부 사항을 보존하는 학습 가능한 시간 단계 적응형 잔차 메커니즘인 확산 적응형 라우팅 (DAR) 을 소개합니다.

원저자: Chao Xu, Maohua Li, Qirui Li, Yixuan Xu, Yanke Zhou, Yunhe Li, Cuifeng Shen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chao Xu, Maohua Li, Qirui Li, Yixuan Xu, Yanke Zhou, Yunhe Li, Cuifeng Shen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 화가가 흐릿하고 잡음이 섞인 정적 구름에서 시작해 점차 선명하고 뚜렷한 이미지로 다듬어 그림을 그리는 법을 가르치려 한다고 상상해 보세요. 이것이 바로 현대 AI 이미지 생성기 (Diffusion Transformers 라고 불림) 가 작동하는 방식입니다.

오랫동안 이 로봇 화가의 "두뇌"는 언어 모델 (에세이를 작성하는 모델 등) 에서 물려받은 표준 청사진을 사용하여 구축되어 왔습니다. 이 청사진은 로봇이 두뇌의 한 층에서 다음 층으로 정보를 전달하는 방법을 알려줍니다. 이는 각 주자가 자신의 메시지를 전봉에 추가하고 전달하는 릴레이 경주와 같습니다.

이 논문의 저자 차오 쉬 (Chao Xu) 와 그의 팀은 이 릴레이 경주를 더 자세히 살펴보기로 했습니다. 그들은 이미지 생성을 위해 전봉을 전달하는 표준 방식이 실제로는 결함이 있다는 것을 발견했고, 이를 해결하기 위해 DAR(Diffusion-Adaptive Routing) 라는 더 똑똑한 새로운 방식을 개발했습니다.

다음은 그들의 발견과 해결책에 대한 간단한 요약입니다:

1. 문제: "잡음 섞인 릴레이 경주"

표준 설계에서는 이미지가 선명해짐에 따라 (잡음이 많음에서 적음으로 이동), 로봇의 두뇌 층을 통과하는 정보가 이상하게 작용하기 시작합니다. 저자들은 세 가지 구체적인 "증상"을 확인했습니다:

  • 볼륨 조절기가 최대에 고정됨 (크기 과대팽창): 릴레이 경주에서 주자들이 한 걸음씩 나아갈 때마다 메시지를 더 크게 외치는 상황을 상상해 보세요. 메시지가 최종 층에 도달할 때는 너무 시끄러워 (수학적으로 너무 커져서) 다른 모든 것을 압도해 버립니다. 로봇은 볼륨을 적절히 조절하기 위해 엄청난 노력을 기울여야 합니다.
  • 신호가 사라짐 (기울기 감소): 릴레이 경주에서 마지막 주자가 전봉을 떨어뜨리면, 첫 번째 주자들은 자신이 실수했다는 것을 알지 못합니다. 마찬가지로 표준 설계에서는 초기 층이 어떻게 개선해야 하는지 알려주는 "피드백"이 위로 올라가는 과정에서 너무 약해져서 초기 층이 효과적으로 학습을 멈추게 됩니다.
  • 모두 같은 말을 함 (중복성): 메시지가 너무 시끄럽고 왜곡되기 때문에, 두뇌의 서로 다른 층들이 거의 동일한 출력을 생성하기 시작합니다. 이는 회의실에 20 명이 있지만 모두 같은 문장을 반복하는 것과 같습니다. 이는 두뇌 능력의 낭비입니다.

저자들은 또한 이 표준 릴레이 경주가 "시간에 무감각하다"는 것을 발견했습니다. 이는 그림의 초기 흐릿한 단계를 최종 선명한 단계와 동일하게 취급합니다. 하지만 실제로 로봇은 이미지가 흐릿할 때는 큰 형태에 집중하고 이미지가 선명할 때는 작은 세부 사항에 집중해야 합니다. 기존 설계는 기어를 전환할 수 없었습니다.

2. 해결책: "스마트 교통 관제사" (DAR)

이 팀은 단순한 "추가하고 전달하기" 릴레이를 스마트하고 적응형인 교통 관제사로 대체하는 DAR를 제안했습니다.

이전 모든 메시지를 현재 메시지에 맹목적으로 추가하는 대신, 새로운 시스템은 다음과 같이 질문합니다: "우리가 그림 그리기 과정의 이 특정 단계 (시간 단계) 에 있다면, 어떤 이전 메시지들이 지금 실제로 유용한가?"

  • 시간을 인지함: 관제사는 이미지가 여전히 흐릿한 구름인지 거의 완성된 상태인지 파악합니다. 흐릿하다면 "큰 그림" 층에 집중하고, 선명하다면 "세부 사항" 층에 집중합니다.
  • 선택적임: 모든 것을 단순히 추가하지 않습니다. "소프트 어텐션 (soft attention)" 메커니즘 (마치 스포트라이트처럼) 을 사용하여 가장 좋은 이전 정보를 선택하고 나머지는 무시합니다.
  • 유연함: 층들이 서로 다르게 되도록 강제하지 않고, 단지 그들이 서로 소통하는 방식을 변경합니다. 이는 기존 모델에 다른 모델을 깨뜨리지 않고도 적용할 수 있음을 의미합니다.

3. 결과: 더 빠르고 더 좋은 예술

이 팀은 표준 이미지 데이터셋 (ImageNet) 에서 이 새로운 시스템을 테스트했습니다. 결과는 인상적이었습니다:

  • 더 나은 품질: 생성된 이미지들이 훨씬 더 선명하고 사실적이었습니다 (낮을수록 좋은 FID 점수로 측정). 표준 모델에 비해 점수가 크게 개선되었습니다.
  • 훨씬 빠른 학습: 모델이 기존 모델과 동일한 높은 품질에 도달하는 데 8.75 배 적은 단계만 필요했습니다. 마치 8 일 대신 하루 만에 걸작을 그리는 법을 배우는 것과 같습니다.
  • 다른 업그레이드와 호환됨: 그들은 DAR 를 기존 예술에서 학습하도록 돕는 또 다른 인기 있는 방법인 REPA와 함께 테스트했습니다. 두 방법은 완벽하게 협력하여 충돌 없이 학습 속도를 2 배로 높였습니다.

4. 추가 이점: 세부 사항 선명하게 유지

이 논문은 또한 이 새로운 시스템을 사용하여 거대한 모델을 더 작고 빠른 모델로 "증류 (압축)"할 때, 새로운 시스템이 고주파 세부 사항을 훨씬 더 잘 유지한다는 것을 보여주었습니다.

문서를 복사하는 것을 생각해 보세요. 기존 방법은 미세한 텍스트와 날카로운 가장자리를 흐리게 만들었습니다. 반면 새로운 DAR 방법은 압축 후에도 텍스트를 또렷하게 하고 가장자리를 선명하게 유지했습니다.

요약

간단히 말해, 이 논문은 AI 이미지 생성기가 두뇌 층 간에 정보를 전달하는 방식이 시대에 뒤떨어져 있다고 주장합니다. 이는 너무 시끄럽고, 피드백이 너무 약하며, 너무 반복적이었습니다. 올바른 정보를 올바른 시간에 선택하는 스마트하고 시간을 인지하는 라우팅 시스템 (DAR) 을 도입함으로써, 그들은 AI 가 더 빠르게 학습하고 더 나은 이미지를 생성하도록 만들었으며, 동시에 기본 아키텍처를 단순하게 유지하고 다른 현대식 업그레이드와 호환되도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →