← 최신 논문
🤖 machine learning

AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers

AoiZora는 물리적 인터커넥트 인지 능력을 자동 병렬화 탐색 프로세스에 통합함으로써 TPU 서브 슬라이스 상의 저지연 비디오 확산 추론을 최적화하는 컴파일러 매개 토폴로지 플래너로, 기존 솔루션 대비 Wan 2.1에 대해 최대 1.42배의 지연 시간 감소를 달성한다.

원저자: Kaijian Wang, Yuanyuan Xu, Fanjiang Ye, Ye Cao, Jingwei Zuo, T. S. Eugene Ng, Yarong Mu, Yuke Wang

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaijian Wang, Yuanyuan Xu, Fanjiang Ye, Ye Cao, Jingwei Zuo, T. S. Eugene Ng, Yarong Mu, Yuke Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 비디오 제작을 위해 거대하고 중요한 수준의 이어달리기 경주를 조직한다고 상상해 보세요. 여기서 "주자"는 컴퓨터 칩(구체적으로 구글의 TPU 칩)이며, "바톤"은 비디오의 각 프레임을 생성하는 데 필요한 데이터입니다.

비디오 생성 과정은 마치 주자들이 이미지가 선명해질 때까지 반복해서 노이즈를 제거(이를 "디노이징"이라고 합니다)하는 길고 반복적인 루프와 같습니다. 이 비디오는 매우 방대하고 과정이 느리기 때문에, 단 하나의 칩만으로는 수행할 수 없습니다. 따라서 여러 칩이 팀을 이루어 함께 협력해야 합니다.

문제점: "좌석 배치도"의 실수
현재 엔지니어들이 이 팀을 구성할 때, 그들은 논리적인 계획에 집중합니다: "주자 A는 배경을 담당하고, 주자 B는 하늘을, 주자 C는 사람을 담당한다." 이것은 마치 화이트보드에 할 일을 적어두는 것과 같습니다.

하지만 그들은 물리적인 현실, 즉 **이 주자들이 경기장의 정확히 어디에 앉아 있는가?**를 간과하곤 합니다.

실제 경기장(물리적 TPU 네트워크)에서는 어떤 주자들은 서로 바로 옆에 앉아 있어 바톤을 즉시 전달할 수 있습니다. 반면, 어떤 주자들은 경기장 반대편에 있어 바톤을 전달하는 데 시간이 걸리고 공유된 경로에서 교통 체증을 유발합니다.

이 논문은 설령 주자들에게 똑같은 과업(동일한 논리적 계획)을 부여하더라도, 단순히 주자들이 경기장의 어디에 앉느냐에 따라 경주 속도가 16.6% 더 느려지거나 빨라질 수 있음을 발견했습니다. 주요 원인은 주자가 달리는 거리가 아니라, 일부 주자들이 동일한 좁은 통로(공유 네트워크 링크)를 동시에 사용해야 해서 발생하는 교통 체증입니다.

해결책: AoiZora (스마트한 코치)
저자들은 AoiZora(일본어로 '푸른 하늘'이라는 뜻)라고 불리는 새로운 도구를 만들었습니다. AoiZora를 단순한 경기 계획을 짜는 것을 넘어, 실제 경기장 배치에 기반하여 좌석 배치도까지 설계하는 초스마트한 코치라고 생각해보세요.

AoiZola는 모든 가능한 좌석 배치 조합을 확인하는 것이 너무 느리고 비용이 많이 든다는 까다로운 문제를 해결합니다. 만약 모든 좌석 배치 방식을 테스트하려고 한다면, 실제 경주를 하는 것보다 계획을 세우는 데 더 많은 시간을 쓰게 될 것입니다.

AoiZora의 작동 방식 (2단계 전략)
AoiZora는 마치 채용 과정과 같은 영리한 "필터링 및 정교화(filter and refine)" 접근 방식을 사용합니다.

  1. 1단계: 빠른 서류 심사 (Pre-Compilation)
    먼저, AoiZora는 저렴하고 빠른 방법을 사용하여 "이력서"(논리적 과업 계획)를 검토합니다. 아직 전체 경기장을 구축하는 단계가 아닙니다. 그저 계획이 서류상으로 타당한지만 확인합니다. 예를 들어, 나눌 수 없는 과업을 나누려고 시도하는 것과 같이 명백히 실패할 계획들을 빠르게 걸러냅니다. 이는 30초짜리 짧은 면접처럼 빠르고 저렴합니다.

  2. 2단계: 전체 시뮬레이션 (Post-Compilation)
    첫 번째 라운드를 통과한 소수의 우수 후보들에 대해, AoiZora는 본격적인 작업을 수행합니다. 실제 경기장(물질적 TPU 칩)의 상세한 시뮬레이션을 구축하고 전체 테스트를 실행합니다. 이를 통해 특정 네트워크 링크에서 정확히 어디에 교통 체증이 발생하는지 확인합니다. 그런 다음, 이러한 정체를 피할 수 있는 단 하나의 최적의 좌석 배치를 선택합니다.

결과
이 2단계 방법을 통해 AoiZora는 "무엇을 할 것인가"와 "어디에서 할 것인가"의 완벽한 조합을 찾아냅니다.

  • 비유: 당신이 저녁 식사 모임을 준비한다고 상상해 보세요.
    • 기존 방식: 누가 어떤 음식을 가져올지 결정하고(논리적 계획), 아무 데나 앉으라고 말합니다. 가끔 무거운 수프를 가져오는 사람이 섬세한 케이크를 가져오는 사람 옆을 지나가야 해서, 서로 부딪혀 음식을 쏟는 일이 발생합니다.
    • AoiZora 방식: 먼저 음식을 가져올 수 없는 손님들을 빠르게 탈락시킵니다. 그다음, 남은 손님들을 위해 실제 테이블 배치를 살펴보고, 수프를 가져오는 사람은 주방 문 바로 옆에, 케이크를 가져오는 사람은 반대편에 앉혀서 아무도 서로 부딪히지 않도록 합니다.

핵심 요약
구글의 TPU 칩에서 AoiZora는 기존 방식보다 비디오 생성을 1.42배 더 빠르게 만들었습니다. AoiZora는 비디오 게임 자체나 경기의 규칙을 변경한 것이 아닙니다. 단지 주자들이 서로 발을 헛디디지 않고 바톤을 전달할 수 있도록 가장 스마트한 좌석 배치 방법을 찾아냈을 뿐입니다. 이를 통해 기초 소프트웨어를 다시 작성할 필요 없이, 더 빠른 속도와 낮은 지연 시간의 비디오 생성이 가능해졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →