← 최신 논문
💻 computer science

FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation

FlashAR 는 보완적인 수직 헤드와 동적 퓨전 게이트를 통해 사전 훈련된 모델을 병렬 양방향 예측 패러다임에 적응시킴으로써 자기회귀 이미지 생성을 가속화하는 경량화된 사후 훈련 프레임워크로, 최소한의 데이터와 계산 비용으로 최대 22.9 배의 속도 향상을 달성합니다.

원저자: Junkang Zhou, Yefei He, Feng Chen, Weijie Wang, Bohan Zhuang

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Junkang Zhou, Yefei He, Feng Chen, Weijie Wang, Bohan Zhuang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

벽에 거대하고 정교한 벽화를 그리려 한다고 상상해 보세요.

기존 방식 (표준 자기회귀 모델)
현재 가장 첨단 AI 화가들은 매우 엄격하고 한 손으로만 작업하는 예술가처럼 작동합니다. 그들은 벽화를 한 작은 사각형씩 그려야 하며, 완벽한 "뱀" 패턴으로 이동합니다: 첫 번째 행은 왼쪽에서 오른쪽으로, 두 번째 행은 오른쪽에서 왼쪽으로, 그리고 그다음 행들은 그렇게 계속 이어집니다. 그들은 첫 번째 행이 완전히 완성되기 전에는 두 번째 행을 그릴 수 없습니다. 또한, 왼쪽 아래 모서리가 완성되기 전에는 오른쪽 위 모서리를 그릴 수 없습니다.

이 "뱀" 방식은 품질이 매우 뛰어나지만, 극도로 느립니다. 고해상도 이미지 (거대한 벽화) 를 원한다면, AI 는 수천 개의 작은 연속적인 붓질을 해야 합니다. 마치 한 사람이 좌석 하나씩 차례로 스타디움 전체를 칠하는 것을 기다리는 것과 같습니다.

문제점
과학자들은 이 과정을 가속화하고 싶어 했습니다. 일부는 AI 에게 완전히 새로운 그림 방식 (큰 블록으로 그리거나 뛰어다니며 그리기 등) 을 가르치려 했지만, 이는 AI 를 처음부터 다시 훈련시켜야 하므로 수년과 막대한 컴퓨팅 파워가 필요했습니다. 다른 이들은 AI 가 여러 지점을 동시에 그리도록 허용하려 했지만, 이는 종종 AI 를 혼란스럽게 하여 이미지가 흐릿하거나 기이하게 보이게 만들었습니다. 이는 AI 가 이미 학습한 규칙을 깨뜨렸기 때문입니다.

해결책: FlashAR
이 논문은 FlashAR를 소개합니다. 이는 AI 를 처음부터 다시 훈련시키지 않고도 느리고 한 손으로만 작업하는 화가를 효율적인 화가 팀으로 전환시키는 교묘한 "소프트웨어 업데이트"입니다.

간단한 비유를 들어 작동 방식을 설명해 보겠습니다:

1. "두 개의 머리" 전략

기존 방식처럼 왼쪽 행만 보는 대신, FlashAR 는 AI 에게 위쪽 열을 보는 두 번째 "머리"를 제공합니다.

  • 머리 A (수평): 방금 그려진 행을 보기 위해 왼쪽을 봅니다.
  • 머리 B (수직): 방금 그려진 열을 보기 위해 위쪽을 봅니다.

이제 AI 는 한 번에 한 사각형씩 그리는 대신, 대각선으로 이어진 사각형 전체를 한 번에 그릴 수 있습니다. 대각선으로 일렬로 서서 함께 작업하는 화가들을 상상해 보세요. 그들은 자신들의 특정 위치를 동시에 칠할 수 있습니다. 왜냐하면 그들은 자신들의 왼쪽이나 위쪽에 있는 것만 알면 되는데, 그 부분은 이미 완성되었기 때문입니다. 이는 긴 줄을 서 있는 작업자들을 빠르게 움직이는 대각선 팀으로 바꿉니다.

2. "스마트 포크" (중간 분기)

"AI 의 뇌 끝부분에 새로운 '위쪽을 보는' 머리만 추가하면 되지 않나?"라고 생각할 수 있습니다. 하지만 논문은 이것이 나쁜 아이디어라고 말합니다.

  • 비유: 특정 레시피 (왼쪽에서 오른쪽으로 그리기) 를 완벽하게 다듬는 데 수년을 보낸 요리사를 상상해 보세요. 요리가 끝나는 마지막 순간에 갑자기 재료를 다른 각도에서 보라고 요청하면 그들은 혼란을 느낍니다. 그들의 뇌는 기존 방식에 너무 특화되어 있기 때문입니다.
  • 해결책: FlashAR 는 AI 의 뇌를 더 일찍, 즉 중간 계층에서 "포크"합니다. 이는 요리사가 기존 레시피에 너무 집착하기 전에 그들의 지식을 가져오는 것입니다. 이 새로운 분기는 "위쪽"을 보도록 학습하는 반면, 원래 분기는 "왼쪽"을 보도록 유지합니다. 그들은 동일한 기반을 공유하지만 서로 다른 방향에 특화됩니다.

3. "교통 신호등" (학습 가능한 융합 게이트)

이제 AI 는 모든 사각형에 대해 두 가지 의견을 갖게 됩니다: "왼쪽을 기준으로 칠하라"와 "위쪽을 기준으로 칠하라". 때로는 이 의견들이 일치하지만, 때로는 충돌합니다.

  • 기존 방식: 두 의견의 평균을 취합니다. 이는 빨간색과 초록색 사이에서 멈춰 있는 교통 신호등과 같습니다. 이는 혼란과 흐릿한 결과를 초래합니다.
  • FlashAR 방식: 이는 스마트 교통 신호등 (학습 가능한 게이트) 을 사용합니다. 이미지의 일부 (예: 수평의 지평선) 에 대해서는 "왼쪽" 시야에 초록불을 켭니다. 다른 부분 (예: 수직의 건물 가장자리) 에 대해서는 "위쪽" 시야에 초록불을 켭니다. 이는 각 특정 지점에 대해 어떤 단서가 더 중요한지 동적으로 결정하여 그림이 선명하고 명확하게 유지되도록 합니다.

4. "2 단계" 훈련

AI 를 망가뜨리지 않고 이를 작동시키기 위해, 그들은 2 단계 훈련 과정을 사용합니다:

  1. 1 단계 (워밍업): 원래 AI 뇌를 고정시켜 (기존 기술을 잊지 않도록) 새로운 "위쪽을 보는" 머리만 훈련시킵니다. 이는 새로운 견습생을 가르치는 동안 요리사가 이전과 똑같이 요리를 계속하는 것과 같습니다.
  2. 2 단계 (팀워크): 새로운 머리가 숙련되면 전체 시스템을 해제하고 요리사와 견습생이 팀워크를 함께 미세 조정합니다.

결과
이 논문은 이 방법이 엄청난 성공을 거두었다고 주장합니다:

  • 속도: 512x512 이미지 생성 속도를 22.9 배 가속화합니다.
  • 품질: 이미지는 느린 기존 방식과 똑같이 훌륭하게 보입니다.
  • 효율성: 새로운 모델을 훈련시키는 데 일반적으로 필요한 데이터의 **0.05%**만 필요했습니다. 이는 완전히 새로운 차를 만드는 대신 간단한 튜닝으로 자동차 엔진을 업그레이드하는 것과 같습니다.

요약하자면, FlashAR 는 느린 1 차선 도로를 도로 자체를 재건하지 않고도 두 번째 방향의 교통 흐름을 추가하고, 흐름을 관리하는 스마트 교통 시스템을 사용하여 다차선 고속도로로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →