← 최신 논문
💻 computer science

Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation

이 논문은 다중 토큰 예측, 토큰 수준의 대조 학습 정규화, 그리고 시맨틱 드로핑(semantic dropping)을 결합하여 LlamaGen과 같은 기존 방식보다 우수한 이미지 품질과 현저히 빠른 훈련 효율성을 달성함으로써 자기회귀적 이미지 생성을 향상시키는 통합 훈련 프레임워크인 Multi-Token Autoregressive (MTAR)를 제안한다.

원저자: Guo Niu, Xiongfei Yao, Teng Wang, Nannan Zhu

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guo Niu, Xiongfei Yao, Teng Wang, Nannan Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터는 무에서 유를 창조하는 데 놀라울 정도로 숙련되었지만, 그 학습 방식은 마치 전체 페이지를 보지 못한 채 교과서의 단어를 한 번에 하나씩 암기하려는 학생처럼 느껴질 때가 많습니다. 인공지능 분야에서 '자기회귀 생성(autoregressive generation)'이라 불리는 대중적인 방법은, 마치 다음 단어를 추측하여 문장을 완성하는 것처럼 이전 조각들을 바탕으로 이미지의 다음 조각을 예측하는 방식으로 작동합니다. 이 접근 방식은 고품질의 이미지를 생성하는 데 큰 가능성을 보여주었지만, 근본적인 비효율성을 안고 있습니다. 컴퓨터는 이미지의 조각들이 어떻게 서로 맞물리는지 배우기 위해 모든 아주 작은 패치들을 하나하나씩 살펴봐야만 합니다. 이 과정은 느리고 종종 근시안적인데, 이는 컴퓨터가 바로 다음 단계에만 너무 좁게 집중한 나머지 더 큰 그림을 놓치게 되어, 반복적인 질감이나 흐릿한 세부 묘사를 초래한다는 것을 의미합니다. 더욱이, 컴퓨터는 빈 하늘과 같이 중요한 정보가 거의 없는 부분도 얼굴의 복잡한 세부 사항을 처리할 때와 똑같은 에너지를 낭비하며 처리합니다.

포산 대학교와 홍콩 대학교의 연구진은 이미지를 생성하는 방식 자체를 바꾸지 않으면서도 이러한 문제들을 해결하는 새로운 이미지 생성 시스템 학습 방법을 제안했습니다. 그들은 이 방법을 세 가지 구체적인 전략을 통해 학습 과정을 개선하는 통합 프레임워크인 MTAR라고 부릅니다. 첫째, 그들은 컴퓨터가 앞을 내다보는 방식을 변경했습니다. 모델에게 바로 다음 패치를 예측하도록 요구하는 대신, 현재 그리드 위치의 바로 아래에 있는 패치를 또한 예측해야 하는 두 번째 과업을 추가했습니다. 이는 컴퓨터가 단순히 하나의 거리만을 보는 것이 아니라 동네 전체를 보는 것처럼, 이미지의 2차원 구조를 이해하도록 강제하여 로컬 패턴과 미래의 맥락을 훨씬 더 잘 포착할 수 있게 돕습니다. 둘째, 그들은 컴퓨터의 내부 이해도가 서로 다른 이미지 부분들에 대해 명확하고 뚜렷하게 유지되도록 하는 기술을 도입했습니다. 동일한 이미지 특징들의 서로 다른 버전들을 비교함으로써, 모델이 다양한 질감과 형태의 표현을 분리된 상태로 유지하도록 독려하여 이미지가 탁해지거나 반복되는 것을 방지했습니다. 마지막으로, 그들은 이미지의 중요하지 않은 부분을 무시하도록 컴퓨터를 가르침으로써 낭비되는 노력을 해결했습니다. 이미지의 어떤 패치가 가장 의미 있는 정보를 담고 있는지 식별하는 별도의 도구를 사용하여, 컴퓨터가 빈 배경과 같은 덜 중요한 영역은 건너뛰면서도 결정적인 세부 사항에는 계속 집중할 수 있도록 했습니다.

이 새로운 접근 방식의 결과는 이 분야의 발전을 측정하는 데 사용되는 표준 이미지 모음인 ImageNet 벤치마크에서 테스트했을 때 매우 인상적이었습니다. 연구진이 자신들의 시스템을 기존의 선도적인 방법인 LlamaGen과 비교했을 때, 새로운 프레임워크가 훨씬 더 짧은 시간 안에 훨씬 더 나은 이미지를 생성한다는 것을 발견했습니다. 구체적으로, 생성된 이미지의 사실성을 측정하는 지표인 FID 점수에서 새로운 방법은 이전의 최고 기록보다 거의 1점 낮게 나타났으며, 이는 품질의 명확한 향상을 의미합니다. 더 중요한 것은 학습 과정이 실질적으로 빨라졌다는 점입니다. 연구진은 자신들의 시스템이 기존 방법과 동일한 수준의 성능에 도 도달하는 데 단 3분의 1의 학습 시간만을 필요로 했으며, 어떤 경우에는 거의 4배나 더 빨랐습니다. 심지어 연구진이 학습 단계를 통상적인 횟수의 일부로 제한했을 때도, 새로운 시스템은 기준 모델과 비슷하거나 더 나은 이미지를 만들어냈습니다. 이는 이러한 개선이 단순히 더 열심히 작업해서가 아니라, 더 나은 학습 신호를 제공하고 불필요한 계산을 제거함으로써 더 똑똑하게 작업했기 때문임을 시사합니다.

결정적으로, 이러한 모든 개선 사항은 오직 컴퓨터가 학습하는 동안에만 발생합니다. 학습이 완료되면 시스템은 추가적인 단계나 지연 없이 이전과 똑같이 한 번에 하나의 토큰을 예측하며 작동합니다. 연구진은 이러한 보조 과업을 추가하고 학습 단계에서 가치가 낮은 정보를 건너뜀으로써, 더 유능하면서도 효율적인 모델을 만들 수 있음을 입증했습니다. 이 연구는 더 나은 이미지 생성을 위한 핵심이 더 큰 모델을 구축하는 것이 아니라, 모델이 세상을 보는 방식을 정교하게 다듬어, 올바른 것에 주의를 기울이고 그들 사이의 공간적 관계를 이해하도록 만드는 데 있다는 것을 시사합니다. 고품질의 출력에 대한 필요성과 시간 및 컴퓨팅 능력이라는 실제적인 제약 사이의 균리 균형을 맞춤으로써, 이 연구는 인공지능을 통한 사실적인 이미지 생성의 더 명확한 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →