← 최신 논문
💻 computer science

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

UniAR은 단일 이산 시각적 토크나이저를 활용하여 시각적 이해와 생성을 연결함으로써 공유된 컨텍스트, 병렬 비트 단위 예측 및 확산 기반 디코더를 통해 고충실도 이미지 합성 및 편집을 가능하게 하는 통합 자기회귀 프레임워크를 도입하며, 이를 통해 멀티모달 벤치마크 전반에서 최첨단 성능을 달성합니다.

원저자: Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 로봇 화가가 있다고 상상해 보세요. 과거에는 이 로봇이 사진을 보고 그 안에 무엇이 있는지 말하게 하려면, 하나의 "안경"(이미지를 데이터로 변환하는 특정한 방식)을 사용해야 했습니다. 하지만 로봇에게 새로운 그림을 그리게 하고 싶다면, 완전히 다른 언어를 사용하는 전혀 다른 "안경"으로 바꿔 써야 했습니다.

이것은 로봇이 그림을 그린 후, 자신의 창작물을 즉시 "보고" 이해할 수 없음을 의미했습니다. 로봇은 그림을 가져와서 다시 "보는" 안경을 통해 처리한 다음, 그것을 이해하려고 노력해야 했습니다. 이는 마치 프랑스어로 편지를 쓴 다음, 스스로 읽기 위해 다시 영어로 번역해야 하는 것과 같았습니다.

UniAR는 로봇에게 보고 그리는 데 모두 사용할 수 있는 단 한 쌍의 안경을 제공함으로써 이 문제를 해결하는 새로운 시스템입니다.

이것이 어떻게 작동하는지 간단한 개념으로 나누어 설명하겠습니다.

1. 만능 번역기 (비주얼 토크나이저 - The Visual Tokenizer)

보통 컴퓨터는 이미지를 '토큰'이라고 불리는 아주 작은 퍼즐 조각들로 분해합니다.

  • 문제점: 기존 시스템은 두 가지 서로 다른 퍼즐 조각 세트를 사용했습니다. 한 세트는 고양이(높은 수준의 의미)를 인식하는 데는 훌륭했지만, 털의 질감(낮은 수준의 세부 사항)을 묘사하는 데는 서툴렀습니다. 다른 세트는 털을 그리는 데는 뛰어났지만, 실제 "고양이"가 무엇인지에 대해서는 혼란스러워했습니다.
  • UniAR의 해결책: 그들은 이미지를 이진 비트(단순히 0과 1로 이루어진)라는 특수한 코드로 변환하는 단일 번역기를 구축했습니다. 이것은 거대한 디지털 모스 부호와 같습니다.
    • 비유: 로고가 10,000개의 단어가 담긴 사전을 사용하는 대신, 이 로봇은 모든 단어가 64자리의 0과 1의 조합으로 이루어진 코드를 사용한다고 상상해 보세요. 이 방식은 매우 방대한 어휘량(2642^{64})을 만들어내어, 거대한 사전 없이도 거의 모든 것을 묘사할 수 있게 해줍니다.
    • 마법 같은 기술: 이 번역기는 다양한 "깊이"로 이미지를 바라봅니다. 형태(깊은 층)와 질감 같은 미세한 디테일(얕은 층)을 동시에 봅니다. 이를 통해 로봇은 동일한 코드를 사용하여 이미지를 이해함과 동시에 완벽하게 그려낼 수 있습니다.

2. 빠른 작가 (병렬 비트 예측 - Parallel Bitwise Prediction)

이미지가 그 0과 1의 코드로 변환되면, 로봇은 이를 하나씩 써 내려가야 합니다.

  • 문제점: 이미지를 비트 단위로 하나씩 쓰는 것은 굉장히 느립니다. 마치 소설을 한 글자씩 쓰고, 다음 글자를 쓰기 전에 잉크가 마르기를 기다리는 것과 같습니다.
  • UniAR의 해결책: 로로봇은 비트를 하나씩 쓰는 대신, 비트 그룹을 동시에 씁니다.
    • 비유: 한 번에 한 글자를 치고 기다리던 타자수를 상상해 보세요. 이제 그들은 한 번의 키 입력으로 단어 하나(또는 심지어 짧은 문장 하나)를 칠 수 있습니다. 이 덕분에 로봇은 코드를 한꺼번에 예측하여 이미지를 생성하는 속도가 32배 더 빨라졌습니다.

3. 화가 (비주얼 디코더 - The Visual Decoder)

로봇은 코드(0과 1)를 쓰지만, 그것이 아직 그림은 아닙니다. 그 코드를 실제 이미지로 바꿔줄 화가가 필요합니다.

  • 혁신: 로봇이 코드를 쓰면, 별도의 "화가"(디퓨전 트랜스포머)가 그 코드를 가져가 그림을 그립니다.
  • 효율성: 로봇은 모든 픽셀을 다 쓸 필요가 없습니다. 로봇은 이미지의 압축된 버전을 쓰고, 화가가 이를 고해상도 걸작(1024x1024 픽셀)으로 "업스케일링"합니다. 이를 통해 로봇의 작업은 가볍고 빨라집니다.

이 로봇은 무엇을 할 수 있나요?

로봇이 보고 그리는 데 동일한 "두뇌"와 "언어"를 사용하기 때문에, 몇 가지 멋진 능력을 갖게 되었습니다.

  • 자기 수정 및 대화: 당신이 로봇에게 "물 위에 배를 그려줘"라고 요청할 수 있습니다. 로봇은 그것을 그립니다. 그다음, 이미지를 다시 스캔할 필요 없이, "배가 파란색인가요?"라고 묻거나 "배경을 해변으로 바꿔줘"라고 요청할 수 있습니다. 로봇은 그림을 만들기 위해 사용했던 것과 같은 언어를 사용하기 때문에, 자신의 그림을 즉시 이해합니다.
  • 텍스트 렌더링: 이 로봇은 이미지 안에 텍스트를 넣는 것(예: 표지판에 "Hello"라고 쓰는 것)에 매우 능숙합니다. 이는 보통 AI에게 매우 어려운 작업입니다.
  • 편집: 지시 사항에 따라 사물을 교체하거나(예: 염소를 토끼로 바꾸기) 색상을 변경할 수 있습니다.

어떻게 학습했나요?

그들은 세 단계에 걸쳐 로봇을 가르쳤습니다:

  1. 읽기와 쓰기의 기초: 방대한 양의 데이터(텍스트와 이미지)를 입력하여 로봇이 보편적인 코드를 배우도록 했습니다.
  2. 미세 조정(Fine-Tuning): 로봇이 지시 사항을 잘 따를 수 있도록 고품질의 예시들을 보여주었습니다.
  3. 강화 학습(연습 단계): 로봇이 이미지를 그리도록 내버려 두고, 결과가 좋은지 확인한 뒤(보상 시스템 사용), 실수를 통해 배우도록 했습니다. 이 과정을 통해 텍스트 렌더링과 지시 이행 능력이 더욱 날카로워졌습니다.

핵심 요약

UniAR가 획기적인 이유는 "이해하는 것"과 "창조하는 것"을 별개의 작업으로 취급하지 않았기 때문입니다. 두 작업 모두에 하나의 효율적인 이진 기반 코드를 사용함으로써, 로봇은 이제 생각하고, 그리고, 자신의 그림에 대해 이야기하는 것을 하나의 연속적이고 매끄러운 흐름 속에서 수행할 수 있으며, 이전 모델들보다 더 빠르고 정확하게 동작합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →