← 최신 논문
🤖 machine learning

KVAE: Family of Tokenizers for Multimodal Generative Models

이 논문은 오디오, 이미지 및 비디오를 위한 고성능 토크나이저 제품군인 KVAE를 소개하며, 이는 최신 오픈 소스 모델과 대등하거나 이를 능가하는 재구성 및 생성 품질을 달성하는 동시에, 텍스트 조건부 멀티모달 생성 모델에서의 활용을 용이하게 하기 위해 포괄적인 학습 세부 정보와 코드를 제공한다.

원저자: Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov
게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 걸작을 그리거나, 교향곡을 작곡하거나, 영화를 감독하도록 가르치고 싶다고 상상해 보세요. 로봇에게 그저 가공되지 않은 혼란스러운 픽셀 덩어리나 수십억 개의 음파를 던져줄 수는 없습니다. 그것은 벽에 벽돌을 던지며 벽돌이 붙기를 바라는 것과 같습니다. 로봇에게는 설계도가 필요합니다. 인공지능의 세계에서 이 설계도를 '토크나이저(tokenizer)'라고 부릅니다. 토크나이저를 고해상도 비디오나 복잡한 오디오 트랙을 AI가 실제로 이해하고 다룰 수 있는 깔끔하고 작은 명령어 세트인 '잠재 공간(latent space)'으로 압축하는 아주 똑똑한 번역기라고 생각하세요.

오랫동안 과학자들은 이 번역기의 가장 중요한 역할이 완벽한 복사기가 되는 것이라고 생각했습니다. 즉, 사진을 주면 원래 모습 그대로 다시 그려낼 수 있어야 한다는 것입니다. 하지만 새로운 아이디어가 떠오르고 있습니다. 최고의 번역기는 완벽하게 복사하는 것이 아니라, AI가 새로운 것을 꿈꿀 수 있도록 정보를 조직화하는 방식일지도 모른다는 생각입니다. 이것은 지도를 완벽하게 복사하는 복사기와, 여행자가 새로운 목적지를 쉽게 찾을 수 있도록 명확하고 논리적인 도로를 새로 그리는 지도 제작자의 차이와 같습니다. 이 논문은 바로 그 질문을 파고들며, AI가 더 나은, 더 빠르고, 더 창의적인 콘텐츠를 만들 수 있도록 이미지, 비디오, 사운드를 위한 이러한 번ators를 구축하는 방법을 탐구합니다.


KVAE 패밀리: AI 크리에이터를 위한 궁극의 번역기

칸딘스키 랩(Kandinsky Lab) 팀이 만든 새로운 도구 세트인 KVAE 패밀리를 만나보세요. 이들은 원시 데이터(비디오 클립이나 노래와 같은)와 이를 생성하는 AI 모델 사이의 가교 역할을 하도록 설계된 특화된 "토크나이저"입니다. 연구팀은 최종 AI 창작물의 품질이 이 다리가 얼마나 잘 구축되었는지에 크게 달려 있다는 것을 깨달았습니다. 다리가 불안정하면 AI는 비틀거리고, 매끄럽고 잘 조직되어 있으면 AI는 빠르게 달리고 놀라운 것을 만들어낼 수 있습니다.

이 논문은 각기 다른 유형의 미디어에 맞춤 설계된 세 가지 주요 멤버를 소개합니다:

  1. KVAE-Audio: 고품질 오디오의 표준인 48kHz에서 작동하는 사운드용 번역기입니다. 오디오를 64개 채널의 압축된 형식으로 압축하여, AI가 음악이나 음성의 뉘앙스를 놓치지 않고 전대역폭 사운드를 듣고 생성할 수 있게 합니다.
  2. KVAE-3D: 비디오를 위한 번역기 세트입니다. 이들은 비디오의 까다로운 "시간" 차원을 처리하도록 설계되었으며, AI가 움직임을 이해할 수 있도록 프레임을 압축합니다. 두 가지 크기로 제공됩니다: 시간을 4배, 공간을 16배 압축하는 모델과 훨씬 더 공격적으로 압축하는 모델이 있습니다.
  3. KVAE-2D: 정지 이미지를 위한 번역기로, AI가 작업하기 용이하도록 8배의 비율로 압축하여 깨끗하고 효율적인 표현을 만듭니다.

거대한 발견: 완벽한 복사가 전부가 아니다

이 논문에서 가장 흥eric한 발견은 다소 직관에 어긋나는 것입니다. 오랫동안 이러한 번역기들의 목표는 완벽한 재구성(reconstruction), 즉 이미지를 입력하면 출력이 입력과 똑같아야 한다는 것이었습니다. 하지만 KVAE 팀은 완벽한 재구성을 쫓는 것이 오히려 함정이 될 수 있다는 것을 발견했습니다.

그들은 토크나이저가 이미지를 복사하는 데는 뛰어나지만, AI가 새로운 이미지를 생성하는 데는 형편없을 수 있다는 것을 발견했습니다. 이는 교과서를 글자 하나 틀리지 않고 암기할 수는 있지만, 새로운 주제로 에세이를 쓰는 데는 실패하는 학생과 같습니다. 논문은 그 비결이 그들이 **"확산 가능성(diffusability)"**이라고 부르는 것에 있다고 제안합니다. 이것은 "압축된 데이터가 AI가 가지고 놀기에 얼마나 쉬운가?"를 의미하는 멋진 표현입니다.

이를 측정하기 위해 팀은 **상관 감소 기울기(Correlation Decay Slope, CDS)**라는 영리한 테스트를 개발했습니다. 격자 위의 점 패턴을 보고 있다고 상상해 보세요. 만약 점들이 이웃한 점들과 너무 비슷하다면, 그 패턴은 "끈적거려서" AI가 움직이기 어렵습니다. 만약 격자를 따라 이동할 때 점들이 특정 방식으로 예측 가능하게 변한다면, 그 패턴은 "흐름이 좋아" AI가 조작하기 쉽습니다. KVAE 모델은 설령 그것이 원래 이미지를 완벽하게 복사하는 데 최선이 아닐지라도, 이러한 "흐름이 좋은" 특성을 갖도록 튜닝되었습니다.

결과: 더 나은 영화, 음악, 그리고 예술

팀이 이 새로운 번역기들을 기반으로 AI 모델을 훈련시켜 테스트했을 때, 결과는 인상적이었습니다.

  • 이미지의 경우: 텍스트로부터 이미지를 생성하기 위해 KVAE-2D를 사용했을 때, AI는 다른 인기 있는 오픈 소스 도구들로 만든 이미지보다 인간이 평가했을 때 더 높은 품질과 프롬프트에 대한 높은 충실도를 가진 이미지를 생성했습니다. 흥미롭게도, 이미지를 복사하는 데 가장 뛰어났던 모델이 오히려 KVAE 모델보다 더 낮은 품질의 새로운 이미지를 생성했는데, 이는 재구성이 전부는 아니라는 점을 증명합니다.
  • 비디오의 경우: KVAE-3D 모델은 AI가 더 자연스럽게 움직이고 더 선명하게 보이는 영상을 생성하도록 도왔습니다. 선도적인 비디오 토크나이저들과의 직접 비교 테스트에서, KVAE 모델은 특히 텍스트 설명과의 일치도 측면에서 더 빠른 훈련 시간과 더 나은 최종 영상을 이끌어냈습니다.
  • 오디오의 경우: KVAE-Audio 토크나이저는 사운드의 게임 체인저였습니다. 소리를 저품질의 조각으로 잘라버리거나 "위상(phase, 음파의 타이밍)"을 놓치는 다른 도구들과 달리, KVAE-Audio는 48kHz의 전체 품질을 유지했습니다. 음악과 음성을 생성할 때, KVAE-Audio는 128개 또는 256개의 채널을 사용하는 경쟁 모델들보다 더 적은 채널(64개)을 사용했음에도 불구하고 인간이 더 선호하는 소리를 만들어냈습니다.

트레이드오프: 왜 적은 것이 더 많을 수 있는가

논문의 핵심 교훈 중 하나는 균형에 관한 것입니다. 팀은 번역기를 더 "넓게"(채널 추가) 만들어 보는 실험을 통해 그것이 도움이 되는지 확인했습니다. 비디오의 경우, 번역기를 넓게 만드는 것이 복사와 생성 모두에 도움이 된다는 것을 발견했습니다. 하지만 오디오의 경우, 적절한 지점이 있었습니다. 만약 오디오 번역기를 너무 넓게(너무 많은 채널) 만들면, 복사는 약간 좋아질지 몰라도 AI가 새로운 소리를 생성하는 법을 배우는 데 어려움을 겪었습니다.

결국 오디오의 경우, 64개 채널이 AI가 빠르게 학습하고 고품질의 소리를 생성할 수 있는 "골디락스(Goldilocks, 딱 적당한)" 존이라는 것을 알게 되었습니다. 이는 이러한 번역기들에 단 하나의 "최고의" 크기가 있는 것이 아니라, 비디오, 이미지, 사운드 중 무엇을 다루느냐와 AI가 얼마나 많은 정보를 처리해야 하느냐에 따라 달라진다는 것을 시사합니다.

요약

KVAE 팀은 단순히 더 나은 번역기를 만든 것이 아니라, 왜 어떤 번역기가 다른 것보다 창의성에 더 효과적인지 그 이유를 밝혀냈습니다. 단순히 얼마나 완벽하게 복사하느냐가 아니라 데이터가 어떻게 조직되어 있는지(확산 가능성)에 집중함으로써, 그들은 AI가 고품질이면서도 인간의 지시와 더 잘 부합하는 미디어를 생성할 수 있도록 돕는 도구를 만들었습니다.

가장 좋은 점은 무엇일까요? 그들은 이 비밀을 혼자 간직하지 않았습니다. 코드와 모델이 오픈 소스로 공개되어 있어, 누구나 이 도구들을 사용하여 자신만의 AI 예술, 음악, 비디오 생성기를 만들 수 있습니다. 이는 AI의 세계에서 때로는 가장 중요한 단계가 단순히 로봇을 더 똑똑하게 만드는 것이 아니라, 로봇에게 세상을 항해할 수 있는 더 나은 지도를 주는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →