← 최신 논문
💻 computer science

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Oxygen-TryOn은 전용 데이터 엔진과 강화 학습을 포함한 3단계 훈련 파이프라인을 활용하여 다양한 아이템과 시나리오에 대해 최첨단 수준의 사실적인 가상 피팅을 구현함으로써 선도적인 독점 및 오픈 소스 시스템 모두를 능가하는 통합된 패션 특화 파운데이션 모델입니다.

원저자: Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

잡지에서 본 옷, 친구의 사진, 혹은 길거리에서 찍힌 스냅샷 속 의상을 옷을 한 번 입어보러 매장에 가지 않고도 즉석에서 입어볼 수 있는 세상을 상상해 보십시오. 이것이 바로 사람들이 새로운 옷을 디지털로 입혀주는 인공지능의 한 분야인 '가상 피팅(virtual try-on)'의 꿈입니다. 오랫동안 이러한 디지털 재단사들은 서툰 견습생 같았습니다. 한 번에 한 종류의 셔츠만 다룰 수 있었고, 사람의 원래 모습이 어떠했는지 자주 잊어버렸으며, 사람이 움직일 때 옷감이 어떻게 보여야 하는지 구현하는 데 어려움을 겪었습니다. 그들은 이 작업을 단순히 빈 공간을 새로운 질감으로 채우는 '색칠 공부'처럼 취급했습니다. 하지만 만약 AI가 패션을 실제로 '이해'할 수 있다면 어떨까요? 모자는 머리에 가야 하고, 가방은 어깨에 걸쳐져야 하며, 재킷은 스웨터 위에 그냥 얹혀 있는 것이 아니라 스웨터 위로 자연스럽게 드레이프되어야 한다는 것을 안다면 어떨까요? 이것이 바로 연구자들이 해결하고자 하는 과제입니다. 즉, 단순히 이미지를 이어 붙이는 것이 아니라 옷, 액세서리, 그리고 사람이 실제 세상에서 어떻게 상호작용하는지를 진정으로 '이해'하는 AI를 구축하는 것입니다.

여기에 Oxygen AIGC 그룹과 JD의 Joy Future Academy가 만든 새로운 '패션 네이티브(fashion-native)' 파운데이션 모델인 Oxygen-TryOn이 등장했습니다. 이 모델을 단순히 패션 작업을 하도록 속여야 하는 일반적인 사진 편집기가 아니라, 스타일의 세계에서 태어나고 자란 전문 재단사라고 생각하십시오. 다른 AI 시스템들이 모호한 지시를 주어 일반 목적의 이미지 편집기가 가상 피팅을 억지로 수행하도록 유도할 때(이는 종-종 가짜 단추를 만들어내거나 사람의 얼굴을 잃어버리는 등의 환각 현상을 초래합니다), Oxygen-TryOn은 처음부터 사람에게 옷을 입히기 위해 특화되어 구축되었습니다. 이 모델은 피팅을 단순한 '빈칸 채우기' 퍼즐이 아니라, AI가 각 아이템이 무엇인지, 어디에 속하는지, 그리고 착용했을 때 어떻게 보여야 하는지를 파악해야 하는 복잡한 추론 작업으로 취급합니다.

연구진은 이 모델에 방대한 양의 엄선된 패션 데이터 라이브러리를 입력하고 3단계 '트레이닝 레시피'를 통해 학습시킴으로써, 이전 방식들보다 훨씬 더 사실적이고 일관된 결과를 얻을 수 있다는 것을 발견했습니다. 이 모델은 한 사람의 사진 한 장을 가져와 단일 아이템을 입힐 수도 있고, 한 사진의 셔츠, 다른 사진의 신발, 세 번째 사진의 가방, 네 번째 사진의 모자처럼 혼란스러운 참조 이미지들을 조합하여 하나의 일관된 착장을 만들어낼 수도 있습니다. 또한 깨끗한 제품 사진부터 이미 아이템을 착용하고 있는 '현장(in-the-wild)' 스냅샷까지 모든 상황을 처리할 수 있습니다. 결정적으로, 이 모델은 사람의 정체성(얼굴, 체형, 포즈)과 옷의 세부 디테일(질감, 로고, 패턴)을 높은 충실도로 보존합니다.

실험에서 Oxygen-TryOn은 단순히 잘 해내는 수준을 넘어 경쟁 모델들을 압도했습니다. 표준 테스트에서 이 모델은 강력한 오픈 소스 모델들과 Nano Banana Pro, GPT-Image-2, Seedream5 Lite와 같은 최고 수준의 독점 시스템들을 제치고 최첨단(state-of-the-art) 성적을 달성했습니다. 특히 여러 아이를 겹쳐 입히는 '멀티 아이템' 시나리오에서 혼란을 겪거나 디테일을 놓치지 않고 성공적으로 수행하며 빛을 발했습니다. 연구팀은 또한 이 모델이 동일한 생성 과정 내에서 사람의 포즈나 배경을 바꾸는 것과 같은 추가 지시를 따를 수 있을 만큼 유연하다는 것을 보여주었습니다.

이러한 성공의 비결은 단순히 모델의 구조뿐만 아니라, 팀이 모델에 공급하기 위해 구축한 '데이터 엔진'에 있었습니다. 그들은 단순히 인터넷을 긁어모은 것이 아니라, 대규모로 고품질의 피팅 데이터를 수집, 필터링, 주석 달기 및 제조하는 파이프라인을 구축했습니다. 그런 다음 모델을 세 단계로 훈련시켰습니다. 첫째, 패션의 기초를 배우는 '지속적 사전 학습(continued pre-training)', 둘째, 입히는 작업의 숙련도를 높이는 '지도 미세 조정(supervised fine-tuning)', 마지막으로 '강화 학습(reinforcement learning)' 단계입니다. 이 마지막 단계는 마치 엄격한 패션 비평가(하이브리드 보상 시스템)가 모델의 결과물을 채점하는 것과 같아서, 어색한 주름이나 정체성 변화와 같은 미세한 오류를 수정하도록 가르칩니다. 그 결과, 풀 바디 착장에서부터 상반신 액세서리까지 다양한 시나리오를 처리할 수 있으며, 애니메이션 캐릭터나 조각상 같은 비인간 대상에도 작동하여, 특정 사진을 단순히 암기하는 것이 아니라 무언가를 착용하는 일반적인 규칙을 학습했음을 증명했습니다.

요약하자면, Oxygen-TryOn은 옷이 어떻게 보여야 하는지 '추측'하는 것에서 옷이 어떻게 맞아야 하는지를 '추론'하는 것으로의 전환을 의미합니다. 이는 특정 도메인에 특화된 모델을 구축하고 고품질의 구조화된 데이터로 훈련함으로써, 더 정확하고 실제 온라인 쇼핑과 같은 현실 세계의 응용 분야에 유용한 AI를 만들 수 있음을 시사합니다. 현재 이 모델은 기본 아키텍처로 인해 한 번에 4개 이상의 참조 아이템을 처리하는 데 한계가 있지만, 이 논문은 진정한 범용 가상 피팅을 향한 길이 열려 있으며, 디지털 패션의 미래가 단 한 번의 스마트한 생성(generation)만큼 가까이 와 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →