← 최신 논문
💻 computer science

InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion

InsertFuse는 카테고리별 전문가 학습을 삽입 온-폴리시 증류(Insertion On-Policy Distillation)를 통한 통합으로부터 분리함으로써 최첨단 성능을 달나며, 토큰 정렬 기하학적 컨디셔닝(Token-Aligned Geometry Conditioning), 영역 균형 플로우 매칭(Region-Balanced Flow Matching), 그리고 레퍼런스 CFG를 통해 공간 제어 및 참조 충실도를 향상시키는 다중 카테고리 참조 가이드 이미지 삽입을 위한 통합 프레임워크이다.

원저자: Guangzhao Li, Qingyan Wei, Huayu Zheng, Yige Zheng, Chaoyang Zhang, Jie Yang, Yunan Ding, Yan Tai, Siqi Luo, Xiaohong Liu

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guangzhao Li, Qingyan Wei, Huayu Zheng, Yige Zheng, Chaoyang Zhang, Jie Yang, Yunan Ding, Yan Tai, Siqi Luo, Xiaohong Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 섬세한 수플레부터 푸짐한 스튜까지 무엇이든 요리할 수 있는 마스터 셰프라고 상상해 보십시오. 이제 누군가 당신에게 단 하나의 요리로, 같은 냄비와 같은 조리법을 사용하여 동시에 완벽한 수플레이자 완벽한 스튜를 만들어 달라고 요청한다고 상상해 보십시오. 시도는 해볼 수 있겠지만, 그 결과는 아마도 눅눅한 엉망진창이 될 것입니다. 스튜에 필요한 열기는 수플레의 섬세한 부풀어 오름을 망칠 것이고, 맛 또한 서로 충돌할 것이기 때문입니다. 이것이 바로 컴퓨터 과학자들이 인공지능(AI)에게 사진 편집을 가르칠 때 직면하는 종류의 문제입니다.

AI의 세계에서 '확산 모델(diffusion models)'은 마치 이 마스터 셰프와 같습니다. 이들은 무작위적인 노이로제(TV의 백색 소음 같은 것)를 단계적으로 선명한 이미지로 바꾸며 이미지를 생성하거나 변경하는 매우 똑똑한 시스템입니다. 최근 이 모델들은 우리가 "이 의자에 고양이를 놓아줘"라거나 "하늘을 노을로 바꿔줘"라고 요청할 수 있을 정도로 정교해졌습니다. 하지만 문제가 하나 있습니다. 서로 다른 유형의 편집은 매우 다른 기술을 필요로 합니다. 손가락에 아주 작은 반지를 끼우는 것은 미세하고 섬세한 정밀함이 필요합니다. 반면, 장면 속에 사람 전체를 넣는 것은 그 사람의 몸이 어떻게 굽혀지는지, 옷이 어떻게 보이는지를 이해해야 합니다. 하나의 단일 AI 모델에게 이 모든 서로 다른 작업들을 한꺼번에 잘 해내라고 가르치려는 것은, 마치 그 셰프에게 수플레와 스튜를 동시에 요리하라고 요구하는 것과 같습니다. 그러면 AI는 혼란에 빠지고, 결과물은 이상하거나 흐릿하게 보일 수 있습니다.

여기서 InsertFuse라는 새로운 논문이 등장합니다. 상하이 교통 대학교 팀을 비롯한 연구진은 기존의 AI 셰프를 훈련시키는 방식에 문제가 있었다는 것을 깨달았습니다. 한 모델에게 모든 것을 한꺼번에 배우라고 강요하는 대신, 그들은 영리한 2단계 시스템을 구축했습니다. 먼저, 각기 다른 재료를 전문으로 하는 다섯 명의 '전문가' 셰프를 훈련시켰습니다. 액세서리(보석 등), 동물, 의류, 일반 사물, 그리고 인간을 위한 전문가가 각각 따로 있습니다. 각 전문가는 자신의 특정 영역에 특화된 마스터가 되어, 다른 영역에 방해받지 않고 해당 카테고리의 독특한 특징들을 정확하게 다루는 법을 배웠습니다.

하지만 다섯 명의 셰프를 두는 것은 단 하나의 앱으로 모든 것을 하고 싶을 때 번거로운 일입니다. 그래서 연구팀은 **삽입 온-폴리시 증류(Insertion On-Policy Distillation, IOPD)**라는 특별한 훈련 기법을 발명했습니다. 이것은 다섯 명의 전문가가 작업하는 모습을 지켜보는 '학생' 셰프라고 생각하면 됩니다. 학생은 단순히 레시피를 암기하는 것이 아니라, 직접 요리를 연습하며 막힐 때마다 정확히 다음에 어떤 동작을 해야 할지 적절한 전문가에게 질문합니다. 만약 학생이 머리에 모자를 씌우려 한다면 '액세서리 전문가'에게 묻습니다. 만약 사람을 방 안에 넣으려 한다면 '인간 전문가'에게 묻습니다. 이처럼 적재적소에 맞는 전문가로부터 배움으로써, 학생은 한꺼번에 모든 것을 배우려다 혼란에 빠지는 대신, 어떤 삽입 작업도 완벽하게 처리할 수 있는 통합된 마스터 셰프가 됩니다.

학생 셰프가 단순히 위치를 짐작하지 않도록, 연구팀은 두 가지 특별한 도구도 추가했습니다. 첫 번째는 **토큰 정렬 기하학적 조건화(Token-Aligned Geometry Conditioning)**로, 이는 AI에게 새로운 물체가 들어갈 위치에 대한 정밀한 GPS 지도와 같은 역할을 하여, 배경 속으로 번지지 않고 구멍의 모양에 딱 맞게 들어갈 수 있도록 보장합니다. 두 번째는 **영역 균형 플로우 매칭(Region-Balanced Flow Matching)**으로, 이는 공정한 심판 역할을 합니다. 일반적인 훈련에서는 화면의 대부분을 차지하는 거대한 배경(예: 벽) 때문에 AI가 아주 작은 물체(예: 팔찌)를 무시할 수 있습니다. 이 새로운 도구는 AI에게 "비록 팔찌가 작더라도 매우 중요하니, 여기에 더 각별히 주의를 기울여라"라고 말하여 작은 디테일이 사라지지 않도록 합니다.

마지막으로, 삽입된 물체가 참조 사진과 똑같이 보이도록(그 고유한 질감과 정체성을 유지하도록), 연구팀은 **참조 CFG(Reference CFG)**라는 기법을 사용했습니다. 이것은 학생 셰프에게 내리는 엄격한 규칙과 같습니다: "이 셔츠의 원래 패턴을 아무리 늘리더라도 반드시 그대로 유지해야 한다."

결과는 인상적입니다. 연구진이 이 새로운 '학생' 모델을 다른 최고의 AI 편집기들과 비교 테스트했을 때, 거의 모든 카테고리에서 승리했습니다. 이 모델은 원래의 물체를 더 잘 보존하고, 더 정확하게 배치하며, 배경을 자연스럽게 유지했습니다. 사람들이 가장 좋아하는 이미지를 투표하는 사용자 연구에서도 InsertFuse는 50% 이상의 선택을 받으며 경쟁 모델들을 압도했습니다. 이 논문은 특정 기술을 배우는 과정과 이를 결합하는 과정을 분리함으로써, 우리가 전문성과 범용성을 모두 갖춘 AI를 구축할 수 있으며, 이미지 편집의 "눅눅한 스튜" 문제를 완전히 해결할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →