Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
이 논문은 경량 프로젝터를 훈련시켜 스칼라 강도 값과 텍스트 지시문을 모델의 변조 공간(modulation space)으로 매핑함으로써, 속성별 훈련 없이도 다양한 작업에 걸쳐 미세한 편집부터 완전히 구현된 편집까지 사용자가 편집 강도를 부드럽고 연속적으로 제어할 수 있게 하는 지시 기반 이미지 편집 모델인 Kontinuous Kontext를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 말 한마디로 사진을 바꿀 수 있는 마법 지팡이를 들고 있다고 상상해 보세요. 당신이 "강아지를 고양이처럼 만들어줘"라고 말하면, 펑, 강아지의 얼굴이 고양이로 변합니다. 이것이 바로 생성형 AI를 기반으로 구축된 **지시 기반 이미지 편집(instruction-based image editing)**의 세계입니다. 이 컴퓨터 두뇌들은 수십억 개의 사진과 캡션을 학습하여, 새로운 그림을 처음부터 그려내거나 당신의 말에 따라 기존의 그림을 수정하는 법을 배웁니다. 오랫동안 이 마법사들은 한 가지 일밖에 할 수 없었습니다. 바로 당신의 명령을 글자 그대로 따르는 것이었죠. 만약 당신이 "파란색 재킷"을 요청했다면, 그들은 100% 파란색인 재킷을 내놓았습니다. 만약 "눈"을 요청했다면, 장면 전체가 눈보라로 변했습니다. 하지만 만약 당신이 아주 조금만 눈이 내리기를 원했다면 어떨까요? 혹은 재킷이 대체로 빨간색이지만 파란색 기운이 살짝 감돌기를 원한다면요? 지금까지 이 마법 지팡이는 조금 서툴렀습니다. 조절할 수 없는 온/오프(on/off) 스위치였지, 밝기를 조절하는 디머(dimmer)가 아니었습니다.
여기서 Kontinuos Kontext의 이야기가 시작됩니다. 연구진들은 그 투박한 온/오프 스위치를 부드러운 슬라이딩 디머로 바꾸고 싶어 했습니다. 그들은 단순한 질문을 던졌습니다. "AI에게 무엇을 바꿀 것인가뿐만 아니라, '얼마나 많이' 바꿀 것인가까지 가르칠 수 있을까?" 그들은 단순히 AI가 적절한 양을 추측하게 하는 것을 넘어, 사용자가 슬라이더를 드래ка그하여 노래의 볼륨을 높이거나 화면의 밝기를 조절하듯 이미지가 점진적으로 변하는 모습을 지켜볼 수 있기를 원했습니다. 이 논문은 AI에게 이러한 미세한 제어력을 부여하는 새로운 방법을 소개하며, 우리가 "아무 일도 일어나지 않음"에서 "완전히 변함"까지 단 하나의 부드러운 동작으로 편집의 강도를 조절할 수 있게 해줍니다.
문제점: "전부 아니면 전무"인 마법 지팡이
당신이 마법의 레시피 북을 가진 요리사라고 상상해 보세요. 만약 당신이 "매운 스프"를 요청하면, 책은 혀가 데일 정도로 뜨거운 스프를 내놓습니다. 만약 "순한 스프"를 요청하면, 물 같은 맛이 나는 스프를 내놓습니다. 당신은 "약간의 매콤함만 추가해줘"라고 요청할 수 없습니다. 현재의 이미지 편집 AI가 작동하는 방식이 바로 이와 같습니다. 당신이 "재킷을 털 소재로 바꿔줘"라는 텍스트 지시를 내리면, AI는 아무것도 하지 않거나 아니면 완전히 폭신폭신하게 변해버립니다. 중간 단계가 없습니다.
이를 해결하려는 이전의 시도들은 마치 모든 식재료마다 새로운 주방을 지으려는 것과 같았습니다. 어떤 과학자들은 머리카락 색을 바꾸기 위한 특수 모델을 훈련했고, 다른 이들은 날씨를 바꾸기 위해, 또 다른 이들은 사물의 모양을 바꾸기 위해 모델을 만들었습니다. 그것은 요리마다 다른 요리사를 두는 것과 같았습니다. 효과는 있었지만, 느리고 비용이 많이 들었으며, 기능들을 서로 조합하기가 어려웠습니다. 당신은 모든 요청을 처리할 수 있고 모든 변화의 강도를 제어할 수 있는 단 한 명의 유니버설 셰프가 필요했습니다.
해결책: AI를 위한 "볼륨 조절 노브"
Kontinuos Kontext(연속성을 뜻하는 'Continuous'와 맥락을 뜻하는 'Context'를 결합한 재치 있는 이름)를 만든 팀은 이미지 편집을 위한 유니버설 볼륨 조절 노브 역할을 하는 시스템을 구축했습니다. 이제 AI는 단순히 "파랗게 만들어"라는 지시를 듣는 대신, "얼마나 파랗게"를 나타내는 숫자와 함께 지시를 듣습니다.
AI를 노래를 연주하는 음악가라고 생각해 보세요. 텍스트 지시는 음악가에게 무엇을 연주할지 알려주는 악보입니다. 새로운 "슬라이더"는 볼륨 조 knob입니다. 과거에는 음악가가 노래를 최대 볼륨으로 연주하거나 무음으로 연주할 수만 있었습니다. 이제 Kontinuos Kontext와 함께라면, 당신은 노브를 0에서 10까지 돌릴 수 있습니다. 0일 때 노래는 무음입니다(이미지가 변하지 않음). 5일 때 음악은 부드럽고 잔잔합니다(미세한 편집). 10일 때는 록 콘서트가 됩니다(전체적인 변형). 마법은 0에서 10 사이의 전환이 갑작스러운 점프나 글리치 없이 완벽하게 부드럽다는 점입니다.
어떻게 AI에게 슬라이딩을 가르쳤는가
당신은 아마 이렇게 물을지도 모릅니다. "이 AI에게 슬라이딩을 가르칠 데이터를 어디서 얻었나요?" 결국, 실제 사람들은 보통 사진을 찍고, 약간 편집하고, 조금 더 편집하고, 완전히 편집한 뒤 그 모든 단계를 일일이 저장하지는 않기 때문입니다. 그런 종류의 데이터는 자연계에 존재하지 않습니다.
그래서 연구진들은 데이터 마법사가 되었습니다. 그들은 합성 데이터셋, 즉 가짜지만 현실적인 예시 라이브러리를 만들었습니다. 과정은 다음과 같습니다:
- 설정: 110,000장의 무작위 사진을 가져왔습니다.
- 명령: 스마트한 AI 어시스턴트를 사용하여 각 사진에 대해 "자동차를 우주선으로 바꿔라"와 같은 독특한 지시문을 작성했습니다.
- 전체 편집: 강력한 기존 AI(Flux Kontext라고 불림)를 사용하여 자동차를 우주선으로 만드는 전체 편집을 수행했습니다.
- 가교 역할: 이 부분이 까다로웠습니다. AI에게 자동차가 10%, 20%, 50%, 90% 정도의 우주선스러움을 가질 때 어떤 모습인지 보여줘야 했습니다. 그들은 한 장면에서 다른 장면으로 페이드 인/아웃되는 영상처럼, 이 사이의 이미지들을 만들기 위해 특별한 "모핑(morphing)" 도구를 사용했습니다.
- 정제: 모핑 도구는 완벽하지 않았습니다. 때때로 바퀴가 반만 있는 자동차나 덩어리처럼 보이는 우주선 같은 이상한 아티팩트(artifact)를 만들어냈습니다. 연구진은 전환이 부드럽지 않거나 이미지가 깨진 "나쁜" 예시들을 버리기 위해 엄격한 필터를 구축했습니다. 결과적으로 64,000개의 고품질 "편집 궤적(edit trajectories)"(시작부터 끝까지의 부드러운 경로)을 얻었습니다.
핵심 비결: "번역기" 프로젝터
핵심 발명품은 **프로젝터(projector)**라고 불리는 작고 가벼운 네트워크입니다. 메인 AI 모델을 거대하고 복잡한 오케스트라라고 생각해보세요. 텍스트 지시는 오케스트라에게 무엇을 연주할지 알려줍니다. 새로운 프로젝터는 슬라이더와 오케스트라 사이에 위치한 작고 정교한 번역기입니다.
슬라이더를 "0.5"(절반)로 밀면, 번역기는 오케스트라에게 그냥 "절반!"이라고 외치지 않습니다. 대신, 오케스트라의 지휘자(변조 공간, modulation space)에게 매우 구체적이고 정밀하게 조정된 지시를 속삭입니다. "좋아요, 파란색 재킷에 대한 이 특정 지시에 대해서는, 정확히 이만큼의 파란색을 적용하세요."라고 말이죠.
연구진은 만약 단순히 숫자를 텍스트 단어 속에 집어넣으려고 하면(예: "절반"이라는 토큰을 추가하는 방식), 음악이 튀거나 이상해진다는 것을 발견했습니다. 하지만 숫자를 변조 공간(modulation space)—AI가 이미지의 '분위기'를 제로하는 숨겨진 레이어—에 입력함으로써, 변화를 부드럽고 정밀하게 만들 수 있었습니다. 이는 볼륨을 바꾸기 위해 가수에게 소리를 지르는 것이 아니라, 앰프의 게인(gain) 노브를 직접 조절해야 한다는 사실을 깨닫는 것과 같습니다.
연구 결과 (그리고 한계점)
결과는 인상적이었습니다. 그들이 이 시스템을 다른 방법들과 비교 테스트했을 때, Kontinuos Kontext는 부드러움(smoothness) 측면에서 압도적인 승자였습니다.
- 경쟁 모델들: 다른 방법들은 고장 난 엘리베이터와 같았습니다. 1층에서 10층까지 올라가긴 하지만, 가끔 5층을 통째로 건너뛰거나 문이 엉뚱한 층에서 열리기도 했습니다. 어떤 방법들은 두 이미지를 단순히 "모핑"하려고 했지만, 그 과정에서 중간 단계에 기괴하고 흐릿한 괴물이 나타나기도 했습니다.
- 승자: Kontinuos Kontext는 부드러운 엘리베이터처럼 움직였습니다. 슬라이더가 0에서 1로 이동함에 따라 이미지는 점진적이고 논리적으로 변했습니다. 재킷이 갑자기 파랗게 변하는 것이 아니라, 서서히 더 많은 푸른 빛을 띠게 되었습니다. 눈 내리는 장면은 갑자기 툭 튀어나오는 것이 아니라, 눈송이가 천천히 나타나고 지면이 천천히 하얗게 변했습니다.
또한 이 논문은 이 방식이 특정 작업뿐만 아니라 모든 것에 작동한다는 것을 보여주었습니다. 드레스의 색을 바꾸든, 바위의 재질을 바꾸든(바위를 금처럼 보이게 함), 자동차의 모양을 바꾸든, 혹은 장면의 날씨 전체를 바꾸든, 동일한 슬라이더가 작동합니다. 이는 매우 중요한데, 왜냐하면 매번 다른 모델을 사용할 필요가 없음을 의미하기 때문입니다. 하나의 유니버설 모델이 이 모든 것을 처리할 수 있습니다.
하지만 저자들은 한계에 대해서도 솔직하게 밝혔습니다. 이 시스템은 색상이나 재질 변경과 같은 "연속적인" 편집에는 뛰어나지만, 자동차를 정확히 90도 회전시키는 것과 같이 매우 구체적이고 어려운 기하학적 변화를 요구할 경우, 기반이 되는 AI(Flux Kontext) 자체가 이를 어려워하기 때문에 가끔 어려움을 겪습니다. 또한, 슬라이더를 최대치 너머로(예: "120% 파란색") 밀려고 하면 시스템은 어떻게 해야 할지 몰라 100%에서 멈추거나 혼란에 빠집니다. 이것은 디머 스위치이지, 타임머신이 아닙니다.
이것이 왜 중요한가
이 논문은 우리가 "예 또는 아니오"의 AI 시대를 지나고 있음을 시사합니다. 우리는 "얼마나 많이?"의 시대로 진입하고 있습니다. 슬라이더를 제공함으로써, Kont이어ous Kontext는 인간의 복잡하고 창의적인 뉘앙스에 대한 욕구와 컴퓨터 코드의 경직되고 이진적인 성격 사이의 간극을 메워줍니다. 이는 이미지 편집을 AI가 적절한 양을 맞추기를 기도해야 하는 '운 게임'에서, 자신의 취향에 딱 맞게 조율할 수 있는 '정밀한 악기'로 탈바ord히킵니다.
연구진은 단순히 더 나은 도구를 만든 것이 아니라, "노브(knob)"를 통한 강도 제어가 이미 이 AI 모델들 안에 숨겨져 있으며, 단지 그것을 찾아낼 방법이 필요했을 뿐이라는 것을 보여주었습니다. 그저 올바른 열쇠를 만들어냈을 뿐입니다. 이제 AI에게 "완벽하게 만들어줘"라고 요청하는 대신, 드디어 "거의 완벽하게 만들어줘"라고 말하며 그것이 딱 들어맞는 과정을 지켜볼 수 있게 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.