SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision
픽셀 수준의 스케치 기반 이미지 편집을 위한 고품질 벤치마크의 부족을 극복하기 위해, 본 논문은 멀티모달 거대 언어 모델을 활용하여 지시어 기반의 쿼드러플렛(quadruplets)을 합성하고 협업적 공간-의미 학습 접근 방식을 통해 정밀하고 의미적으로 정렬된 국소 변형을 달성하는 SI-Data 데이터셋과 SI-Edit 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 무엇이든 그릴 수 있는 마법 같은 화가에게 아주 구체적이고 작은 지시를 내리려 한다고 상상해 보세요. 당신은 이렇게 말할 수도 있을 것입니다. "저 꽃줄기가 매끄러운 S자 모양으로 휘어지게 만들어줘." 하지만 여기 문제가 있습니다. 그 화가는 약간 공상에 빠지는 경향이 있습니다. 그들은 "S자 모양"이라는 말을 듣고 줄기의 엉뚱한 부분을 휘게 하거나, 식물 전체를 꽃 대신 뱀으로 바꿔버릴 수도 있습니다. 이것이 바로 **인공지능(AI)**을 이용한 이미지 편집의 과제입니다. 과학자들은 수백만 장의 사진을 학습한 디지털 화가와 같은 강력한 "생성 모델"을 구축했지만, 꽃잎 하나를 구부리거나 불꽃을 늘리는 것과 같이 아주 작고 정밀한 변화를 요구할 때 이 디지털 화가들은 종종 혼란에 빠집니다. 그들은 그림의 엉뚱한 부분을 바꾸거나, 당신이 정확히 어떻게 바꾸기를 원하는지 오해하곤 합니다.
이를 해결하기 위해 연구자들은 두 가지 주요 기술을 시도했습니다. 하나는 화면에 선을 그려서 어디를 구부려야 할지 보여주는 스케치를 주는 것입니다. 다른 하나는 "여기를 구부려"라고 쓰는 것과 같은 텍스트 지시를 주는 것입니다. 하지만 각 기술에는 결함이 있습니다. 스케치만 주면 화가는 무엇을 해야 할지 모릅니다(잎을 복사해야 할까요, 옮겨야 할까요, 아니면 그냥 구부려야 할까요?). 텍스트 지시만 주면 화가는 어디에 해야 할지 모릅니다. 이 논문인 SI-Edit는 화가가 스케치와 텍스트를 동시에 듣도록 가르침으로써, 마지막 픽셀까지 이미지를 재형성할 수 있는 초정밀 디지털 조각가처럼 행동하도록 하여 이 문제를 해결하고자 합니다.
문제점: "번역 오류"를 일으키는 화가
당신이 그림을 보고 있는 친구에게 그 그림을 설명하여 친구가 당신이 말하는 대로 그리게 하는 게임을 하고 있다고 상상해 보세요. 만약 당신이 "나무 가지를 휘게 해줘"라고 말한다면, 친구는 엉뚱한 가지를 휘게 하거나 아예 새로운 나무를 그려버릴 수도 있습니다. 이것이 현재의 텍 тек스트 지시만을 듣는 AI 도구들에서 발생하는 현상입니다. 그들은 "하늘을 파랗게 바꿔줘"와 같은 큰 변화에는 뛰어나지만, 아주 작고 정밀한 변화에는 서툽니다. 그들에게는 "공간적 닻(spatial anchor)", 즉 어떤 픽셀을 움직여야 하는지 알 수 있는 방법이 부족합니다.
반면에, 스케치(화면에 그린 선)만 준다면 AI는 어디에 그려야 할지는 알지만 무엇을 해야 할지는 모릅니다. 그 선이 잎을 움직이려는 것일까요? 복사하려는 것일까요? 아니면 그냥 구부리려는 것일까요? 명확한 지시가 없으면 AI는 잘못된 추측을 하게 되어, 잎이 갑자기 자기 자신의 복사본으로 변하거나 줄기가 사라져 버리는 것과 같은 이상한 결과를 초래할 수 있습니다.
이 논문의 저자들은 완벽한 픽셀 수준의 제어를 얻으려면 지도(스케치)와 목적지(텍스트)가 모두 필요하다는 것을 깨달았습니다. 하지만 큰 장애물이 있었습니다. 누구도 이 두 가지를 완벽하게 결합하는 AI를 위한 훈련 매뉴얼을 만든 적이 없었다는 점입니다.
해결책: 새로운 훈련 매뉴얼과 새로운 화가
이를 해결하기 위해 팀은 먼저 SI-Data라고 불리는 거대하고 고품질인 훈련 데이터셋을 구축해야 했습니다. 이것을 AI를 위한 거대한 요리책이라고 생각하세요. 단순히 AI에게 텍text 설명과 함께 "전"과 "후"의 사진을 보여주는 대신, 그들은 네 가지 요소가 세트로 구성된 **쿼드러플릿(quadruplets)**을 만들었습니다:
- 원본 이미지 (시작점).
- 대상 이미지 (편집 후의 모습).
- 스케치 (정확한 형태 변화를 보여주는 단순한 선).
- 지시문 (AI에게 무엇을 할지 알려주는 텍스트).
그들은 이를 손으로 직접 그리지 않았습니다. 그것은 시간이 너무 오래 걸리기 때문입니다. 대신 영리한 자동화 파이프라인을 사용했습니다. 그들은 아름다운 사진을 가져와서, 똑똑한 AI(Qwen3-VL)에게 특정 편집 지시(예: "텐트를 늘려라")를 고안하게 한 다음, 또 다른 AI(Nano Banana Pro)를 사용하여 실제로 그 변화를 만들었습니다. 그런 다음, **광학 흐름(optical flow)**이라는 수학적 기법을 사용하여 원본에서 새로운 이미지로 픽셀이 어떻게 이동했는지 관찰함으로써 자동으로 "스케치"를 그렸습니다. 이를 통해 스케치와 텍스트 지시를 결합하여 정밀한 편집을 수행하는 완벽한 예시 6,500개를 확보했습니다.
SI-Edit의 작동 원리: "동일 위치" 트릭
이 새로운 데이터셋을 바탕으로, 그들은 SI-Edit라는 새로운 편집 도구를 만들었습니다. 이 도구는 "협력적인" 화가가 되도록 설계되었습니다. 이 도구는 텍스트나 스케치 중 하나만 보는 것이 아니라, 둘을 함께 봅니다.
논문은 이것이 작동하게 하기 위한 두 가지 주요 기술을 소개합니다:
- "태스크 트리거(Task-Trigger)" 토큰: 그들은 모든 지시문의 시작 부분에 **
<sk>**라고 쓰인 특별한 비밀 코드 단어를 추가했습니다. 이것은 화가가 그림을 시작하기 전에 울리는 종소리와 같습니다. AI가 "종소리"(<sk>)를 들으면, "아, 이제 곧 보게 될 스케치 선들에 각별히 주의를 기울여야겠구나"라고 인지합니다. 이는 AI가 스케치를 단순한 장식이 아니라 엄격한 규칙으로 이해하도록 돕습니다. - 동일 위치 인코딩 (Same Position Encoding, SPE): 이것이 가장 중요한 부분입니다. 당신이 유리판 위에 그림을 따라 그리고 있다고 상상해 보세요. 아래에는 원본 그림이 있고 그 위에는 당신의 스케치가 있습니다. 만약 이 둘을 완벽하게 맞추지 못하면, 당신의 그림은 어긋나게 됩니다. 일반적인 AI는 스케치와 원본 이미지를 두 개의 별개 사물로 취급하며, 이로 인해 서로 "표류(drifted)"하게 됩니다. SI-Edit는 AI가 스케치와 원본 이미지를 마치 뇌 속에서 정확히 같은 위치에 있는 것처럼 취급하도록 강제합니다. 스케치를 이미지 위에 겹쳐 놓고 AI에게 "이 두 가지는 동일한 좌표에 있다"라고 말하는 것입니다. 이는 AI가 어디에서 굽혀져야 하는지에 대해 혼란을 겪는 것을 방지합니다.
연구 결과: 픽셀 수준의 정밀도
팀은 SI-Edit를 SketchEdit, MagicQuill, FramePainter와 같은 다른 인기 있는 도구들과 비교 테스트했습니다. 결과는 명확했습니다. SI-Edit가 규칙을 훨씬 더 잘 따랐습니다.
- 기하학적 정밀도: AI가 스케치 선을 얼마나 잘 따랐는지 측정했을 때, SI-Edit는 4.292(낮을수록 좋음)의 점수를 기록한 반면, 그다음으로 우수한 도구인 MagicQuill은 7.434를 기록했습니다. 이는 SI-Edit의 굽힘과 곡선이 사용자가 실제로 그린 것에 훨씬 더 가깝다는 것을 의미합니다.
- 의미론적 이해: AI가 실제로 텍스트가 말하는 바(예: "늘리기" vs "복사하기")를 수행했는지 확인했을 때, SI-Edit는 CS라는 지표에서 다른 모든 방법을 제치고 0.0174를 기록했습니다.
- 사용자 선호도: 실제 사람들이 결과를 보았을 때, 시각적 일관성, 정확성, 이미지 품질 중 무엇을 보느냐에 따라 SI-Edit를 다른 도구보다 81.3%에서 94.8% 더 선호했습니다.
또한 논문은 이 도구가 단순히 무언가를 구부리는 것 이상을 할 수 있음을 보여주었습니다. 예를 들어, 무술가가 자세를 바꾸는 것처럼 사람의 포즈를 바꿀 수 있으며, 이때 얼굴과 옷은 똑같이 유지됩니다.
핵심 요약
저자들은 명확한 지도(스케치)와 명확한 목적지(텍스트)를 결합하고, AI가 이 둘을 하나의 통합된 가이드로 다루도록 가르침으로써, 이미지의 나머지 부분을 망가뜨리지 않고도 작고 복잡한 변화를 처리할 수 있는 정밀한 이미지 편집 도구를 마침내 얻을 수 있다고 제안합니다. 그들은 단순히 더 나은 도구를 만든 것이 아니라, AI가 이를 수행하는 방법을 가르치는 최초의 공개 데이터셋을 구축하여 미래의 연구자들이 더욱 똑똑한 디지털 화가를 만들 수 있는 길을 열었습니다. 논문은 "공간적 모호성"(어디를 편집해야 할지 모름)과 "의미론적 맹목성"(무엇을 편집해야 할지 모름)이 주요 장애물이었으나, 이러한 협력적 접근 방식이 픽셀 단위의 완벽한 편집을 향한 길을 성공적으로 열었음을 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.