ClickRemoval: An Interactive Open-Source Tool for Object Removal in Diffusion Models
ClickRemoval은 수동 마스크나 텍스트 프롬프트, 추가 학습 없이 사용자 클릭과 사전 학습된 Stable Diffusion 모델만을 활용하여 복잡한 장면에서 정밀한 객체 제거와 자연스러운 배경 복원을 가능하게 하는 오픈소스 대화형 도구입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
사진에 원치 않는 손님이 찍혀 있다고 상상해 보세요. 아마 배경에 낯선 사람이거나, 아름다운 풍경 속에 있는 쓰레기통, 혹은 식탁 위에 어지럽게 놓인 물건일 수도 있습니다. 보통 이런 것을 제거하려면 사진 편집 소프트웨어를 사용해 브러시로 물체를 조심스럽게 '덮어씌우는' 방식으로, 물체의 윤곽을 픽셀 단위로 따라가며 그려야 합니다. 이는 둔한 칼로 종이에서 특정 모양을 잘라내는 것과 같습니다. 시간이 오래 걸리고 손이 안정적이어야 하며, 한 군데라도 놓치면 자른 부분이 거칠고 추워 보입니다.
ClickRemoval은 게임을 바꾸는 새로운 무료 도구입니다. 마스크를 그리는 대신, 제거하려는 물체 위에 클릭하기만 하면 됩니다. 그것으로 끝입니다. 한 번의 클릭으로 컴퓨터가 무엇을 삭제하고 무엇을 유지할지 정확히 파악한 뒤, 빈 공간을 사실적인 배경으로 마법처럼 채워줍니다.
다음은 몇 가지 간단한 비유를 통해 작동 원리를 설명한 것입니다:
1. '클릭-지도' 번역기 (M2N2)
물체를 클릭하면 이 도구는 단순히 점 하나를 보는 것이 아니라, 그 물체의 개념을 이해합니다.
- 비유: 연못에 작은 돌을 떨어뜨려 보세요. 물결이 퍼지며 물이 어디까지 닿는지 정확히 보여줍니다. ClickRemoval도 이와 비슷하게 작동합니다. '물결 효과'(의미적 거리 지도라고 함) 를 사용하여 물체가 어디에서 끝나고 배경이 시작되는지 정확히 파악합니다. 물체의 모양이 기이하거나 부분적으로 가려져 있더라도 말입니다. 단 한 번의 클릭으로 물체의 세부적인 지도를 만들어내며, 당신은 한 줄도 그릴 필요가 없습니다.
2. '주의 전환기' (SGAR & SGAS)
도구가 물체가 무엇인지 파악하면, AI 모델에게 "이 부분은 무시하고 배경에 집중하라"고 알려야 합니다.
- 비유: AI 모델을 전체 그림에 매우 집중하는 화가라고 생각하세요. 보통 화가는 모든 것을 균등하게 봅니다. ClickRemoval은 스포트라이트 운영자처럼 작용합니다.
- SGAR (스포트라이트): 클릭한 물체의 조명을 어둡게 만들어 화가에게 "이건 그리지 마"라고 알려주고, 배경의 조명은 밝게 만들어 "여기에 속하는 것으로 채워라"라고 지시합니다.
- SGAS (디머 스위치): 물체에 대한 조명을 처음부터 끝까지 어둡게 유지하면 그림이 기이하거나 부자연스러워 보일 수 있습니다. 따라서 이 부분은 디머 스위치처럼 작동합니다. 작업 초기에는 '무시' 신호를 강하게 보낸 뒤, 그림이 거의 완성될수록 서서히 약해지도록 합니다. 이렇게 하면 배경이 자연스럽고 억지스럽지 않게 보입니다.
3. '혼합 셰프' (ARG)
마지막으로 도구는 새로운 배경과 기존 원본 이미지 중 얼마나 섞을지 결정해야 합니다.
- 비유: 스무디를 만든다고 상상해 보세요. 원본 과일 (배경) 과 새로운 맛 (AI 의 추측) 이 있습니다. ARG는 완벽한 비율을 결정하는 셰프입니다. 원본 사진과 매우 유사한 결과를 원한다면 셰프는 새로운 맛을 조금만 추가합니다. 완전한 변형을 원한다면 더 많이 추가하죠. 이렇게 하면 제거 효과의 강도를 사용자가 조절할 수 있습니다.
왜 이것이 중요한가요?
대부분의 다른 도구들은 특정 레시피 (텍스트 프롬프트) 와 미리 준비된 재료 목록 (수동 마스크) 이 있어야 요리를 할 수 있는 전문 셰프와 같습니다. 또한 특정 재료를 다루는 법을 배우기 위해 요리 학교 (추가 학습) 에 다녀야 하는 경우가 많습니다.
ClickRemoval은 이미 가지고 있는 어떤 레시피와도 작동하는 스마트 주방 조력자와 같습니다.
- 학습 불필요: 기존 AI 모델과 바로 작동합니다. 새로운 것을 가르칠 필요가 없습니다.
- 마스크나 텍스트 불필요: 윤곽을 그리거나 "개를 제거해"라고 입력할 필요가 없습니다. 클릭하기만 하면 됩니다.
- 오픈 소스: 제작자들은 전체 '레시피 책'(코드, 지침, 도구) 을 무료로 공유하여 누구나 사용할 수 있거나 이를 기반으로 구축할 수 있게 했습니다.
결과
제작자들은 이 도구를 다른 최상급 사진 편집기들과 비교 테스트했습니다.
- 품질: 테스트 결과, 마스크와 텍스트가 필요한 복잡한 방법과 동등하거나 더 나은 사진을 생성했습니다.
- 사용자 선호도: 일반인 (비전문가) 이 결과를 평가했을 때 ClickRemoval 을 가장 선호했습니다. 사용이 더 쉽고 결과가 더 자연스러워 보인다고 평가했습니다.
- 다용도성: 512x512 크기의 단순한 이미지부터 고해상도 1024x1024 이미지까지 다양한 유형의 사진에서 작동하며, 울타리 뒤에 숨어 있는 개를 제거하는 것과 같은 까다로운 상황도 처리합니다 ('부정 클릭'을 사용해 "울타리는 제거하지 말고 개만 제거해"라고 도구에게 지시하는 방식).
요약하자면, ClickRemoval은 사진 편집의 어려운 작업을 간단한 '포인트 앤 클릭' 경험으로 바꾸어, 컴퓨터를 가진 누구나 전문가 수준의 객체 제거를 가능하게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.