← 최신 논문
💻 computer science

DuET: Dual Expert Trajectories for Diffusion Image Editing

DuET는 구조적 무결성을 유지하면서 타겟 지시사항에 더 잘 부합하도록 텍스트-투-이미지 단계를 일시적으로 거침으로써 확산 기반 이미지 편집을 향상시키는 학습이 필요 없는 추론 방법이며, 그 선택적 변형은 편집 충실도와 소스 보존 사이의 균형을 더욱 최적화한다.

원저자: Lidia Troeshestova, Alexander Ustyuzhanin, Sergey Kastryulin

게시일 2026-08-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lidia Troeshestova, Alexander Ustyuzhanin, Sergey Kastryulin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터와 대화하며 당신이 상상하는 무엇이든 그려달라고 요청할 수 있는 세상을 상상해 보세요. 수년 동안 과학자들은 마치 마법의 스케치북처럼 작동하는 "텍ext-to-image(텍스트 투 이미지)" 모델을 구축해 왔습니다. 당신이 "모자를 쓴 고양이"라고 입력하면 그들은 그것을 그려냅니다. 하지만 이미 존재하는 사진을 바꾸고 싶다면 어떻게 될까요? 예를 들어, 고양이를 강아지로 바꾸거나, 화창한 날을 폭풍우 치는 날로 바꾸고 싶을 때 말이죠. 여기서 "이미지 편집(image editing)" 모델이 등장합니다. 이 모델들은 당신의 원래 사진과 새로운 지시 사항을 받아, 바꾸지 말라고 요청한 부분은 정확히 그대로 유지하면서 사진을 다시 써 내려가려고 노력합니다.

까다로운 점은 이 이미지 편집 모델들이 매우 신중한 예술가와 같다는 것입니다. 이들은 작업하는 내내 원래의 사진에 매여 있기 때문에, 때때로 큰 변화를 주는 것을 너무 두려워합니다. 만약 당신이 작은 집을 거대한 성으로 바꿔달라고 요청한다면, 그들은 집을 약간 더 크게 만들 뿐이며, 나머지 장면은 이상하거나 과거에 머물러 있는 것처럼 보이게 만듭니다. 그들은 원래의 것을 망치지 않는 데 너무 집중한 나머지, 당신의 새로운 지시를 완전히 따르는 데 실패합니다. 이 논문은 바로 이 구체적인 문제를 다룹니다. 어떻게 하면 이 디지털 예술가들이 원래 사진의 영혼을 잃지 않으면서도 과감하게 큰 변화를 줄 수 있게 만들 것인가 하는 문제입니다.

저자들은 DuET(Dual Expert Trajectories, 이중 전문가 궤적)이라는 영리한 새로운 기술을 소개합니다. 이미지 편집 과정을 빈 캔버스에서 완성된 걸작에 이르는 긴 여정이라고 생각해 보세요. 보통 컴퓨터는 원래의 사진을 끊임없이 바라보며 경로를 벗어나지 않도록 주의하는 "편집 모드(Edit Mode)"로 이 여정을 수행합니다. DuET 방식은 다른 경로를 제안합니다. 여정 중 짧고 특정한 구간 동안, 컴퓨터는 원래의 사진을 완전히 보는 것을 멈춰야 합니다. 대신, 컴퓨터는 오직 당신의 새로운 장면 묘사에만 귀를 기울이는 "Text-to-Image(텍스트 투 이미지) 모드"로 전환합니다. 이는 마치 배경 음악(원래의 사진)에 맞춰 연주하던 음악가가, 몇 마디 동안은 노이즈 캔슬링 헤드폰을 쓰고 오직 악보(당신의 지시 사항)에만 의존하여 즉흥 연주를 하는 것과 같습니다. 이를 통해 컴퓨터는 장면을 당신의 비전에 맞게 완전히 재구성할 수 있습니다.

이 짧은 "솔로" 연주 후에, 컴퓨터는 헤드폰을 벗고 나머지 여정을 위해 다시 "편집 모드"로 돌아옵니다. 이제 커다란 구조적 변화가 이루어졌으므로, 컴퓨터는 다시 원래의 사진을 바라보며 세부적인 디테일을 채우고 조명과 질감이 여전히 자연스럽게 보이도록 만듭니다. 논문은 이 "Edit(편집) → Text-to-Image(텍스트 투 이미지) → Edit(편집)"의 춤이 한 가지 모드에 계속 머물러 있는 것보다 훨씬 더 효과적임을 보여줍니다. 이 방식은 결과물이 당신이 요청한 것과 더 닮게 만들고, 특히 전체 사물을 교체하거나 배경을 바꾸는 것과 같은 큰 변화를 줄 때 더욱 자연스럽게 느껴지도록 합니다.

하지만 연구진은 한 가지 문제점을 발견했습니다. 컴퓨터가 원래의 사진을 보는 것을 멈추면, 아주 잠깐이라도, 당신이 똑같이 유지하고 싶었던 부분까지 변화시키는 경우가 생깁니다. 이는 트레이드오프(trade-off, 절충 관계)입니다. 더 나은, 더 정확한 편집을 얻는 대신, 원래 이미지의 정밀함이 아주 조금 손실될 수 있습니다. 논문은 픽셀이 얼마나 유사한지를 확인하는 SSIM이라는 점수로 이를 측정합니다. 그들은 새로운 방식이 "재미있는" 부분(예: 지시 사항을 얼마나 잘 따르는지, 얼마나 자연스러운지)은 개선하지만, "보존(preservation)" 점수는 약간 떨어진다는 것을 발견했습니다.

하지만 정말 멋진 부분은 여기 있습니다. 저자들은 이 트레이드오프가 엄격한 규칙이 아니라고 제안합니다. 그들은 Selective DuET(선택적 DuET)라는 더 똑똑한 버전을 만들었습니다. 이 버전은 교통 경찰처럼 행동합니다. 여정이 시작되기 전, 이미지를 빠르게 훑어보고 컴퓨터가 이미 원래의 이미지를 얼마나 "붙잡고 있는지"를 확인합니다. 만약 이미지가 거대한 변화(예: 집을 나무로 바꾸는 것)를 필요로 한다면, 교통 경찰은 "가도 좋다, 솔로를 해라!"라고 말합니다. 하지만 이미지가 아주 미세한 수정만을 필요로 한다면, 경찰은 "모드를 바꿀 필요 없다, 그냥 편집을 계속하라"고 말합니다. 위험이 따르는 "솔로" 방식을 꼭 필요한 경우에만 사용함으로써, 그들은 보존 점수가 인간이 실제로 인지할 수 있을 정도로 떨어지지 않으면서도 고품질의 편집을 얻는 방법을 찾아냈습니다.

요약하자면, 이 논문은 이미지를 더 잘 편집하기 위해 더 복잡하고 새로운 로봇을 훈련시킬 필요가 없다는 것을 증명합니다. 단지 기존의 로봇에게 언제 원래의 사진을 보는 것을 멈추고, 언제 당신의 말에만 귀를 기울여야 하는지를 가르치기만 하면 됩니다. 이는 디지털 아트 편집을 더 유연하고 창의적으로 만드는 간단하고 비용이 들지 않는 업그레이드이며, 때로는 완벽한 결과를 얻기 위해 잠시 동안 과거를 놓아줄 필요가 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →