← 최신 논문
💻 computer science

Editing Everything Everywhere All at Once

이 논문은 의미적 간섭과 속성 누출을 방지하기 위해 어텐션 메커니즘을 조절함으로써, 단 한 번의 순전파(forward pass)만으로 확장 가능하고 고충실도의 다중 인스턴스 이미지 편집을 가능하게 하는 멀티모달 디퓨전 트랜스포머를 위한 훈련 불필요(training-free) 전략인 MICE를 소개한다.

원저자: Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 방의 디지털 사진을 가지고 있고, 그 안의 거의 모든 것을 한 번에 바꾸고 싶다고 상상해 보세요. 커피 컵을 물병으로 바꾸고, 천장 타일을 나무 보로 교체하며, 화이트보드를 칠판으로 바꾸고, 창밖의 풍경을 눈 덮인 산으로 바꾸는 식입니다.

이것을 한 번에 하나씩 수행하는 것(컵을 바꾸고, 그다음 천장을 바꾸고, 그다음 보드를 바꾸는 방식)은 느릴 뿐만 아니라, 결과물이 서로 잘 어우러지지 않아 지저분해지기 쉽습니다. 하지만 이 모든 것을 단 한 번의 "스냅"으로 처리하는 것은 현재의 AI에게 매우 어려운 일입니다. 만약 AI에게 모든 것을 한꺼번에 하라고 요청하면, AI는 종종 혼란에 빠집니다. 실수로 눈 덮인 산의 모습을 커피 컵 위에 그려 넣거나, 나무 보가 칠판의 일부처럼 보이게 만들 수도 있습니다. 이것을 "속성 누출(attribute leakage)"이라고 하며, 명령어가 서로 뒤섞이는 현상을 말합니다.

문제점: "붐비는 방" 효과
AI의 뇌를 사람들이 동시에 소리를 지르고 있는 붐비는 방이라고 생각해 보세요. 당신이 방에 "컵을 바꿔라"와 "천장을 바꿔라"라고 동시에 말하면, AI는 압도당합니다. AI는 모든 목소리에 귀를 기울이려 노력하지만, 목소리들이 서로 뒤섞여 버립니다. "컵"에 대한 명령어가 실수로 "천장" 명령어를 잡아채서, 천장처럼 보이는 컵을 만들어낼 수 있습니다. 변화를 추가할수록 혼란은 더 심해지며, 최종 이미지는 무질서해집니다.

해결책: MICE (다중 인스턴스 동시 편집 - Multi-Instance Concurrent Editing)
이 논문의 저자들은 MICE라고 불리는 새로운 방법을 개발했습니다. MICE는 AI의 뇌를 위한 매우 효율적인 교통 관제사라고 생각하면 됩니다. 모든 사람이 서로의 말을 가로채도록 내버려 두는 대신, MICE는 각 명령어가 전체적인 그림을 보면서도 자신만의 "차선"을 가질 수 있도록 해줍니다.

작동 방식은 다음과 같습니다 (쉬운 비유를 사용함):

  1. 세그멘테이션 마스크 (스텐실 도안):
    먼저, 사용자(또는 보조 도구)가 바꾸고자 하는 대상의 윤곽을 그립니다. 이것은 종이 위에 그려진 스텐실이나 오려낸 모양과 같습니다. MICE는 이 스텐실을 사용하여 이미지의 어느 부분이 어떤 명령어에 속하는지를 정확히 파악합니다.

  2. "부드러운" 벽 (가우시안 블러):
    기존 방식들은 이 스텐실들 사이에 단단한 콘크리트 벽을 세우려 했습니다. 만약 컵과 천장 사이에 콘크리트 벽을 세우면, 결과물은 마치 조잡한 콜라주처럼 경계가 울퉁불퉁하고 부자연스러워 보입니다.
    MICE는 대신 부드럽고 흐릿한 벽을 사용합니다. 이는 완만한 그래디언트를 생성합니다. AI는 "좋아, 이 부분은 확실히 컵이고, 저 부분은 확실히 천장이야"라고 인식합니다. 하지만 두 부분이 만나는 지점은 벽이 흐릿하게 처리됩니다. 이를 통해 컵이 테이블과 자연스럽게 어우러지고, 천장이 벽과 자연스럽게 연결되도록 하면서도, 컵에 대한 명령어가 천장을 침범하지 않도록 합니다.

  3. "출입 금지" 구역:
    MICE는 또한 보이지 않는 "출입 금지" 표지판을 설치합니다. AI에게 이렇게 지시하는 것입니다: "컵에 대한 명령은 컵과 대화할 수 있고, 주변의 테이블과도 대화하여 서로 잘 맞는지 확인할 수 있다. 하지만 눈 덮인 산에 대한 명령과는 절대로 대화해서는 안 된다." 이는 "산"의 질감이 실수로 "컵" 위로 새어 들어오는 것을 막아줍니다.

  4. 한 번의 통과, 한 번의 실행:
    MICE의 마법은 이 모든 과정을 **단 한 번의 순방향 패스(forward pass)**로 수행한다는 점입니다. 보통의 화가가 컵을 칠하고, 마르기를 기다리고, 그다음 천장을 칠하고, 다시 기다려야 하는 상황을 상상해 보세요. MICE는 화가가 컵, 천장, 창문, 그리고 카펫을 단 한 번의 매끄러운 붓질로 모두 그려내어, 각 부분이 완벽하게 연결되도록 만드는 것과 같습니다.

이것이 왜 중요한가
논문의 저자들은 이 기술을 MICE-Bench라는 매우 어려운 새로운 챌린지에 테스트했습니다. 기존의 테스트들이 한 번에 3가지를 바꾸는 것을 요구했다면, MICE-Bench는 한 이미지에서 평균 8.5가지(어떤 경우에는 최대 40가지까지!)를 동시에 바꾸도록 요구했습니다.

결과에 따르면 MICE는 다음 항목에서 훨씬 뛰어난 성능을 보였습니다:

  • 경청: 실제로 대상이 의도한 대로 바뀝니다 (예: 컵이 개가 되는 것이 아니라 물병이 됨).
  • 보존: 바꾸라고 요청하지 않은 부분은 원래 상태 그대로 유지합니다.
  • 조화: 새로운 오브젝트들이 올바른 조명과 그림자를 갖추어 사진 속에 자연스럽게 녹아듭니다.

요약하자면
MICE는 "학습이 필요 없는(training-free)" 도구입니다 (새로 그림 그리는 법을 배울 필요 없이, AI가 주의를 기울이는 방식을 바꾸는 것입니다). MICE는 서로 다른 편집 명령어를 분리하면서도 조화롭게 유지하는 스마트한 조직가 역할을 하여, AI가 혼란을 겪지 않고도 복잡한 이미지를 한 번에 여러 가지 변경 사항과 함께 편집할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →