← 최신 논문
📊 statistics

Couple to Control: Joint Initial Noise Design in Diffusion Models

본 논문은 확산 모델에서 샘플 간에 제어된 의존성(예: 반발적 결합 또는 부분공간 결합)을 도입함으로써 배치 다양성을 향상시키고 고정된 객체의 배경 생성과 같은 구조화된 생성 작업을 가능하게 하며 프롬프트 정렬, 이미지 품질 또는 샘플링 효율성을 저해하지 않는 결합 초기 잡음 설계를 위한 프레임워크를 제안한다.

원저자: Jing Jia, Liyue Shen, Guanyang Wang

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jing Jia, Liyue Shen, Guanyang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 'a cat on a mat'과 같은 단일 단어 프롬프트를 기반으로 그림을 그리는 마법 붓 (확산 모델) 을 사용하는 예술가라고 상상해 보세요.

보통 이 붓에게 한 번에 세 장의 그림을 그리라고 요청하면, 붓은 각 그림을 완전히 무작위이고 서로 관련 없는 소음 (노이즈) 의 튀김으로 시작합니다. 마치 세 개의 다른 모래 주머니를 공중에 던지는 것과 같습니다. 모래가 무작위이고 독립적이기 때문에, 결과적으로 나온 그림들은 매우 비슷해지거나 완전히 다르게 보일 수 있지만, 그들이 서로 어떻게 관련되는지에 대한 통제권은 없습니다.

이 논문은 그 모래를 던지는 새로운 방식을 제안합니다. 세 개의 독립적인 주머니를 던지는 대신, 저자는 모래 알갱이들이 특정 패턴으로 서로 연결된 단일하고 조율된 주머니를 던질 것을 제안합니다.

간단한 비유를 사용하여 그들의 아이디어를 살펴보면 다음과 같습니다:

1. 핵심 아이디어: 소음의 "결합 (Coupling)"

소음을 그림을 위한 시작 재료라고 생각해 보세요.

  • 옛 방식 (독립적): 예술가에게 세 개의 분리된 무작위 밀가루 주머니를 줍니다. 각 주머니는 그 자체로 훌륭하지만, 서로 간에 관계가 없습니다. 결과적인 케이크들은 너무 비슷하거나 너무 혼란스러울 수 있습니다.
  • 새로운 방식 (결합된): 예술가에게 세 개의 밀가루 주머니를 주는데, 각각은 여전히 완벽합니다 (옛 방식과 동일하게). 하지만 보이지 않는 실로 그들을 서로 묶어 놓았습니다. 당신은 그들이 서로에 대해 어떻게 움직일지 결정합니다.
    • "반발"하는 실: 한 주머니가 왼쪽으로 움직이면 다른 주머니들은 오른쪽으로 움직이도록 묶습니다. 이는 개별 그림의 품질을 해치지 않으면서 세 개의 결과 그림이 서로 가능한 한 다르게 보이도록 보장합니다.
    • "동일"한 실: 그들이 함께 움직이도록 묶습니다. 이는 사진 속의 특정 제품과 같은 특정 객체를 정확히 동일하게 유지하면서 배경을 변경하고 싶을 때 유용합니다.

2. 이것이 중요한 이유: 두 가지 주요 트릭

트릭 A: 무료로 더 많은 다양성 얻기 ("반발" 방법)

모두가 고유한 이미지 갤러리를 원한다면, 저자들은 시작 소음을 서로 밀어내도록 (동일한 극을 가진 자석처럼) 묶는 수학적 방법을 발견했습니다.

  • 이점: 추가적인 컴퓨터 연산을 실행하거나 더 기다릴 필요 없이 훨씬 더 다양한 이미지 세트 (다른 포즈, 각도, 배경) 를 얻을 수 있습니다. 같은 바구니에서 과일을 고르는 방식을 재배치함으로써 같은 바구니에서 더 좋은 다양성을 얻는 것과 같습니다.
  • 결과: 테스트에서 이 방법은 사후에 소음을 수동으로 조정하는 비싼 "최적화"가 필요한 이전 방법들보다 더 다양한 이미지를 생성했으며, 즉시 수행되었습니다.

트릭 B: 배경 변경, 객체 유지 ("부분 공간" 방법)

특정 운동화 사진이 있다고 상상해 보세요. 그 운동화를 숲, 도시, 해변에서 보고 싶지만, 운동화 자체는 정확히 동일하게 보이기를 원합니다.

  • 옛 방식: 배경을 "지우고" 다시 그릴 수 있지만, 이는 종종 운동화를 흐리게 하거나 추한 가장자리를 남깁니다.
  • 새로운 방식: 저자들은 운동화를 생성하는 소음을 잠그는 (모든 시도에서 동일하게 유지) 반면, 배경을 위한 소음은 "반발"하거나 극적으로 변하도록 하여 그들의 "결합된 소음" 아이디어를 사용합니다.
  • 결과: 그들은 운동화가 선명하게 유지되고 신발과 배경 사이의 전환이 매끄럽게 보이는 완전히 다른 자연스러운 배경에서 같은 운동화의 전체 갤러리를 생성할 수 있습니다.

3. 작동 원리 (간단히 설명된 "마법")

저자들은 시작 소음을 단순한 무작위 정적 (static) 이 아니라 친구들의 그룹으로 취급합니다.

  • 독립적인 소음: 친구들은 낯선 사람들입니다. 실수로 같은 자리에 서게 될 수 있습니다.
  • 결합된 소음: 친구들은 계획이 있습니다.
    • 다양성을 원한다면, 그들에게 이렇게 말합니다: "서로 가능한 한 멀리 떨어져 서야 합니다."
    • 일관성을 원한다면, 그들에게 이렇게 말합니다: "손을 잡고 함께 움직여야 합니다."

마법은 예술가 (AI 모델) 가 그 차이를 모른다는 점입니다. 예술가에게 있어 각 그림은 여전히 표준적이고 고품질의 시작점에서 그려진 것처럼 보입니다. 변경된 것은 배치 내 그림들 사이의 관계일 뿐입니다.

4. 그들이 실제로 증명한 것

이 논문은 실험을 기반으로 세 가지 주요 주장을 합니다:

  1. 더 나은 다양성: 그들의 "반발" (밀어내는) 소음 방법을 사용하면 표준 무작위 소음보다 더 다양한 이미지 갤러리가 생성되며, 사후에 소음을 최적화하려는 방법들보다 더 빠르게 수행됩니다.
  2. 품질 손실 없음: 그림들이 서로 더 다르게 보임에도 불구하고, 표준 방법과 마찬가지로 보기 좋고 텍스트 프롬프트에 정확합니다.
  3. 더 나은 배경: 특정 객체를 위한 소음을 잠그고 배경 소음을 변하게 함으로써, 기존 "인페인팅 (inpainting)" 도구들보다 자연스러운 배경 변경을 생성할 수 있습니다 (기존 도구들은 객체를 선명하게 유지하면서 배경을 변경하는 데 보통 어려움을 겪습니다).

요약

이 논문을 일련의 예술 프로젝트 시작 방법에 대한 새로운 규칙으로 생각하세요. 모두에게 완전히 무작위이고 연결되지 않은 아이디어로 시작하게 하는 대신, 그들의 아이디어가 서로 어떻게 관련되어야 하는지에 대한 일련의 지시를 제공합니다.

  • 다양성을 원한다면? 그들에게 정반대가 되라고 하세요.
  • 일관성을 원한다면? 그들에게 동일하게 되라고 하세요.

이것은 더 강력한 컴퓨터나 더 똑똑한 AI 모델이 필요하지 않고, 더 스마트한 시작 방식을 통해 더 나은 결과 (더 다양하거나 더 제어된 이미지) 를 얻을 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →