← 최신 논문
🤖 AI

Initialization is Half the Battle: Generating Diverse Images from a Guidance Potential Posterior

이 논문은 랑제빈 역학(Langevin dynamics)을 사용하여 가이던스 포텐셜 사후 분포(guidance potential posterior)로부터 초기 노이즈를 샘플링함으로써 생성 모델의 다양성을 향상시키는 방법인 다양성 유도 초기화(Diversity-inducing Initialization, DivIn)를 소개하며, 이는 기존의 궤적 기반 개입 방식과 호환되면서도 이를 보완하며 모드 붕괴(mode collapse)로부터 궤적을 효과적으로 멀어지게 한다.

원저자: Xiang Li, Dianbo Liu, Kenji Kawaguchi

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiang Li, Dianbo Liu, Kenji Kawaguchi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 쿠키 한 판을 굽고 있다고 상상해 보세요. 당신에게는 맛있는 쿠키를 만들 수 있는 완벽한 레시피(AI 모델)가 있습니다. 하지만 쿠ки를 구울 때마다, 모든 쿠키가 정확히 똑같이 보입니다. 모양도, 색깔도, 심지어 초콜릿 칩의 배치까지도 모두 같습니다. AI 예술의 세계에서는 이를 **"모드 붕괴(mode collapse)"**라고 부릅니다. AI가 틀에 박힌 생각에 갇혀서, 만들 수 있었던 다른 모든 맛있는 변주들을 무시한 채 계속해서 똑같은 "지배적인" 쿠키만을 만들어내는 것입니다.

대부분의 사람들은 쿠키가 오븐 안에서 구워지는 동안(온도를 조절하거나 반죽을 다르게 젓는 등) 베이킹 과정을 수정하여 이를 해결하려고 노력합니다. 하지만 이 논문은 진짜 문제가 베이킹을 시작하기도 에, 즉 볼에 담긴 생반죽에 달려 있다고 주장합니다.

문제점: "표준 반죽"은 너무 지루하다

보통 AI 모델은 "표준 반죽"(수학적으로 가우시안 분포라고 불리는 것)에서 시작합니다. 이것은 일반적인 봉지에서 밀가루 한 줌을 집어 드는 것과 같습니다. 문제는 이 일반적인 밀가루가 항상 주방 카운터의 특정 지점에 떨어지게 되어, 매번 똑같은 모양의 쿠키를 만들게 된다는 점입니다.

저자들은 "주방 카운터"(수학적 경관)에는 언덕과 골짜기가 있다는 사실을 발견했습니다.

  • 높은 언덕: 이곳은 AI가 매우 흥분하여 모든 것을 하나의 특정하고 지배적인 쿠키 모양으로 끌어당기는 구역입니다. 만약 당신의 반죽을 이곳에서 시작한다면, 쿠키 붕괴가 일어납니다.
  • 평평한 골짜기: 이곳은 차분하고 넓은 구역으로, 반죽이 여러 방향으로 퍼져나가 다양한 모양의 쿠키를 만들 수 있는 곳입니다.

표준적인 방식은 눈을 감고 반죽을 "높은 언덕" 위로 던져버리기 때문에, 지루한 결과를 초래할 수밖에 없습니다.

해결책: DivIn (다양성 유도 초기화)

저자들은 DivIn이라는 새로운 방법을 만들어냈습니다. DivIn은 단순히 밀가루를 무작정 집어 드는 대신, 먼저 카운터를 정찰하는 똑똑한 주방 보조원 역할을 합니다.

  1. 지형 정찰: 베이킹을 시작하기 전, DivIn은 다양한 쿠키가 자라날 수 있는 평평하고 넓은 골짜기를 찾기 위해 "잠재적 경관"을 살펴봅니다.
  2. "랑제뱅(Langevin)" 산책: 반죽을 이 안전한 골짜기로 이동시키기 위해, DivIn은 **랑제뱅 역학(Langevin dynamics)**이라는 기술을 사용합니다. 당신이 손전등을 들고 어둠 속을 걷고 있다고 상상해 보세요. 그냥 똑바로 걷는 대신(그러면 낭떠러지로 떨어질 수 있습니다), 작은 발걸음을 내디디며 땅의 느낌을 살핍니다. 만약 가파른 언덕이 느껴지면 뒤로 물러납니다. 만약 평평하고 안전한 구역이 느껴지면 그곳에 자리를 잡습니다.
  3. 결과: 이제 반죽은 다양한 모양으로 퍼져나갈 수 있는 "평평한 골짜기"에 놓이게 됩니다. 베이킹 과정(AI 생성)이 시작되면, 쿠키는 하나의 형태로 붕괴되는 대신 자연스럽게 다양하고 독특한 모양으로 진화합니다.

이것이 특별한 이유

이 논문은 왜 이 접근 방식이 게임 체인저인지 세 가지 주요 포인트를 강조합니다.

  • "베이킹 전" 해결책: 쿠키가 구워지는 동안 문제를 해결하려고 시도하는(이는 지저내고 복잡할 수 있습니다) 다른 방법들과 달리, DivIn은 오븐을 켜기도 에 문제를 해결합니다. 이는 시작부터 다양성을 위한 무대를 설정합니다.
  • 모든 것에 적용 가능: 당신이 오래된 베이킹 방식(확산 모델/Diffusion models)을 사용하든, 더 새로운 방식(흐름 매칭/Flow Matching)을 사용하든, DivIn은 완벽하게 작동합니다. 이는 어떤 오븐에도 딱 맞는 유니버설 어댑터와 같습니다.
  • 협력적인 도구: 가장 좋은 점은 DivIn이 다른 방법들을 대체하는 것이 아니라, 그들과 함께 작동한다는 것입니다. 만약 당신이 DivIn을 사용하여 반죽을 적절한 위치에 두고, 그 후에 다른 기술들을 사용하여 베이킹 과정을 미세 조정한다면, 당신은 최상의 결과를 얻게 됩니다. 즉, 맛이나 질감(품질)을 희생하지 않으면서도 엄청나게 다양한 쿠키(다양성)를 얻을 수 있습니다.

핵심 요약

이 논문은 단순히 과정을 어떻게 마무리하느냐가 아니라, 과정을 어디서 시작하느냐(초기화)를 바꿈으로써 AI의 창의성을 대폭 끌어올릴 수 있다고 주장합니다. 이는 AI가 똑같은 것을 만드는 루프에 빠지지 않도록 막아주며, 품질을 유지하면서도 전체 메뉴의 가능성을 탐험하도록 독려합니다.

요컨대: 단순히 베이킹을 고치려 하지 말고, 반죽의 위치를 고치십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →