← 최신 논문
🤖 machine learning

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

본 논문은 국소적 계획들을 정렬하기 위한 전역적 구조 스캐폴드를 먼저 구축한 후 이를 정교화함으로써 장기 계획 능력을 향상시키는 추론 시 샘플러인 Coarse-to-Fine Compositional Diffusion(CoFi)을 제안하며, 이를 통해 기존 방식보다 훨씬 적은 계산 평가 횟수로도 우수한 전역적 일관성과 국소적 품질을 달성한다.

원저자: Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대한 100피트 길이의 숲 벽화를 그리려고 한다고 상상해 보세요. 당신에게는 매우 재능 있는 화가(AI 모델)가 있지만, 그들은 한 번에 고품질로 5피트 정사각형 하나만을 그릴 수 있습니다. 만약 당신이 한 번에 전체를 그리라고 요청하면, 그들은 혼란에 빠지거나 품질이 떨어집니다. 그래서 당신은 그들에게 아홉 개의 별도 된 5피트 정사각형을 그리게 한 다음 그것들을 테이프로 붙이기로 결정합니다.

문제점: "패치워크(조각보)" 결함
이 방식의 기존 방식(이를 "구성적 생성(Compositional Generation)"이라 부릅니다)은 예술가들에게 다음과 같이 지시하는 것이었습니다: "당신의 정사각형 가장자리가 이웃한 정사각형의 가장자리와 일치하도록 하세요."

  • 결과: 가장자리는 완벽하게 일치합니다. 왼쪽 정사각형의 나무들이 오른쪽 정사각형의 나무들과 매끄럽게 연결됩니다.
  • 결함: 비록 가장자리는 일치할지라도, 전체 그림은 이상해 보일 수 있습니다. 예를 들어, 첫 번째 정사각형은 햇살 가득한 숲인데, 중간은 눈 덮인 산이고, 끝은 사막일 수 있습니다. 예술가들은 서로의 '큰 그림'에 대해 이야기하지 않았습니다. 그들은 단지 자신의 즉각적인 이웃과 괜찮아 보이도록 만들었을 뿐입니다. 최종 벽화는 논리적인 이야기나 일관된 스타일을 갖추지 못하게 됩니다.

해결책: CoFi (Coarse-to-Fine)
이 논문은 CoFi(Coarse-to-Fine Compositional Diffusion)라는 새로운 방법을 소개합니다. CoFi는 마치 예술가들을 위한 "프로젝트 매니저" 역할을 하는 2단계 프로세스처럼 작동합니다.

1단계: "거친 스케치" (Coarse 단계)

단순히 예술가들에게 가장자리를 맞추라고 말하는 대신, CoFi는 먼저 그들에게 모두 물러나서 100피트 벽화 전체의 거칠고 흐릿한 스케치에 합의하도록 요청합니다.

  • 예술가들이 모두 눈을 가늘게 뜨고 전체적인 형태에 합의하는 것을 상상해 보세요: "좋아, 이건 숲이야, 태양은 왼쪽에 있고, 길은 왼쪽 아래에서 오른쪽 위로 이어져."
  • 이들은 전체 이미지의 "스캐폴드(뼈대)"를 만듭니다. 이를 통해 모든 정사각형이 거대한 계획 속에서 자신의 위치를 알게 됩니다.
  • 트레이드오프: 이 거친 스케치는 다소 흐릿하고 세부 사항(나무 껍질의 질감 같은)이 부족합니다. 하지만 구조는 완벽합니다.

2단계: "세부 작업" (Fine 단계)

이제 완벽한 뼈대가 생겼으므로, CoFi는 이렇게 말합니다: "자, 잠시 거친 스케치는 잊으세요. 이제 노이즈를 다시 추가하고 세부 사항을 다시 그리되, 이번에는 여러분의 원래 재능을 사용하여 나무와 잎을 채워 넣으세요."

  • 그들은 이 완벽한 뼈대를 가져와서 약간의 "정적(노이즈)"을 추가한 뒤, 예술가들이 그 위에 다시 그리도록 합니다.
  • 뼈대가 이미 존재하기 때문에, 예술가들은 경로를 벗어날 걱정 없이 나무를 사실적으로 만들거나 물을 반짝이게 만드는 데 집중할 수 있습니다.
  • 결과물은 거친 스케치의 논리적 구조를 가지면서도, 원래 예술가의 고품질 세부 사항을 갖게 됩니다.

왜 더 나은가?

논문은 이 방법이 두 가지 이유로 "윈-윈(win-win)"이라고 주장합니다.

  1. 더 보기 좋습니다: 최종 이미지(또는 로봇 계획, 비디오)는 처음부터 끝까지 논리적으로 이어집니다. 로봇이 원을 그리며 걷지 않고, 비디오 캐릭터가 갑자기 다른 사람으로 변하지 않으며, 파노라마 사진이 낮에서 밤으로 갑자기 바뀌지 않습니다.
  2. 더 빠릅니다: 기존 방식은 예술가들이 매 붓질마다 서로 계속 대화하게 함으로써 "큰 그림" 문제를 해결하려 했습니다. 이는 시간이 오래 걸렸습니다. CoFi는 "큰 그림" 계획을 한 번에 수행한 다음 세부 사항을 채웁니다. 논문은 이 방식이 더 나은 결과를 얻으면서도 2배에서 8배 더 빠르다(더 적은 컴퓨터 연산 필요)고 밝히고 있습니다.

어디에서 테스트했나요?

저자들은 이 "프로젝트 매니저" 접근 방식을 세 가지 특정 분야에서 테스트했습니다:

  • 로봇 계획(Robot Planning): 짧은 움직임들을 이어 붙여 거대한 미로를 통과하도록 로봇을 안내하는 것입니다. CoFi는 로봇이 길을 잃지 않고 목표에 도달하도록 도왔습니다.
  • 파노라마 이미지: 9개의 작은 이미지를 이어 붙여 하나의 거대하고 넓은 사진을 만드는 것입니다. CoFi는 하늘과 나무가 전체 너비에 걸쳐 일관되게 보이도록 했습니다.
  • 긴 비디오: 짧은 클립들을 이어 붙여 긴 비디오를 만드는 것입니다. CoFi는 메인 캐릭터가 전체 영상 동안 동일하게 유지되도록 하여, 캐릭터가 다른 사람으로 "모핑(변형)"되는 것을 방지했습니다.

요약하자면, CoFi는 먼저 큰 그림에 먼저 합의하도록 강제함으로써 AI가 세부 사항에 매몰되어 길을 잃는 것을 막고, 그 후 세부 사항을 마음껏 구현하게 하면서도 엄청난 양의 컴퓨팅 자원을 절약합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →