← 최신 논문
🤖 machine learning

Plan First, Diffuse Later: Extrinsic Graph Guidance for Long-Horizon Diffusion Planning

본 논문은 내재적 탐색의 계산적 오버헤드 없이 복잡한 작업에서 전역적 일관성과 성능을 향상시키도록 노이즈 제거 과정을 안내하는 경량 계획을 생성하기 위해 외재적 그래프 기반 탐색을 활용함으로써 장기 계획 확산을 강화하는 새로운 접근법인 XDiffuser 를 소개합니다.

원저자: Yaniv Hassidof, Adir Morgan, Yilun Du, Kiril Solovey

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yaniv Hassidof, Adir Morgan, Yilun Du, Kiril Solovey

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 복잡한 미로를 걷는 로봇을 가르치려 한다고 상상해 보세요. 당신은 로봇이 한 구석에서 인접한 다른 구석으로 가는 짧은 비틀거리는 보행에 대한 비디오 라이브러리만 가지고 있습니다. 로봇에게 미로 전체를 한 번에 건너는 법을 보여준 적은 없습니다.

이 논문이 다루는 문제는 바로 이것입니다: 로봇에게 짧은 지역 이동에 대한 데이터만 있을 때, 어떻게 로봇이 길고 복잡한 여정을 계획하게 할 수 있을까요?

구식 방법: "추측하고 확인하기" (확산 모델)

연구자들은 확산 모델 (Diffusion Model) 이라는 인기 있는 AI 도구를 사용했습니다. 이 모델을 두 지점 사이를 매끄럽고 사실적인 선으로 그리는 데 매우 재능 있는 예술가로 생각하세요. 만약 이전과 유사한 경로를 본 적이 있는 A 지점에서 B 지점까지 경로를 그려달라고 요청하면, 그것은 훌륭하게 해냅니다.

그러나 수많은 작은 구간을 이어 붙여 거대한 미로 전체를 가로지르는 경로를 그려달라고 요청하면, 혼란에 빠지기 시작합니다. 첫 번째 구간에는 완벽한 곡선을 그리고, 두 번째 구간에도 완벽한 곡선을 그릴 수 있지만, 두 곡선이 실제로 제대로 연결되지 않을 수 있습니다. 서로 대화하지 않고 함께 벽화를 그리려는 예술가 팀과 같습니다. 지역적 세부 사항은 훌륭해 보이지만, 전체 그림은 무너집니다.

이를 해결하기 위해 이전 방법들은 AI 가 그림을 그리는 동안 "더 깊이 생각"하도록 시도했습니다. AI 가 이미지를 생성하는 동안 잠시 멈추고 가능한 모든 다음 단계를 살펴본 후, 가장 좋은 것을 선택하도록 만들었습니다. 이 논문은 이를 화가가 그림을 그리는 동안 매초마다 멈춰 지도를 참조하고, 열 가지 다른 경로를 확인한 후 다시 그림을 계속하라고 요구하는 것과 같다고 주장합니다. 이는 극도로 느리고 계산 비용이 많이 듭니다.

새로운 방법: "먼저 계획하고, 나중에 그리기" (XDiffuser)

Yaniv Hassidof 와 그의 팀인 저자들은 더 지능적인 업무 분담을 제안합니다. 그들은 이 방법을 XDiffuser라고 부릅니다.

그들은 작업을 두 가지 명확한 역할로 나눕니다:

1. 항해자 (그래프 탐색)
먼저, 그들이 가진 짧은 비디오 클립을 사용하여 미로의 단순하고 가벼운 "스켈레톤 지도"를 구축합니다. 이 지도는 매끄러운 곡선을 보여주지 않습니다. 단지 어떤 영역이 어떤 영역과 연결되어 있는지만 보여줍니다.

  • 비유: 등산가가 지형도를 보고 있다고 상상해 보세요. 그들은 아직 전체 길을 걷지 않습니다. 시작점에서 도착점까지 직선을 그리고, 길목에 있는 몇 가지 주요 "경유지"(특정 나무, 바위, 또는 다리 등) 를 표시할 뿐입니다.
  • 행동: 로봇은 다익스트라 알고리즘과 같은 고전적이고 빠른 컴퓨터 알고리즘을 사용하여 이러한 경유지의 최적 순서를 찾습니다. 이것이 외부 탐색 (Extrinsic Search) 입니다. 이는 무거운 AI 모델 외부에서 발생합니다.

2. 예술가 (확산 모델)
항해자가 경유지 목록을 확보하면, 이 목록을 확산 모델에 넘겨줍니다.

  • 비유: 이제 예술가는 다음에 어디로 가야 할지 추측할 필요가 없습니다. 그들은 체크리스트를 받습니다: "시작점에서 나무 A 까지의 매끄러운 경로를 그리고, 나무 A 에서 바위 B 까지, 그리고 바위 B 에서 도착점까지 그려라."
  • 행동: AI 모델은 오직 이러한 점들 사이의 경로를 매끄럽고, 사실적이며, 물리적으로 가능하도록 만드는 데만 집중합니다. 항해자가 이미 큰 그림을 계획했기 때문에 AI 는 큰 그림을 추측하는 데 에너지를 낭비하지 않습니다.

이것이 게임 체인저인 이유

이 논문은 이 접근 방식이 다음 세 가지 주요 이유로 훨씬 더 낫다고 주장합니다:

  • 더 빠릅니다: 무거운 AI 모델이 복잡한 탐색에 매몰되지 않습니다. AI 는 매끄러운 선을 그리는 것만 잘하면 됩니다. "생각"은 간단하고 빠른 그래프 알고리즘이 수행합니다.
  • 나쁜 데이터로도 작동합니다: 훈련 비디오가 지저분하거나 로봇이 poorly 움직였더라도, 항해자는 미로에서 논리적인 경로를 찾을 수 있습니다. 그런 다음 AI 는 그 경로를 "연마"할 뿐입니다. 그들의 테스트에서 데이터가 불량했을 때, 그들의 방법은 98.5% 성공한 반면, 구식 방법은 27% 만 성공했습니다.
  • 유연합니다 ("플러그 앤 플레이" 기능): "항해자"와 "예술가"가 분리되어 있기 때문에, 예술가를 재학습시키지 않고도 다른 작업에 맞게 항해자를 교체할 수 있습니다.
    • 다중 에이전트 조정: 4 대의 로봇이 있다면, 항해자에게 서로 충돌하지 않도록 4 대 모두의 경로를 계획하라고 지시하기만 하면 됩니다. 예술가는 여전히 매끄러운 선만 그립니다.
    • 점검 계획: 드론이 다리를 점검하기 위해 64 개의 서로 다른 지점을 방문해야 한다면, 항해자는 방문할 가장 효율적인 순서를 파악합니다 (여행하는 세일즈맨 문제와 같습니다). 그런 다음 예술가는 비행 경로를 그립니다.

결론

이 논문은 길고 복잡한 작업의 경우, 단일 AI 모델에게 모든 것 (계획 그리기) 을 하도록 강요해서는 안 된다고 주장합니다. 대신, 간단한 빠른 계획자가 큰 그림(경유지) 을 파악하게 하고, 강력한 AI 모델이 세부 사항(매끄러운 움직임) 에 집중하게 하십시오.

"계획"과 "그리기"를 분리함으로써, 그들은 이전 방법들이 어려움을 겪었던 복잡한 퍼즐 (여러 로봇의 조정이나 대형 구조물 점검 등) 을 해결할 수 있는 더 빠르고, 더 신뢰할 수 있으며, 능력이 있는 시스템을 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →