Compositional Diffusion with Guided Search for Long-Horizon Planning
이 논문은 구성적 생성 모델에서의 모드 평균화(mode averaging) 문제를 해결하기 위해 인구 기반 탐색(population-based search)과 가능도 필터링(likelihood filtering)을 확산 디노이징 과정에 직접 통합함으로써, 로봇 조작, 파노라마 이미지 합성, 비디오 생성과 같은 다양한 도메인에 걸쳐 일관된 장기 계획(long-horizon planning)을 가능하게 하는 가이드 탐색을 포함한 구성적 확산(Compositional Diffusion with Guided Search, CDGS) 방법을 소개한다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 거대한 퍼즐을 푸는 법을 가르치려 하거나, 컴퓨터에게 거대한 벽화를 그리라고 요청하거나, 혹은 몇 시간 동안 이어지는 영화를 감독하고 있다고 상상해 보세요. 문제는 이 작업들이 한꺼번에 배우기에는 너무 크다는 점입니다. 이는 마치 하룻밤 사이에 백과사전 전체를 암기하려는 것과 같습니다. 당신의 뇌(또는 컴퓨터의 뇌)는 그 모든 것을 다 담아낼 수 없습니다. 그래서 과학자들은 영리한 묘책을 사용합니다. 큰 작업을 작고 관리 가능한 조각들로 나누는 것이죠. 로봇에게 블록 하나를 집는 법, 혹은 벽의 한 칸을 칠하는 법, 또는 5초짜리 클립을 촬영하는 법을 가르칩니다. 이것들이 바로 "로컬(local)" 전문가들입니다.
하지만 여기에 까다로운 문제가 있습니다. 각 작은 조각을 완벽하게 수행할 줄 안다고 해서, 그것들을 합쳐서 완벽한 전체를 만들 수 있다는 뜻은 아닙니다. 만약 상자에 그려진 그림을 보지 않고 두 퍼즐 조각을 붙이려고 한다면, 가까이서 볼 때는 괜찮아 보일지 몰라도 전체 그림은 뒤틀리고 깨져 보일 수 있습니다. 인공지능의 세계에서 이를 "모드 평균화(mode averaging)"라고 부릅니다. 이는 컴퓨터가 너무 안전한 길만 택하려다 보니 모든 옵션을 평균 내버려, 결국 엉망이고 불가능한 타협안을 만들어내는 현상을 말합니다. 예를 들어, 로봇 팔이 컵과 망치를 동시에 잡으려고 시도하거나, 영상 속에서 고양이가 문장 중간에 갑자기 개로 변해버리는 것과 같습니다.
여기서 조지아 공과대학교(Georgia Institute of Technology) 연구진의 새로운 논문이 등장합니다. 그들은 생성형 AI, 즉 컴퓨터가 새로운 이미지, 영상, 계획을 만들어내는 기술 분야에서 연구하고 있습니다. 구체적으로, 그들은 "장기적 계획 수립(long-horizon planning)", 즉 어떻게 많은 작은 단계들을 엮어서 큰 목표를 달성할 것인가라는 골칫거리를 다루고 있습니다. 그들은 기존의 방식처럼 여러 작은 AI 모델을 단순히 이어 붙이는 것이 종종 저런 엉망이고 불가능한 타협안을 만들어낸다는 점에 주목했습니다. 그래서 그들은 **조합적 확산 및 가이드 탐색(Compositional Diffusion with Guided Search, CDGS)**이라는 새로운 방법을 발명했습니다. 이것은 컴퓨터에게 퍼즐을 맞추는 동안 손전등과 지도를 쥐여주는 것과 같습니다. 이를 통해 컴퓨터는 앞을 내다보고, 조각들이 실제로 잘 맞는지 확인하며, 전체 그림을 망치기 전에 나쁜 아이디어들을 미리 버릴 수 있게 됩니다.
문제점: "평균"이 적이 될 때
저자들이 무엇을 해결했는지 이해하려면, 먼저 그들이 발견한 혼란이 무엇인지 알아야 합니다. 당신이 뉴욕에서 로스앤젤레스까지 자동차 여행을 계획한다고 상상해 보세요. 당신에게는 "뉴욕에서 필라델피아까지" 또는 "시카고에서 덴버까지"와 같은 짧은 주행 계획에는 뛰어난 내비게이션 앱이 있습니다. 하지만 만약 앱이 가능한 모든 경유지를 평균 내어 경로를 알려준다면, 당신은 시카고 근처까지 갔다가 갑자기 덴버로 점프하고, 다시 시카고로 돌아오는 식의 경로를 갖게 될 것입니다. 이것은 모든 경로의 "수학적 평균"일지는 모르나, 끔찍하고 불가능한 자동차 여행입니다.
AI의 세계에서도 이런 일이 일어납니다. 컴퓨터가 여러 가지 다른 "로컬" 계획들을 결합하려고 할 때 발생합니다. 로컬 계획들은 흔히 "멀티모달(multimodal)"한데, 이는 하나의 단계를 수행하는 데 여러 가지 유효한 방법이 존재한다는 뜻입니다. 예를 들어, 블록을 움직이기 위해 로봇은 블록을 밀 수도, 당길 수도, 들어 올릴 수도 있습니다. 만약 컴퓨터가 이 옵션들을 그냥 평균 내버린다면, 세 가지를 동시에 하려고 시도할 것이고, 결과적으로 로봇은 쓸모없이 파르르 떨기만 할 것입니다. 기존 방식들은 서로 다른 가능성들의 점수를 단순히 평균 내어 이를 해결하려 했지만, 저자들은 이 접근법이 서류상으로는 매끄러워 보일지 몰라도 실제로는 물리적으로 불가능하거나 논리적으로 망가진 계획을 만들어낸다는 것을 발견했습니다.
해결책: 안개 속의 가이드 탐색
저자들은 이를 처리하기 위한 새로운 방법인 **조합적 확산 및 가이드 탐색(CDGS)**을 제안합니다. 이 방식이 어떻게 작동하는지 이해하기 위해, 당신이 안개가 자욱한 숲속에서 특정 빈터를 찾고 있다고 상상해 보세요. 당신에게는 일반적인 방향을 알려주는 나침반(AI 모델)이 있지만, 안개가 너무 짙어 앞길이 보이지 않습니다.
기존 방식은 한 걸음을 내딛고, 나침반을 보고, 다시 한 걸음을 내딛으며 경로를 벗어나지 않기를 바라는 방식이었습니다. 하지만 안개가 너무 짙기 때문에, 너무 늦기 전까지는 자신이 늪에 빠지고 있다는 사실을 모른 채 경로를 이탈할 수 있습니다.
CDGS 방식은 다릅니다. 단 하나의 경로만 가는 대신, 탐험대 전체(후보 계획의 "집단")를 보냅니다. 여정의 매 단계마다 이 탐험대원들은 세 가지 일을 수행합니다.
- 서로 대화하기 (반복적 재샘플링, Iterative Resampling): 앞줄에 있는 탐험가가 뒷줄에 있는 탐험가에게, 그리고 그 반대로 정보를 전달합니다. 이는 그룹 전체가 정렬된 상태를 유지하도록 돕습니다. 만약 앞선 탐험가가 앞길이 막다른 길임을 깨닫는다면, 그룹 전체가 길을 잃기 전에 뒷사람에게 돌아가라고 말할 수 있습니다. 이는 계획이 시작과 끝이 서로 모순되지 않고 처음부터 끝까지 일관성을 유지하도록 보장합니다.
- 지도 확인하기 (가지치기, Pruning): 이 팀에는 특별한 규칙이 있습니다. 만약 어떤 경로가 절벽(불가능한 전환)으로 이어질 것 같다면, 즉시 차단합니다. 그들은 AI가 가진 "좋은 경로"에 대한 기억을 활용하여 이러한 막다른 길을 조기에 포착하는 영리한 기술을 사용합니다. 여행이 끝날 때까지 기다렸다가 길을 잃었다는 것을 깨닫는 것이 아니라, 나쁜 가지들이 자라나기도 전에 미리 쳐냅니다.
- 최선의 경로 선택하기 (선택, Selection): 경로를 확인한 후, 가장 유망한 탐험대원들만을 남겨 다음 단계로 보냅니다. 이는 마치 자동차 여행을 위한 '적자생존'과 같습니다.
이렇게 함으로써 CDGS는 "모드 평균화"의 함정을 피합니다. 뭉툭하고 불가능한 평균을 만드는 대신, 시작부터 끝까지 일관성 있고 제대로 작동하는 특정한 경로를 찾아냅니다.
연구 결과: 로봇, 파노라마, 그리고 영화
저자들은 이 새로운 방법을 세 가지 매우 다른 환경에서 테스트했으며, 그 결과는 매우 유망했습니다.
1. 로봇 놀이터
먼저, 로봇을 대상으로 CDGS를 테스트했습니다. 그들은 로봇에게 큐브를 한 곳에서 다른 곳으로 옮기는 과제를 주었지만, 약간의 변주를 주었습니다. 로봇은 갈고리를 사용해 큐브를 끌어당기거나, 먼저 다른 물체들을 치워야 했습니다. 이것들은 많은 단계의 순차적인 과정이 필요하기 때문에 "장기적(long-horizon)" 과제에 해당합니다.
- 결과: 이 테스트에서 CDGS는 기존의 가장 우수한 방식들과 대등하거나, 어떤 경우에는 더 나은 성능을 보였습니다. 로봇이 명시적인 단계 설명 없이도 복잡한 퍼즐을 풀 수 있도록 적절한 이동 순서를 찾아냈습니다. 이 논문은 CDGS가 방대한 양의 새로운 학습 데이터 없이도 이러한 과제를 수행할 수 있음을 시사하며, 이는 로봇 데이터를 수집하는 데 많은 시간과 비용이 든다는 점에서 큰 성과입니다.
2. 파노라마 화가
다음으로, 거대한 파노라마 이미지를 만드는 데 CDGS를 사용했습니다. 산맥의 사진을 찍는데, 한 번에 하나의 봉우리만 찍을 수 있다고 상상해 보세요. 전체 풍경을 보기 위해서는 이 사진들을 서로 이어 붙여야 합니다.
- 결과: CDGS를 사용하여 이 이미지들을 이어 붙였을 때, 최종 파노라마는 끊김 없이 매끄러웠습니다. 산맥은 완벽하게 맞물렸고, 하늘에는 이상한 글리치(오류)가 없었습니다. 단순히 가장자리를 "평균" 내는 다른 방식들과 비교했을 때, CDGS는 전체 이미지에 걸쳐 스타일을 일관되게 유지하며 훨씬 더 자연스러운 결과를 만들어냈습니다.
3. 영화 감독
마지막으로, 비디오 생성에 이를 테스트했습니다. 그들은 약 50프레임 정도의 짧은 영상 클립들을 가져와서, 이를 이어 붙여 긴 영상(최대 350프레임)을 만들고자 했습니다.
- 결결과: 여기서 핵심은 캐릭터의 일관성을 유지하는 것입니다. 만약 첫 번째 클립에서 판다가 기타를 치고 있다면, 두 번째 클립에서 갑자기 곰으로 변해서는 안 됩니다. CDGS는 긴 영상 내내 피사체의 모습이 동일하게 유지되도록 관리했습니다. 영상의 품질은 짧은 클립보다는 약간 낮았지만(저자들이 긴 영상에서 흔히 발생하는 트레이드오프라고 언급한 부분입니다), 캐릭터가 형태를 바꾸거나 변해버리는 다른 방식들에 비하면 훨씬 더 일관성이 높았습니다.
요약
저자들은 이 방법이 모든 문제를 즉시 해결하는 마법 지팡이는 아니라는 점을 분명히 하고 있습니다. 그들은 이 방법이 명확한 목표(예: "큐브를 초록색 지점으로 옮겨라")가 있어야 하며, "로컬" 전문가(작은 AI 모델들)가 이미 자신의 특정 업무에 대해 어느 정도 숙련되어 있을 때 가장 잘 작동한다는 점을 언급했습니다. 또한, 여러 경로를 동시에 확인해야 하기 때문에 실행하는 데 더 많은 컴퓨터 자원이 필요하다는 점도 인정했습니다.
하지만 이 논문은 CDGS가 AI가 장기적인 계획을 세우는 데 있어 더 똑똑해지도록 만드는 강력한 새로운 도구임을 강력하게 시사합니다. AI가 계획을 생성하는 방식에 직접 "탐색(search)" 과정을 심어둠으로써, 이전 방식들을 괴롭혔던 지저한 타협안들을 피할 수 있게 되었습니다. 로봇 팔이 어질러진 책상을 정리하는 법을 알아내든, 카메라가 광활한 풍경을 훑든, 혹은 영화 감독이 긴 이야기를 이어 붙이든, CDGS는 전체가 부분의 합보다 커지도록, 즉 최종 결과물이 단순한 수학적 평균이 아니라 일관성 있고 작동하는 현실이 되도록 보장하는 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.