← 최신 논문
🤖 machine learning

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

이 논문은 국소적으로 안정적인 영역의 선택적 재노이징을 통해 반복적인 교차 호라이즌 수정을 가능하게 함으로써 장기 호라이즌 계획, 정책 학습 및 통합 비디오-액션 모델링에서 기존 방법들을 크게 능가하는 새로운 확산 기반 로봇 순차 예측 프레임워크인 Diffusion ReRoll을 제안한다.

원저자: Seonsoo Kim, Seongil Hong, Jun-Gill Kang

게시일 2026-07-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seonsoo Kim, Seongil Hong, Jun-Gill Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 복잡한 미로를 탐색하거나 컵을 쌓는 것과 같은 섬세한 작업을 가르치고 있다고 상상해 보십시오. 이를 위해 로봇은 한 번에 한 단계씩 움직이는 것이 아니라, 미래의 움직임 전체 시퀀스를 한꺼번에 예측해야 합니다. 인공지능의 세계에서 이러한 예측을 수행하기 위한 인기 있는 도구는 "디퓨전 모델(diffusion model)"이라고 불립니다. 디퓨전 모델을 노이즈와 정적(static)으로 가득 찬 진흙 덩어리에서 시작하는 조각가라고 생각해 보십시오. 조각가는 노이즈를 한 단계씩 천천히 깎아내며 로봇의 미래 경로라는 매끄럽고 완벽한 조각상을 드러냅니다. 보통 이 과정은 일방향입니다. 조각가는 시퀀스의 시작부터 끝까지 노이즈를 제거하며, 한 부분이 매끄러워지면 다시는 그 부분을 건드리지 않습니다.

이러한 "한 번에 끝내는(one-and-done)" 방식의 문제는 만약 조각가가 초기에 작은 실수를 한다면, 예를 들어 벽을 잘못된 위치에 깎아 놓는다면, 그 실수를 그대로 안고 가야 한다는 점입니다. 다시 돌아갈 수 없기 때문에 나머지 조각상이 무너지거나, 로봇이 막다른 길로 곧장 향하는 경로를 계획할 수도 있습니다. 이는 로봇 공학에서 매우 중요한 문제입니다. 자신의 잘못된 추측을 스스로 수정할 수 없는 로봇은 위험하고 비효율적이기 때문입니다. 과학자들은 이러한 AI 모델이 전체 시퀀스의 구조를 잃지 않으면서도, 진행 과정에서 자신의 실수를 "되돌리고(undo)" 계획을 다듬을 수 있는 방법을 찾아내기 위해 노력해 왔습니다.

여기서 **디퓨전 리롤(Diffusion ReRoll)**이라는 새로운 방법이 등장합니다. 이 논문의 저자들인 국방과학연구소(Agency for Defense and Development) 연구진은 표준적인 조각 과정에 영리한 변주를 제안합니다. 전체 조각상을 처음부터 끝까지 한 번에 매끄럽게 만드는 대신, 조각가가 잠시 멈추어 완성된 부분들을 살펴보고 "잠깐, 이 벽이 좀 이상한데"라고 깨닫게 합니다. 이때가 되면 조각가는 그 부분을 그냥 무시하는 것이 아니라, 해당 특정 구역을 다시 노이즈가 가득한 진흙 상태로 되돌린 다음, 이번에는 전체 조각상의 맥락을 활용하여 다시 매끄럽게 다듬기 시작합니다.

이 논문은 이 과정을 "리롤(ReRoll)"이라고 부릅니다. 당신이 이야기를 쓰고 있다고 상상해 보십시오. 기존 방식에서는 첫 번째 장을 쓰고 나서 두 번째 장을 쓰며, 일단 첫 번째 장을 마치면 그 내용이 이후의 결말을 망치더라도 다시는 수정하지 않습니다. 하지만 디퓨전 리롤 방식에서는, 이야기를 써 내려가다가 초반의 내용이 방금 상상한 결말과 잘 맞지 않는다는 것을 깨달을 수 있습니다. 그래서 당신은 그 도입부를 "리롤"합니다. 즉, 그 단어들을 다시 엉망인 초안 상태로 되돌려 놓은 뒤, 이제 이야기의 결말을 알게 된 상태에서 다시 써 내려가는 것입니다. 이를 통해 로봇의 계획은 유연성을 유지할 수 있습니다. 만약 로봇이 국지적으로는 좋아 보이지만 전체적으로는 좋지 않은 움직임을 예측한다면, 시스템은 그 특정 움직임을 "리롤"하여 전체 시퀀스가 조화를 이룰 때까지 다듬을 수 있습니다.

연구진은 이 아이디어를 실제 로봇 작업처럼 설계된 컴퓨터 게임 세계와 같은 여러 시뮬레이션 환경에서 테스트했습니다. 그들은 이 새로운 "리롤" 방식과 표준적인 "일방향" 디퓨전 모델 및 다른 기존 기술들을 비교했습니다. 결과는 유망했습니다. 장거리 미로 탐색 작업에서 리롤 방식은 선행 기술인 디퓨전 포싱(Diffusion Forcing)보다 약 21%, 또 다른 방식인 디퓨저(Diffuser)보다 23% 더 높은 성공률을 보였습니다. 로봇이 물체를 조작하는(예: 머그컵을 집어 올리는) 일련의 동작을 학습해야 하는 작업에서는 개선 효과가 더욱 극적이었습니다. 표준 디퓨전 폴리시(Diffusion Policy) 대비 성공률이 **56.5%**나 증가했습니다.

이 논문은 계획의 일부를 선택적으로 "뒤섞고 다듬는(scramble and refine)" 능력이 강력한 도구임을 시사합니다. 이는 로봇이 너무 일찍 잘못된 계획에 고착되는 것을 방지하여, 더 오랫동안 선택지를 열어둘 수 있게 해줍니다. 저자들은 이러한 결과가 아직 실제 물리적 로봇이 아닌 컴퓨터 시뮬레이션에서 나온 것이지만, AI 모델에게 자신의 생각을 수정할 수 있는 방법을 제공하는 것이 훨씬 더 똑똑하고 신뢰할 수 있는 행동으로 이어질 수 있음을 보여준다고 언급했습니다. 이는 로봇이 단순히 경직된 대본을 따르는 것이 아니라, 스스로 생각하고, 실수를 깨닫고, 그 자리에서 바로 수정할 수 있는 단계로 나아가는 발걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →