← 최신 논문
💻 computer science

DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

이 논문은 중간 디노이징 단계에 상태 의존적 크레딧을 할당함으로써 디퓨전 기반 로봇 정책을 강화하고, 이를 통해 기존의 미세 조정 방식보다 더 효율적인 탐색과 우수한 작업 성능을 가능하게 하는 정책 경사 방법론인 Denoising Intermediate Advantage (DIA)를 소개한다.

원저자: Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic, Alan Aspuru-Guzik

게시일 2026-09-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic, Alan Aspuru-Guzik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간과 같은 정교한 손재주로 물체를 조작할 수 있는 로봇은 오랫동안 인공지능의 목표였지만, 이들에게 그러한 능력을 가르치는 것은 섬세한 균형 잡기 과정입니다. 수년 동안 가장 효과적인 방법은 로봇이 인간이 과업을 수행하는 영상을 보고 그 움직임을 모방하며 배우는 '행동 복제(behavior cloning)'였습니다. 이 방식은 디퓨전(diffusion)이라 불리는 기술에 기반한 강력하고 새로운 부류의 로봇 컨트롤러를 탄생시켰습니다. 마치 조각가가 거친 돌덩어리에서 시작하여 점차 재료를 깎아내어 조각상을 드러내는 것과 마찬가지로, 이 디퓨전 모델들은 무작위 노이즈에서 시작하여 이를 정밀한 일련의 동작으로 서서히 정교화합니다. 이 방법은 인간의 시연이 가진 다양성과 미묘한 차이를 포착하는 데는 탁월하지만, 근본적인 한계가 있습니다. 즉, 로봇은 자신이 보여준 데이터의 품질과 다양성에 엄격하게 묶여 있다는 점입니다. 만약 훈련 영상에서 로보가 새로운 방식으로 문제를 해결하는 모습을 보여준 적이 없다면, 로봇은 실제 세계에서 그 문제에 직면했을 때 실패할 가능성이 높습니다. 이를 극려하기 위해 연구자들은 디퓨전 모델을 강화 학습(reinforcement learning)과 결합하기 시작했습니다. 강화 학습은 에이전트가 시행착오를 통해 배우며, 좋은 결과에는 보상을, 실수는 벌칙을 받는 기법입니다. 그러나 문제는 디퓨전 모델이 한 번에 하나의 결정을 내리는 것이 아니라, 정교화라는 길고 단계적인 과정을 통해 동작을 생성한다는 점입니다. 그 긴 연쇄 과정 중 정확히 어떤 단계가 성공이나 실패의 원인이 되었는지 결정하는 것은 기존 방식들에게 어려운 난제로 밝혀졌습니다.

토론토 대학교와 벡터 연구소(Vector Institute)의 연구팀은 이 문제를 해결하기 위한 '디노이징 인터미디어트 어드밴티지(Denoising Intermediate Advantage, 이하 DIA)'라는 새로운 솔루션을 제안했습니다. 이들의 연구는 현재의 시스템이 로봇의 학습 과정에 공로를 돌리는 방식의 특정 결함을 다룹니다. 표준적인 접근 방식에서는 로봇이 긴 정교화 과정을 거쳐 과업을 성공적으로 완료했을 때, 시스템은 그 시퀀스의 모든 단계에 동일한 양의 공로를 부여합니다. 이는 마치 화가 팀이 벽화를 완성하기 위해 협력하고 있는데, 관리자가 특정 붓터치가 사소한 세부 사항이었는지 아니면 전체 이미지를 정의하는 결정적인 선이었는지와 상관없이 모든 붓터치에 똑같이 찬사를 보내는 것과 같습니다. 연구자들은 이 과정이 비효율적이라고 주장하는데, 생성 과정의 중간 단계들이 로봇이 어디를 향해 가고 있는지에 대한 가치 있는 정보를 담고 있기 때문입니다. 전체 정교화 연쇄를 하나의 덩어리로 취급함으로써, 이전 방식들은 각 단계에서 이루어진 구체적인 결정으로부터 배울 수 있는 기회를 놓쳤습니다.

이를 해결하기 위해 DIA 방식은 마지막 단계뿐만 아니라 정교화 과정의 매 단계마다 로봇의 진행 상황을 평가하는 방법을 도입합니다. 이 시스템은 형성되고 있는 동작의 가치를 단계별로, 형태가 갖춰짐에 따라 예측하는 법을 배웁니다. 이를 통해 로봇은 어떤 중간 결정이 최종 결과에 다른 결정보다 더 중요한지를 이해할 수 있게 됩니다. 과업이 완료될 때까지 기다리는 대신, 시스템은 생성 과정 전반에 걸쳐 피드백을 제공하여 로봇이 더 나은 선택을 하도록 유도합니다. 이는 로봇이 운 좋게 성공한 것인지 아니면 잘 실행된 전략인지를 구분할 수 있게 돕는 더 미묘한 학습 신호를 만들어냅니다. 연구진은 단순한 물체 조작부터 로봇이 장시간 동안 팔을 협응시켜 움직여야 하는 복잡한 다단계 조립 작업에 이르기까지 네 가지 서로 다른 로봇 과업 세트에 대해 이 접근 방식을 테스트했습니다.

테스트 결과는 일관되고 유의미했습니다. 물체를 들어 올리거나, 캔을 옮기거나, 사각형을 그리는 등의 과업을 포함하는 표준 벤치마크인 로보미믹(Robomimic)에서 DIA 방식은 기존 기술들을 지속적으로 능가했습니다. 로봇이 두 팔을 사용하여 물체를 옮겨야 하는 가장 어려운 과업인 양손 운반 챌린지에서, 이 새로운 방식은 기존의 최고 방식보다 23% 더 높은 보상 점수를 달성하면서도 동일하게 높은 성공률을 유지했습니다. 이러한 개선은 단순히 일을 더 자주 해내는 것에 그치지 않고, 더 잘 해내는 것에 관한 것이었습니다. DIA로 훈련된 로봇은 성공 상태에 더 빠르게 도달했으며, 과업을 완료하는 데 더 적은 단계를 소요했습니다. 특정 테스트에서 로봇이 성공하는 데 걸리는 시간은 21% 단축되었습니다. 이는 로봇이 단순히 해결책을 우연히 찾아낸 것이 아니라, 목표를 향한 더 효율적인 경로를 학습했음을 시사합니다.

이 방법의 위력은 연구진이 훈련 데이터가 불완전하거나 전체 해결책이 누락된 과업에서 테스트했을 때 더욱 분명해졌습니다. 로봇이 가스레인지를 켜거나 캐비닛을 여는 것과 같은 일련의 하위 과업을 수행해야 하는 주방 시뮬레이션에서, 표준 훈련 데이터는 종종 전체 시퀀스의 일부만을 보여주었습니다. 이전 방식들은 여기서 어려움을 겪었으며, 훈련 영상에서 본 정확한 패턴에 너무 의존했기 때문에 루프에 빠지거나 무관한 동작을 반복하곤 했습니다. 그러나 DIA 방식은 관찰된 부분적인 시연들을 재조합하여 완전히 새로운 성공적인 동작 시퀀스를 만들어낼 수 있었습니다. 단일 시연이 전체 과업을 보여주지 않았던 가장 까end로운 버전의 테스트에서, 베이스라인 방식들은 성공률 0%를 기록하며 완전히 실패했습니다. 반면 DIA 방식은 69%의 성공률을 기록했습니다. 이 방식은 원래의 훈련 예시에는 명시적으로 존재하지 않았던 전략을 효과적으로 학습하여, 필요한 단계들을 짜 맞추어 과업을 완수해 냈습니다.

이러한 발견은 로봇이 의사 결정의 중간 단계에 주목함으로써 훈련 데이터의 한계를 극복할 수 있음을 시사합니다. 이 방법은 로봇이 단순히 본 것을 복사하는 것이 아니라, 새로운 전략을 탐색하고 문제를 해결하는 더 효율적인 방법을 발견할 수 있게 해줍니다. 실험은 시뮬레이션 환경에서 수행되었지만, 결과는 로봇이 복잡한 실제 환경에 더 유연하게 적응할 수 있는 미래를 향한 이정표를 제시합니다. 연구진은 다음 단계가 이러한 아이디어들을 실제 로봇에 테스트하는 것이며, 이 과정에서 실제 세계의 데이터를 수집하는 실질적인 과제를 극복해야 할 것이라고 언급했습니다. 현재로서는, 로봇의 사고 과정 중 적절한 순간에 공로를 돌리는 것이 훨씬 더 똑똑하고 유능한 기계를 만드는 길임을 이 연구가 입증하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →