Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Dynin-Robotics는 언어, 시각, 행동을 이산 토큰으로 취급하여 목표 예측, 역학 모델링, 행동 생성을 공동으로 학습함으로써 공유된 궤적 모델링과 테스트 시간 스케일링을 통해 여러 벤치마크에서 경쟁력 있는 성능을 달나 성취하는 옴니모달 통합 확산 모델을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 인간처럼 세상을 이해하는 데 어려움을 겪어 왔습니다. 기계는 팔을 특정 좌표로 움직이도록 프로그래밍될 수는 있지만, "포장을 자를 만한 것을 건네줘"와 같은 모호한 지시를 이해해야 하는 작업에서는 종종 실패하곤 합니다. 이를 해결하기 위해 연구자들은 언어, 시각, 그리고 물리적 움직임을 하나의 뇌로 연결하는 시스템을 구축하고 있습니다. 비전-언어-행동(vision-language-action) 모델이라고 불리는 이 시스템들은 단순히 물체가 무엇인지 배우는 것을 넘어, 그 물체가 어떻게 행동하고 어떻게 조작되는지를 배우고자 합니다. 지금까지의 과제는 대부분의 현재 접근 방식들이 이러한 기술들을 별개로 취급해 왔다는 점입니다. 즉, 시스템의 한 부분은 단어를 이해하고, 다른 부분은 이미지를 인식하며, 세 번째 부분은 운동 명령을 계산하는 식입니다. 이러한 분리는 실제 환경이 변하거나 지시가 예상치 못한 방식으로 표현될 때 로봇을 혼란에 빠뜨리곤 합니다.
서울대학교의 한 연구팀은 이러한 분리된 기술들을 하나의 응집된 모델로 통합하는 'Dynin-Robotics'라는 새로운 접근 방식을 선보였습니다. 로봇의 뇌를 서로 다른 작업을 위한 여러 모듈로 구축하는 대신, 그들은 한 번에 여러 방식으로 미래를 예측하는 법을 배우는 단일 시스템을 만들었습니다. 예를 들어, 어떤 작업을 수행할 때 단순히 다음 동작을 계산하는 것이 아니라, 그 동작 이후의 장면이 어떻게 보일지, 최종 목표 상태는 어떠해야 하는지, 그리고 그 작업을 말로 어떻게 설명할 것인지를 함께 상상하는 로봇을 떠올려 보십시오. 이 단일 모델이 이 모든 예측을 동시에 처리하도록 훈련함으로써, 연구진은 로봇이 훈련받은 것과 다른 방식으로 지시가 내려지더라도 훨씬 더 잘 따르게 된다는 것을 발견했습니다.
이 시스템의 핵심은 '마스크 확산(masked diffusion)'이라 불리는 방법입니다. 간단히 말해, 이는 모델에게 작업의 비디오, 서술된 지시문, 로봇의 움직임과 같은 정보의 시퀀스를 보여주되, 그 시퀀스의 일부를 숨기거나 '마스킹(masking)'하는 학습 과정입니다. 모델의 임무는 보이는 부분을 보고 숨겨진 부분이 무엇이어야 하는지 추측하는 것입니다. 예를 들어, 컵의 사진과 "컵을 집어라"라는 문구는 보이지만 움직임 데이터가 숨겨져 있다면, 모델은 올바른 동작을 예측해야 합니다. 또 다른 시나리오에서는 움직임과 지시문은 보이지만 컵을 손에 쥐고 있는 최종 모습이 숨겨져 있다면, 모델은 그 결과를 예측해야 합니다. 130만 개 이상의 로봇 궤적 데이터셋을 통해 이러한 다양한 유형의 추측 게임을 연습함으로써, 모델은 언어, 시각, 행동이 어떻게 연결되어 있는지에 대한 깊은 이해를 학습하게 됩니다.
이 접근 방식이 독특한 점은 동일한 모델이 즉각적으로 이러한 다양한 역할들 사이를 전환할 수 있다는 것입니다. 이 모델은 다음 동작을 결정하는 정책(policy)이 될 수도 있고, 동작 후 카메라에 무엇이 보일지 예측하는 세계 모델(world model)이 될 수도 있으며, 최종 성공 상태를 시각화하는 목표 예측기(goal predictor), 또는 로봇이 작업하는 영상을 보고 원래의 지시를 재구성하는 교사(teacher)가 될 수도 있습니다. 이러한 유연성 덕분에 시스템은 자신의 예측을 사용하여 성능을 개선할 수 있습니다. 예를 들어, 로봇은 팔을 어떻게 움직일지 결정하기 전에 먼저 목표 상태가 어떤 모습일지 예측할 수 있습니다. 그런 다음 예측된 목표를 가이드로 삼아 행동 계획을 정교하게 다듬습니다. 이처럼 앞을 내다보고 실시간으로 계획을 조정하는 과정은 꽃을 꽃병에 꽂거나 블록을 특정 순서대로 쌓는 것과 같이 정밀한 정렬이 필요한 복잡한 작업을 처리하는 데 도움을 줍니다.
연구진은 이 시스템이 다른 선도적인 로봇 모델들과 비교하여 얼마나 잘 수행되는지 확인하기 위해 다양한 벤치마크에서 테스트를 진행했습니다. 표준 시뮬레이션 작업에서 이 모델은 98.1%의 성공률을 달-성하며 해당 분야의 최상위권에 올랐습니다. 더욱 중요한 것은, 지시 사항이 더 간접적이거나 추상적으로 바뀌었을 때의 테스트에서도 이 시스템이 뛰어난 적응력을 보여주었다는 점입니다. 한 실험 세트에서 모델은 "사과를 집어라"와 같은 직접적인 명령 대신 "자연스럽게 달콤하고 즙이 많은 것"과 같은 묘사를 바탕으로 과일을 선택해야 하는 과제를 수행했습니다. 다른 모델들이 이러한 언어적 변화에 어려움을 겪는 동안, Dynin-Robotics는 특정 문구를 암기한 것이 아니라 작업의 근본적인 개념을 학습했음을 입증하며 높은 성공률을 유지했습니다.
이 시스템은 실제 환경에서도 효과적임을 입증했습니다. 연구진은 이 모델을 '프랑카 리서치 3(Franka Research 3)'라는 물리적 로봇 팔에 배치했습니다. 과일을 집거나, 색깔별로 큐브를 분류하고, 특정 순서로 쌓는 등의 일련의 실제 테스트에서, 로봇은 네 가지 조작 조건에 걸쳐 평균 78.4%의 성공률을 기록했습니다. 이 성능은 특히 사용자가 지정한 색상 순서에 따라 큐브를 쌓는 것과 같이 단계별 순서를 따라야 하는 작업에서 강력한 모습을 보였습니다. 목표와 중간 단계를 시각화하는 능력 덕분에 로봇은 실수를 했을 경우 경로를 수정할 수 있었는데, 이는 단순한 시스템에서는 흔히 볼 수 없는 기능입니다.
이 모델은 로봇 제어를 넘어, 묘사를 이해하고 생성하는 놀라운 능력도 보여주었습니다. 로봇이 작업을 수행하는 영상을 보여주면, 시스템은 "집다", "놓다", "접다"와 같은 동사를 사용하고 색상과 위치로 물체를 식별하며 무슨 일이 일어나고 있는지 정확하게 설명할 수 있었습니다. 반대로, 작업 설명을 주면 최종 장면이 어떻게 보일지에 대한 시각적 예측을 생성할 수 있었습니다. 이러한 능력은 모델이 단순한 운동 제어를 넘어 물리적 세계에 대한 풍부하고 내부적인 표현을 구축했음을 시사합니다.
실시간 사용이 가능할 정도로 시스템을 빠르게 만들기 위해, 연구진은 모델을 실행하는 특화된 방법도 개발했습니다. 이 모델은 추측을 반복적으로 정교화하는 방식으로 작동하기 때문에, 매 단계를 하나씩 처리해야 한다면 속도가 느려질 수 있습니다. 연구팀은 모델이 여러 단계의 움직임을 동시에 예측하고 확정할 수 있는 기술을 개발했습니다. 이 최적화는 모델의 의사결정 속도를 표준 방식보다 거의 30배 빠르게 만들어, 물리적 로봇의 속도에 맞춰 따라갈 수 있는 하드웨어에서 복잡한 모델을 실행하는 것을 가능하게 했습니다.
이 연구의 결과는 로봇 학습을 통합된 예측 문제로 다루는 것이 강력한 전략임을 시사합니다. 언어를 이해하고, 시각적 변화를 예측하며, 행동을 생성하는 능력을 하나의 프레임워크로 결합함으로써, 연구진은 이전 모델들보다 더 견고하고 적응력이 뛰어난 시스템을 만들어냈습니다. Dynin-Robotics의 성공은 로봇이 미래를 상상하고 작업의 맥락을 이해할 수 있을 때, 현실 세계의 예측 불가능한 성격을 훨씬 더 잘 다룰 수 있음을 보여줍니다. 아직 더 길고 복잡한 일련의 동작으로 기능을 확장하는 등의 과제가 남아 있지만, 이 접근 방식은 진정으로 환경을 이해하고 상호작용할 수 있는 로봇을 향한 유망한 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.