← 최신 논문
🤖 machine learning

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

이 논문은 고정된 방향을 따라 이동하는 대신 표현 분포를 전송함으로써, 플로우 매칭 기반 시각-언어-행동 모델에서 미세한 행동 제어를 가능하게 하기 위해 고전적인 선형 방식의 한계를 극복하는 분포 매칭 스티어링 전략인 DiMaS를 소개한다.

원저자: Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 단순히 경직된 스크립트를 따르는 것이 아니라, 부드러운 밀기와 강한 밀치의 차이를 실제로 '느낄' 수 있는 세상을 상상해 보십시오. 이것은 컴퓨터가 카메라를 통해 세상을 보고, 언어를 통해 지침을 이해하며, 작업을 완수하기 위해 로봇 팔을 물리적으로 움직이는 법을 배우는 최첨단 인공지능의 영역인 시각-언어-행동(VLA) 모델의 영역입니다. 이 모델들을 모든 책을 읽고 모든 영상을 시청한 뒤, 이제 막 기계 손을 사용하는 법을 익히려는 초지능적인 두뇌라고 생각하십시오.

하지만 문제가 하나 있습니다. 이 로봇들은 무엇을 할 것인가(예: "컵을 집어라")에 대해서는 점점 더 잘하게 되고 있지만, 그것을 어떻게 할 것인가에 대해서는 여전히 다소 서툽니다. 우리는 로봇에게 "컵을 집되, 천천히 해줘" 또는 "집어 올리되, 너무 높이 들지는 마"라고 말할 수 있어야 합니다. AI 분야에서 이를 **행동 제어(behavioral control)**라고 부릅니다. 오랫동안 과학자들은 로봇의 내부 '생각'을 마치 자동차를 왼쪽으로 살짝 밀어 회전하게 만드는 것처럼, 직선 방향으로 단순히 밀어내는 방식으로 이 로봇들을 제어하려고 노력했습니다. 그러나 이 논문은 가장 최신의, 가장 진보된 로봇들에게는 그 직선형 밀기만으로는 충분하지 않다고 제안합니다. 그것은 마치 복잡한 춤을 추는 무용수에게 춤 자체가 회전, 굴신, 도약을 동시에 요구하고 있음에도 불구하고 단순히 "왼쪽으로 움직여"라고 말하며 춤의 방향을 조절하려는 것과 같습니다.

여기, 페가 카야탄(Pegah Khayatan)과 그녀의 팀이 제안한 새로운 방법론인 DiMaS(Distribution Matching for Steering, 분포 매칭 제어)가 등장합니다. DiMaS는 로봇의 내부 생각을 단일 방향으로 밀어내는 대신, 마치 숙련된 안무가처럼 '느린' 움직임의 전체 집합과 '빠른' 움직임의 전체 집합을 모두 살펴봅니다. 이 방식은 '느린' 집합과 '빠른' 집합의 정확한 형태를 학습한 다음, 로봇의 현재 생각을 '느린' 집합의 패턴에 맞도록 부드럽게 재형성합니다.

연구진은 이 방법을 오늘날 가장 똑똑한 로봇 두 가지 뇌인 SmolVLA𝜋0.5에 테스트했습니다. 이들은 로봇이 블록을 쌓거나 물체를 옮기는 등의 과제를 수행하는 가상 놀이터인 LIBERO를 사용했습니다. 연구 결과, 기존의 "직선형" 방법들은 일관성이 없었습니다. 때로는 작동하기도 했지만, 종종 속도나 높이를 변화시키는 데 실패하거나 로봇이 과제 자체를 실패하게 만들었습니다. 반면, DiMaS는 로봇이 더 느리게 움직이거나 물체를 더 낮게 들어 올리도록 성공적으로 가르쳤으며, 그 과정에서도 로봇이 과제를 완수할 수 있도록 궤도를 유지했습니다.

연구진은 또한 기존 방식들이 왜 실패했는지에 대해 매우 흥ek로운 사실을 발견했습니다. 그들은 로봇의 뇌 내부를 들여다보았고, "빠른" 생각과 "느린" 생각을 쉽게 구분할 수는 있지만(둘은 쉽게 분리됩니다), 단순히 숫자를 더하는 것만으로는 한 형태를 다른 형태로 바꿀 수 없다는 것을 발견했습니다. 그 관계는 너무 복잡해서, 마치 사각형을 한 방향으로 늘리는 것만으로는 원으로 만들 수 없는 것과 같습니다. 즉, 전체를 재형성해야 합니다. DiMaS는 바로 이 작업을 수행합니다. 원하는 행동에 맞도록 로봇의 내부 상태를 재형성하는 것입니다.

가장 인상적인 점은, 연구진이 이 새로운 기술이 로봇이 본 적 없는 과제로 전이될 수 있는지 테스트했다는 것입니다. 그들은 로봇에게 한 세트의 퍼즐을 사용하여 느리게 움직이는 법을 가르친 뒤, 완전히 다른 퍼즐을 해결하도록 했습니다. 이 방법은 놀라울 정도로 잘 작동했으며, 이는 로봇이 특정 게임을 위한 특정 기술을 암기한 것이 아니라 "느리게 움직인다"는 일반적인 규칙을 학습했음을 시사합니다. 비록 과제가 매우 달라지거나 로봇이 아주 오랫동안 움직여야 할 때 조금 더 어려움을 겪기는 했지만, 과제를 완수하는 능력을 깨뜨리지 않으면서 로봇의 움직임을 제어하는 능력은 중요한 진전입니다.

요약하자면, 이 논문은 진정한 로봇 제어를 위해서는 그들의 내부 정신을 단순히 높낮이를 조절할 수 있는 다이얼처럼 취급하는 것을 멈춰야 한다고 제안합니다. 대신, 우리는 그것들을 복잡한 지형으로 취급해야 하며, Di-MaS라는 지도를 사용하여 한 유형의 행동에서 다른 유형의 행동으로 안내함으로써, 그들이 춤을 추는 내내 길을 잃지 않도록 해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →