← 최신 논문
💻 computer science

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

이 논문은 디노이징 궤적의 결합 확률을 최적화함으로써 주변 행동 확률의 계산 불가능성을 극복하고, 통합된 가변 단계 스케줄링 접근 방식을 통해 로봇 조작 벤치마크에서 최첨단 성능을 달와하는 이산 확산 시각-언어-행동 모델을 위한 강화 학습 프레임워크인 dVLA-RL을 소개한다.

원저자: Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 수플레와 같은 복잡한 요리를 가르치고 있다고 상상해 보세요.

과거의 방식 (The "Copycat" Problem - 모방꾼 문제):
이전에는 로봇이 인간 셰프가 하는 동작을 한 번 보고 그대로 따라 하는 방식으로 학습했습니다. 이것을 "지도 미세 조정(Supervised Fine-Tuning)"이라고 합니다. 단순한 작업에는 효과적이지만, 주방이 지저도해지거나 재료가 약간만 달라져도 로봇은 당황하며 실패합니다. 이는 마치 연습 시험의 답을 통째로 외웠지만, 새로운 문제는 풀지 못하는 학생과 같습니다.

새로운 도구 (The "Denoising" Robot - 노이즈 제거 로봇):
최근 과학자들은 dVLA(이산 확산 시각-언어-행동 모델)라는 새로운 유형의 로봇 두뇌를 만들었습니다. 이 로봇은 다음 동작을 즉각적으로 결정하는 대신, "노이즈"가 섞인 방식으로 생각합니다. 로봇이 낙서로 가득 찬 빈 종이에서 시작한다고 상상해 보세요(노이즈). 그런 다음 로봇은 낙서를 단계적으로 지워나가며 완벽한 레시피를 드러냅니다.

  • 1단계: 몇 단어를 추측합니다.
  • 2단계: 보이는 것을 바탕으로 그 단어들을 정교하게 다듬습니다.
  • 3단계: 레시피를 완성합니다.

이 "천천히 드러내는" 과정은 로봇이 마치 예술가가 밑그림을 그린 뒤 잉크를 입히듯, 반복적으로 계획을 정교하게 다듬을 수 있게 해줍니다.

잃어버린 조각 (The "Reinforcement Learning" Gap - 강화 학습의 공백):
이 "천천히 드러내는" 로봇은 똑똑했지만, 여전히 모방꾼에 불과했습니다. 스스로의 실수로부터 배우지 못했기 때문입니다. 과학자들은 로봇이 무언가를 시도하고, 성공하면 "엄지 척(보상)"을 받고, 실패하면 "엄지 아래(벌점)"를 받으며 시간이 흐를수록 더 잘하도록 만드는 방법인 **강화 학습(RL)**을 사용하고 싶어 했습니다.

큰 문제점:
수학적인 장애물이 있었습니다. 표준적인 로봇 두뇌에서는 정답을 맞힐 확률을 쉽게 계산할 수 있습니다. 하지만 이 "천천히 드러내는" 로봇의 경우, 최종 답변은 일련의 긴 추측 과정을 거친 결과물입니다. 로봇이 취할 수 있었던 모든 가능한 경로를 살펴보며 최종 결과의 정확한 확률을 계산하려는 것은, 조수의 흐름을 예측하기 위해 해변의 모든 모래알을 세려는 것과 같습니다. 이는 수학적으로 불가능(intractable)합니다.

해결책: dVLA-RL (The "Journey" Approach - 여정 접근법)
논문의 저자들은 dVLA-RL을 통해 질문을 바꾸어 이 문제를 해결했습니다. "어떻게 하면 완벽한 최종 답안에 도달할 확률이 높은가?"라고 묻는 대신, "우리가 방금 걸어온 '특정한 경로'를 따를 확률은 얼마인가?"라고 물었습니다.

비디오 게임을 생각해보세요:

  • 과거의 수학: 게임을 시작하기도 전에 토너먼트 전체에서 우승할 확률을 계산하려고 노력하는 것.
  • 새로운 수학 (dVLA-RL): 다음 레벨에 도달하기 위해 방금 밟았던 구체적인 단계들을 밟을 확률을 계산하는 것.

로봇의 "천천히 드러내는" 과정을 하나의 단계별 여정(궤적)으로 취급함으로써, 그들은 표준적인 강화 학습을 사용하여 로봇을 가르칠 수 있었습니다. 그들은 최종 결과만이 아니라, 문제를 해결하기 위해 로봇이 거친 '전체 경로'에 대해 보상을 줍니다.

"하이브리드" 전략 (The "Smart Scheduler" - 스마트 스케줄러)
논문은 또한 Hybrid dVLA-RL이라는 영리한 기법을 도입했습니다.

  • 쉬운 작업: 로봇이 컵을 집는 것과 같은 단순한 작업에 능숙하다면, 굳이 10단계를 거쳐 생각할 필요가 없습니다. 단 1~2단계만으로도 충분합니다. 이는 시간과 에너지를 절약해 줍니다.
  • 어려운 작업: 블록을 쌓는 것과 같이 복잡한 작업의 경우, 로봇은 계획을 생각하고 정교하게 다듬기 위해 더 많은 단계를 밟을 수 있도록 허용됩니다.

이는 마치 선생님이 쉬운 문제에는 짧은 퀴즈를 내고, 어려운 연구 논문에는 에세이 형식을 허용하는 것과 같습니다. 이를 통해 로봇은 쉬운 일에는 더 빠르게, 어려운 일에는 더 똑똑하게 대처할 수 있습니다.

결과
연구팀은 두 가지 주요 로봇 훈련장에서 테스트를 진행했습니다:

  1. LIBERO: 단일 팔 로봇을 위한 시뮬레이션입니다. 새로운 방식은 99.7%의 성공률을 달 achievement, 사실상 과업을 완벽하게 수행했습니다.
  2. RoboTwin 2.0: 인간처럼 두 팔을 사용하는 더 어려운 시뮬레이션입니다. 새로운 방식은 기존의 "모방꾼" 버전보다 성공률을 30.6% 향상시켰으며, 다른 최고 수준의 로봇 두뇌들을 능가했습니다.

요약
이 논문은 "천천히 생각하는" 로봇이 자신의 경험으로부터 배우는 방법을 제시합니다. 최종 결과에 대한 불가능한 수학적 계산에 막히는 대신, 그곳에 도달하기 위해 거친 구체적인 여정을 통해 학습하도록 만듭니다. 이 방식은 로봇이 명령을 따르고 복잡한 물리적 과업을 수행하는 능력을 현저히 향상시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →