← 최신 논문
🤖 machine learning

ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation

이 논문은 장거리 로봇 조작을 위한 밀집적이고 차별화된 피드백을 제공하기 위해 6000 만 프레임 규모의 대규모 데이터셋 (ProcCorpus-60M) 으로 훈련된 비전 - 언어 모델인 ProcVLM 을 소개하며, 이 모델은 남은 원자적 행동과 시각적 변화를 추론함으로써 절차 기반의 진행 보상을 학습합니다.

원저자: Youhe Feng, Hansen Shi, Haoyang Li, Xinlei Guo, Yang Wang, Chengyang Zhang, Jinkai Zhang, Xiaohan Zhang, Jie Tang, Jing Zhang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Youhe Feng, Hansen Shi, Haoyang Li, Xinlei Guo, Yang Wang, Chengyang Zhang, Jinkai Zhang, Xiaohan Zhang, Jie Tang, Jing Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 ProcVLM 논문에 대한 설명으로, 일상적인 비유를 통해 간단한 개념으로 나누어 정리한 것입니다.

큰 문제: "시간의 함정"

로봇에게 케이크 굽는 법을 가르친다고 상상해 보세요.

  • 옛날 방식: 대부분의 로봇은 완벽한 케이크가 만들어지는 영상을 보고 배웁니다. 하지만 로봇이 케이크를 만들다가 밀가루를 떨어뜨리면, 기존 시스템은 대개 "결국 실패했다"고만 말합니다. 왜 실패했는지, 혹은 실수하기 전까지 로봇이 얼마나 진척되었는지는 알지 못합니다.
  • "시간"의 함정: 일부 시스템은 시계를 보고 진척도를 추측하려 합니다. "10 초가 지났으니 로봇은 50% 완료되었을 거야!"라고 생각하지만, 이는 잘못되었습니다. 로봇이 미끄러운 숟가락을 잡으려고 10 초를 보냈다면, 실제로는 아무런 진척도 이루지 못한 것입니다. 시간이 지났다고 해서 일이 해결된 것은 아닙니다.

이 논문의 저자들은 이렇게 말합니다: *로봇은 단순히 시계나 최종 결과만 보는 것이 아니라, 단계를 이해하는 선생님이 필요합니다.*

해결책: ProcVLM ("단계별" 코치)

이 팀은 ProcVLM이라는 새로운 AI 모델을 개발했습니다. 이는 로봇이 작업하는 모습을 지켜보며 과정이 어떻게 진행되고 있는지에 대해 끊임없이 피드백을 제공하는 매우 예리한 코치라고 생각하면 됩니다.

작동 원리 ("추론 우선" 트릭):
단순히 숫자 (예: "70% 완료") 를 추측하는 대신, ProcVLM은 말하기 전에 생각하는 인간 코치처럼 행동합니다.

  1. 장면을 봅니다: "좋아, 로봇이 파란 접시를 들고 있군."
  2. 계획에 대해 추론합니다: "목표는 접시를 선반에 넣는 것입니다. 로봇은 이미 접시를 씻었습니다. 이제 잡아서 들어 올린 뒤 선반에 밀어 넣어야 합니다."
  3. 진척도를 계산합니다: "씻는 작업은 끝냈고 현재 들어 올리는 중이므로, 약 80% 완료된 상태입니다."

이 "추론 후 추정" 접근 방식은 로봇이 다음 단계 (들어 올리기 등) 에서 막히더라도 이전 하위 단계 (씻기 등) 를 완료한 것에 대해 점수를 받을 수 있게 해줍니다.

학습 데이터: "6 천만 프레임" 도서관

ProcVLM 을 훌륭한 코치로 가르치기 위해 연구자들은 방대한 예제 도서관을 구축해야 했습니다.

  • 도전 과제: 실제 로봇 영상에는 보통 "시작"과 "종료" 라벨만 있습니다. 로봇이 매초마다 무엇을 하고 있는지에 대한 라벨은 없습니다.
  • 해결책: 그들은 초지능 AI(대규모 VLM 주석자) 를 이용해 40 만 개의 로봇 영상을 시청하게 하고, 모든 단일 프레임에 대한 상세한 메모를 자동으로 작성하도록 했습니다.
    • 로봇이 방금 무엇을 했는가? (예: "컵을 잡았다")
    • 남은 작업은 무엇인가? (예: "컵을 싱크대에 넣는다")
    • 작업이 완료되었는가? (예: "예/아니오")
  • 결과: 그들은 ProcCorpus-60M이라는 데이터셋을 만들었으며, 여기에는 6 천만 개의 주석 달린 프레임이 포함되어 있습니다. 이는 목차만 있는 40 만 페이지짜리 책을 각 페이지마다 상세한 요약이 있는 책으로 바꾼 것과 같습니다.

"VQA" 게임: 질문을 통해 배우기

연구자들은 이 거대한 도서관을 ProcVQA라는 게임으로 변모시켰습니다. 단순히 보는 것 대신, AI 는 다음과 같은 질문에 답해야 했습니다.

  • "지금 어떤 행위가 일어나고 있는가?"
  • "로봇이 취해야 할 다음 단계는 무엇인가?"
  • "보는 바에 비추어 볼 때, 작업의 몇 퍼센트가 완료되었는가?"

6 천만 개의 예제로 이 게임을 반복하며 플레이함으로써 ProcVLM은 단순히 그림을 보는 것을 넘어 작업의 논리를 이해하게 되었습니다.

중요성: "밀집 보상"

로봇 학습 세계에서는 "보상"이 간식과 같습니다.

  • 희소 보상 (옛날 방식): 로봇은 작업이 100% 완벽하게 끝났을 때만 간식을 받습니다. 중간에 실패하면 아무것도 받지 못합니다. 이는 학습을 느리게 하고 좌절감을 줍니다.
  • 밀집 보상 (ProcVLM): ProcVLM은 매 단계마다 로봇에게 "간식"(피드백) 을 줍니다. "블록을 잡은 잘했어!" "그래, 떨어뜨렸지만 여전히 올바른 구역에 있어."

ProcVLM은 단계를 이해하기 때문에 다음 세 가지를 구별할 수 있습니다.

  1. 정체: 로봇이 멈춰서 아무것도 하지 않는 상태.
  2. 실패: 로봇이 물체를 떨어뜨린 상태.
  3. 진전: 로봇은 애를 쓰고 있지만 앞으로 나아가고 있는 상태.

결과: 효과가 있는가?

이 논문은 ProcVLM 을 세 가지 주요 방식으로 테스트했습니다.

  1. 작업 이해: 다른 최첨단 AI 모델들에 비해 로봇이 어느 단계에 있는지, 그리고 다음에 무엇을 해야 할지 추측하는 능력이 향상되었습니다.
  2. 빠른 적응: 새로운 작업의 예시 하나만 보여줘도 (실패한 경우라도), ProcVLM은 즉시 해당 작업의 진척도를 판단하는 방법을 이해할 수 있었습니다. 다른 모델들은 이렇게 적은 데이터로는 적응하는 데 어려움을 겪었습니다.
  3. 로봇 교육: ProcVLM 을 이용해 실제 로봇 (그릇 쌓기) 을 훈련시켰을 때, 로봇은 표준 방법으로 훈련했을 때보다 더 빠르고 안정적으로 학습했습니다. 이는 혼란스러운 현실 세계의 실수를 처리하는 데 더 뛰어났습니다.

요약 비유

자동차 운전 배우기를 상상해 보세요.

  • 옛날 AI: 시험이 끝날 때까지 "합격" 또는 "불합격" 점수만 받습니다. 중간에 차가 멈추더라도 어떻게 고쳐야 하는지에 대한 피드백은 전혀 받지 못합니다.
  • ProcVLM: 조수석에 앉은 운전 강사와 같습니다. "키를 돌렸네, 잘했어. 이제 가속페달을 너무 세게 밟고 있구나, 좀 줄여. 교차로를 60% 지났으니 신호등에 집중해."라고 말합니다.

ProcVLM은 로봇에게 동일한 종류의 연속적이고 단계별 지도를 제공하여, 새로운 일을 배우는 데 있어 더 똑똑하고 신뢰할 수 있게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →