← 최신 논문
💻 computer science

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

이 논문은 최소한의 인간 피드백으로부터 고충실도 의사 라벨(pseudo-labels)을 생성하기 위해 비디오 파운데이션 모델과 최적 운송(optimal transport)을 활용하는 준지도 학습 프레임워크인 VOTP를 소개하며, 이를 통해 오프라인 선호 기반 강화 학습을 위한 효율적이고 강건한 보상 학습을 가능하게 한다.

원저자: Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 서랍을 열거나 비틀거리지 않고 걷는 것과 같은 복잡한 작업을 가르치려고 한다고 상상해 보세요. 로봇의 세계에서는 로봇이 무엇을 잘하고 있는지 알 수 있게 해주는 '보상 시스템'이 필요합니다. 보통은 엔지니어들이 "팔을 위로 움직였으니 잘했어" 또는 "물건을 떨어뜨렸으니 잘못했어"라고 로봇에게 일일이 코드를 작성해야 합니다. 이는 마치 한 번도 요리해 본 적 없는 요리의 레시피를 쓰려고 애쓰는 것과 같습니다. 매우 어렵고, 지침을 잘못 전달할 수도 있습니다.

이를 해결하기 위해 과학자들은 **선호 기반 강화 학습(Preference-Based Reinforcement Learning, PbRL)**을 사용합니다. 코드를 직접 짜는 대신, 로봇이 수행하는 두 개의 영상을 보여주고 인간에게 "어느 것이 더 좋아 보이나요?"라고 묻는 방식입니다. 로봇은 이러한 선택을 통해 학습합니다.

문제점:
인간이 영상을 보고 더 나은 것을 고르는 작업은 느리고 비용이 많이 듭니다. 로봇을 잘 가르치려면 수천 번의 이러한 비교 작업이 필요할 수도 있습니다. 이는 마치 아이가 자전거를 탈 때마다 비틀거릴 때마다 멈춰 서서 "방금 그게 좋았니?"라고 묻는 것과 같습니다. 시간이 너무 오래 걸립니다.

해결책: VOTP
이 논문은 VOTP(Video-based Optimal Transport Preference)라는 새로운 방법을 소개합니다. VOTP를 아주 똑똑한 조교라고 생각하면 쉽습니다. 이 조교는 당신이 로봇을 가르칠 때 아주 적은 질문만으로도 효과적으로 도울 수 있습니다.

작동 방식은 다음과 같습니다.

1. "스마트한 눈" (비디오 파운데이션 모델)

먼저, VOTP는 사전 학습된 "스마트한 눈"(비디오 파운데이션 모델)을 사용합니다. 이 눈은 수백만 시간의 인간 영상을 이미 봐온 상태라고 상상해 보세요. 사람들이 춤추고, 요리하고, 달리고, 노는 모습 말이죠. 이 눈은 이미 많은 것을 보았기 때문에, 설령 로봇을 본 적이 없더라도 무엇이 "좋은 움직임"인지 이해할 수 있습니다. 이 눈은 로봇이 움직이는 영상을 동작의 정수를 담고 있는 수학적 "지문(fingerprint)"으로 변환할 수 있습니다.

2. "중매쟁이" (최적 운송, Optimal Transport)

이 부분이 마법 같은 부분입니다.

  • 설정: 당신은 인간이 이미 "영상 A가 영상 B보다 좋다"라고 말한 아주 적은 양의 예시(예: 10쌍의 영상)를 제공합니다.
  • 데이터의 산: 또한, 아직 아무도 인간의 의견을 묻지 않은 라벨이 없는 방대한 양의 영상(수천 쌍)도 가지고 있습니다.
  • 중매 작업: VOTP는 **최적 운송(Optimal Transport)**이라는 수학적 도구를 사용합니다. 당신이 가진 10개의 인간 승인 영상에서 추출한 "좋음" 지문 더미와 "나쁨" 지문 더미가 있다고 상상해 보세요. 이제 당신에게는 라벨이 없는 영상들의 거대한 "알 수 없는" 지문 더미가 있습니다.
  • 연결: 최적 운송은 매우 효율적인 중매쟁이 역할을 합니다. 이 중매쟁이는 "알 수 없는" 영상을 보고 "이 영상은 인간이 좋아했던 10개의 영상 중 어떤 것과 가장 닮았는가?"라고 묻습니다. 단순히 추측하는 것이 아니라, 지문의 유사성을 바탕으로 알 수 없는 영상들을 알려진 영상들과 연결하는 최선의 방법을 계산합니다.

3. "추론" (의사 라벨, Pseudo-Labels)

중매쟁이가 알 수 없는 영상을 알려진 "좋은" 영상과 연결하면, VOTP는 "만약 이 알 수 없는 영상이 인간이 좋아했던 영상과 닮았다면, 이 알 수 없는 영상도 좋은 것이다!"라고 판단합니다. 그리고 당신이 다 볼 시간이 없었던 수천 개의 영상에 자동으로 라벨(의사 라벨)을 부여합니다.

4. 결과

이제 로봇은 단 10개의 인간 예시만으로 배우는 것이 아니라, 10개의 인간 예시와 더불어 자동으로 라벨링 된 수천 개의 예시를 통해 배울 수 있습니다. 로봇은 훨씬 더 빠르고 정확하게 학습하며, 이 과정에서 인간은 아주 적은 도움만 주면 됩니다.

논문의 연구 결과

저자들은 로봇이 걷는 동작(보행)과 물체를 움직이는 동작(조작)에 대해 테스트했습니다. 또한 실험실의 실제 로봇 팔을 대상으로도 테스트했습니다.

  • 적은 인간의 노력: VOTP는 아주 적은 수의 인간 라벨(때로는 단 10개만으로도)만 사용하여 최고 수준의 결과를 달enc했습니다.
  • 다른 방법보다 우수함: VOTP는 비슷한 결과를 얻기 위해 수백 또는 수천 개의 라벨이 필요했던 다른 방법들을 압도했습니다.
  • 강건성(Robustness): 조명이 바뀌거나 배경에 방해되는 요소(예: 로봇 뒤에서 재생되는 TV 화면)가 있어도, VOTP는 여전히 무엇이 좋고 나쁜지를 정확히 파악했습니다.
  • 실제 환경: 실제 로봇 팔이 바나나를 들어 올리거나 서랍을 여는 실험을 했을 때, VOTP는 오직 몇 개의 인간 라벨에만 의존하는 방법들보다 훨씬 더 자주 성공을 거두었습니다.

요약하자면: VOTP는 인간이 좋아하는 예시를 몇 가지만 보여줌으로써, "스마트한 눈"과 "수학적 중매쟁이"를 이용해 나머지 영상들에 대해 스스로 무엇을 해야 할지 알아내도록 로봇을 가르치는 방법입니다. 이는 수천 개의 영상을 라벨링 하는 지루하고 반복적인 작업을 인간으로부터 덜어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →