← 최신 논문
💻 computer science

Recovering Hidden Reward in Diffusion-Based Policies

이 논문은 적대적 훈련 없이 스칼라 에너지 함수를 매개변수화하여 전문가 보상을 복원하고 정책 일반화를 개선함으로써 생성적 행동 모델링과 역강화학습을 통합하는 EnergyFlow 라는 프레임워크를 소개합니다.

원저자: Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

**"Recovering Hidden Reward in Diffusion-Based Policies"(ENERGYFLOW 소개) 에 대한 설명을 쉬운 언어와 일상적인 비유로 정리합니다.

큰 그림: 모방이 아닌 관찰을 통한 로봇 학습

로봇에게 완벽한 커피 한 잔을 만드는 법을 가르치려 한다고 상상해 보세요.

  • 옛 방식 (행동 복제): 로봇에게 커피를 만드는 당신의 영상을 보여줍니다. 로봇은 당신의 손동작을 그대로 따라 하려 합니다. 하지만 머그잔이 새로운 위치에 놓여 있어 손동작이 조금만 달라져도 로봇은 혼란을 겪고 커피를 쏟습니다. 로봇은 무엇을 해야 하는지는 알지만, 왜 해야 하는지는 모릅니다.
  • 문제점: 현재 최첨단 방법인'확산 정책 (Diffusion Policies)'은 당신의 손동작을 완벽하게 모방할 수 있는 거장 예술가와 같습니다. 하지만 그들은 목표 자체를 이해하지 못합니다. 그들은 단순히 혼란스러운 상태에서 깔끔한 상태로 이동하는 방법만 알 뿐입니다. 상황이 조금만 변해도 (예: 머그잔이 이동한 경우) 그들은 행동의'가치'를 이해하지 못하고 패턴에 기반해 다음 행동을 추측하기만 하므로 실패할 수 있습니다.

ENERGYFLOW는 두 가지 일을 동시에 수행하는 새로운 프레임워크입니다:

  1. 옛 방식처럼 로봇에게 전문가의 손동작을 모방하도록 가르칩니다.
  2. 그 손동작 뒤에 숨겨진 보상 체계 (왜 그런지) 를 비밀리에 파악하여 로봇이 새로운 상황에 적응할 수 있도록 합니다.

핵심 아이디어:'언덕과 계곡'지도

ENERGYFLOW 를 이해하려면 로봇의 의사결정 과정을 언덕과 계곡으로 이루어진 지형도로 상상해 보세요.

  • 지형도 (에너지 함수): 로봇이 취할 수 있는 모든 가능한 움직임이 지면 위의 한 점으로 표현된 지도를 상상해 보세요.
    • 계곡 (낮은 에너지): 이것이'좋은'움직임입니다. 계곡이 깊을수록 그 움직임은 더 좋습니다.
    • 언덕 (높은 에너지): 이것은'나쁜'움직임입니다.
  • 기울기 (경사): 언덕 위에 서 있으면 중력이 가장 가파른 경사를 따라 계곡으로 당신을 끌어당깁니다. 수학적으로 이 경사를'기울기 (gradient)'라고 부릅니다.

다른 방법들이 작동하는 방식:
대부분의 현재 AI 방법들은 각 지점에서의 바람 방향 (벡터장) 을 학습하려 합니다. 그들은"여기에 있으면 목표에 도달하기 위해 이 방향으로 바람을 불어라"라고 말합니다. 하지만 때로는 그들이 학습한 바람 방향들이 서로 조화되지 않습니다. 당신은 목표 지점에 도달하지 못한 채 원형으로 (A → B → C → A) 밀려날 수 있습니다. 이를'비보존적 (non-conservative)'장이라고 하며, 로봇에게는 혼란스러운 상황입니다.

ENERGYFLOW 가 작동하는 방식:
ENERGYFLOW 는 바람을 학습하는 대신 지형 자체의 모양 (스칼라 에너지 함수) 을 학습합니다.

  1. 언덕과 계곡으로 이루어진 3 차원 지도를 구축합니다.
  2. 로봇은 단순히 경사를 따라 계곡으로 내려갑니다.
  3. 단일 지도를 따르기 때문에 혼란스러운 함정에 빠질 수 없습니다. 경로가 항상 논리적입니다.

"마술": 숨겨진 보상 찾기

이 논문의 가장 큰 breakthrough 는 다음과 같은 수학적 증명입니다: 로봇이 지형의 모양을 올바르게 학습한다면, 그 모양 자체가 보상이 된다.

  • 비유: 요리사의 손놀림을 관찰한다고 상상해 보세요. 당신은 단순히 칼질하는 모습만 보는 것이 아니라, 요리사가 항상 그렇게 하므로 양파를 완벽하게 다지는 것을'사랑'한다고 추론할 수 있습니다.
  • 결과: ENERGYFLOW 는"잘했다!"또는"나쁘다!"라고 인간이 말해줄 필요가 없습니다 (이는 프로그래밍하기 어렵습니다). 전문가의 영상에서 지형 지도를 학습함으로써 로봇은 모든 행동에 대한'점수'를 자동으로 발견합니다.
    • 낮은 점수 = 좋은 행동 (깊은 계곡).
    • 높은 점수 = 나쁜 행동 (높은 언덕).

이 점수는 보상 신호로 작용합니다. 이제 로봇은 이 점수를 사용하여 작업을 더 잘 수행하는 법을 스스로 가르치거나, 본 적 없는 상황을 처리할 수 있습니다.

왜 중요한가:'보존적 (Conservative)'제약

이 논문은 로봇에게 단순히'바람 방향'이 아닌'지형 지도 (보존적 장)'를 학습하도록 강제하는 것이 초능력이 된다고 주장합니다.

  • 비유: 도시를 항해하려 한다고 상상해 보세요.
    • 바람 방식: 여기서는 북쪽으로, 저기서는 동쪽으로 가라는 화살표 목록을 받습니다. 화살표가 조금만 틀려도 당신은 원형으로 걷게 될 수 있습니다.
    • 지형 방식: 지형 지도를 받습니다. 당신이 본 적 없는 도시의 어느 곳에 있더라도 지도를 보고 경사를 확인하면, 어느 방향이 가장 낮은 지점 (목표) 으로 이어지는지 알 수 있습니다.
  • 이점: 이'지도'접근 방식은 로봇을 훨씬 더 견고하게 만듭니다. 로봇의 시작점을 변경하더라도 (분포 이동) 지도는 여전히 작동합니다. 로봇은 새로운 시작 위치에서도 언덕을 내려가는 법을 압니다. 이 논문은 수학적으로 이 방법이 오류를 줄이고 이전 방법들보다 로봇이 새로운, 본 적 없는 상황에 더 잘 일반화되도록 돕는다고 증명합니다.

실제 결과

저자들은 다음과 같은 작업을 수행하는 로봇으로 이를 테스트했습니다:

  • 캔 들어 올리기.
  • 네모난 못을 네모난 구멍에 끼우기.
  • 서랍 열기.
  • 병 들어 올리기.

결과:

  1. 더 나은 모방: 로봇은 이전 최첨단 방법 (확산 정책) 보다 전문가를 더 잘 모방했습니다.
  2. 실제 로봇 성공: 그들은 코드를 실제 물리적 로봇 (AGIBOT G1) 에 적용했고, 로봇은 시작 위치가 약간 달랐음에도 넘어지지 않고 서랍을 열고 병을 제자리에 놓는 데 성공했습니다.
  3. 자기 개선: 그들이'에너지 점수'를 보상으로 사용하여 로봇을 추가로 학습시켰을 때 (강화 학습), 로봇은 희소한 표준 보상을 사용할 때보다 더 빠르게 학습하고 더 높은 성공률을 달성했습니다.

요약

ENERGYFLOW는 로봇에게 단계별 방향 목록 대신'선함'의 GPS 지도를 제공하는 것과 같습니다.

  • 그것은 문제의 모양 (에너지 지형) 을 학습합니다.
  • 그 모양의 경사는 로봇에게 무엇을 해야 하는지 (행동) 를 알려줍니다.
  • 그 모양의 깊이는 로봇에게 얼마나 좋은지 (보상) 를 알려줍니다.

이를 통해 로봇은 인간을 완벽하게 모방할 뿐만 아니라 작업의 근본적인 논리를 이해하게 되어, 더 똑똑해지고 적응력이 높아지며 지속적인 인간의 피드백 없이도 스스로 학습할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →