← 최신 논문
🤖 machine learning

Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning

본 논문은 장기적 작업에서의 오류 있는 일반화를 극복하고 OGBench 에서 최첨단 성능을 달성하기 위해 잠재 표현 기반 가치 일반화와 계층적 계획을 통합한 오프라인 목표 조건 강화 학습 알고리즘인 잠재 정렬 가치 학습 (LAVL) 을 소개합니다.

원저자: Hyungkyu Kang, Byeongchan Kim, Min-hwan Oh

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hyungkyu Kang, Byeongchan Kim, Min-hwan Oh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 복잡한 미로를 탐색하거나 블록을 쌓아 탑을 만드는 법을 로봇에게 가르치려 한다고 상상해 보세요. 로봇이 시행착오를 통해 배우는 것 (시간이 무한히 걸리고 위험합니다) 을 원하지 않으시죠. 대신 다른 사람의 과거 시도들을 담은 거대한 비디오 라이브러리를 이용해 가르치고 싶습니다. 이를 **오프라인 목표 조건 강화 학습 (Offline Goal-Conditioned Reinforcement Learning)**이라고 합니다.

이 논문은 로봇이 현재 이러한 비디오 라이브러리에서 학습하는 방식의 주요 문제를 해결하는 새로운 방법인 LAVL(잠재 정렬 가치 학습, Latent-Aligned Value Learning)을 소개합니다.

아래는 간단한 비유를 통해 문제와 해결책을 정리한 내용입니다.

문제: "지도 vs 현실"의 혼란

미로에서 A 지점에서 B 지점으로 가는 법을 로봇에게 가르친다고 가정해 봅시다. 당신은 미로를 걷는 사람의 비디오를 보여줍니다.

구식 방법 (결함 있는 지도):
대부분의 기존 방법들은 목표에 얼마나 가깝게 보이는지에 기반하여 미로의 특정 지점이 얼마나 "좋은지"를 추측하려 합니다.

  • 비유: 로봇이 직선 거리 (새가 날아갈 때처럼) 로 거리를 측정하는 지도를 가지고 있다고 상상해 보세요. 목표가 10 피트 떨어져 있지만 로봇과 목표 사이에 두꺼운 벽이 있다면, 로봇은 "아, 불과 10 피트밖에 안 떨어져 있네! 내가 갈 수 있어!"라고 생각합니다.
  • 결과: 로봇은 혼란에 빠집니다. 시간적으로 멀리 떨어져 있어도 (거기에 도달하는 데 100 단계가 걸리더라도) 시각적으로 가깝기 때문에 목표에 가깝다고 생각합니다. 이를 **오류 있는 일반화 (erroneous generalization)**라고 합니다. 로봇은 벽이 존재하지 않는 "고장 난 지도"를 학습하게 되어 나쁜 결정을 내리게 됩니다.

준거리 (Quasimetric) 수정 (경직된 규칙집):
일부 연구자들은 로봇의 뇌가 "벽을 통과할 수 없다"고 말하는 엄격한 수학적 규칙 (준거리라고 함) 을 따르도록 강제하여 이를 해결하려 했습니다.

  • 비유: 이는 로봇에게 "이 특정하고 복잡한 공식을 사용하여 거리를 계산하라"고 말하는 경직된 규칙집을 주는 것과 같습니다.
  • 결과: 단순한 미로에서는 잘 작동하지만, 로봇 팔로 큐브를 들어 올리는 것과 같은 복잡한 작업을 주면 이 경직된 규칙집은 무너집니다. 로봇은 혼란을 겪고 완전히 실패합니다. 다양한 유형의 작업에 적응하기에는 너무 뻣뻣합니다.

해결책: LAVL (스마트 GPS)

저자들은 LAVL을 제안하는데, 이는 거리를 바라보는 새로운 방식을 사용합니다. 사물이 얼마나 가깝게 보이는지 측정하거나 경직된 규칙집을 따르는 대신, LAVL 은 로봇이 작업의 "숨겨진 기하학"을 이해하도록 가르칩니다.

1. "잠재 정렬 (Latent Alignment)" (비밀 언어):
LAVL 은 미로나 팔의 원시 픽셀을 보는 대신, 로봇의 현재 상태와 목표를 "비밀 언어"(잠재 공간) 로 변환합니다.

  • 비유: 로봇과 목표가 서로 다른 방언을 말한다고 상상해 보세요. 구식 방법들은 단어 대 단어 (유클리드 거리) 로 번역하려 했습니다. LAVL 은 둘 모두를 거리의 의미가 보존되는 보편적 언어로 번역합니다.
  • 작동 원리: 로봇은 "상태 A"와 "목표 B"가 화면에서 가깝게 보이더라도 이 비밀 언어에서는 멀리 떨어져 있음을 학습합니다. 이는 "벽 누수" 오류를 방지합니다. 직선 거리뿐만 아니라 교통 상황과 우회로를 이해하는 GPS 를 가진 것과 같습니다.

2. "연속성 (Continuity)" 접착제:
로봇이 긴 경로를 학습하려 할 때 내부 지도가 흔들리고 떨릴 수 있습니다.

  • 비유: 로봇의 지도가 계속 구겨지는 종이 조각이라고 상상해 보세요. 한 초에는 목표가 5 단계 거리에 있다가, 다음 초에는 작은 결함 때문에 500 단계 거리에 있게 됩니다.
  • 수정: LAVL 은 "스무딩 접착제"(연속성 정규화) 를 추가합니다. 로봇에게 이렇게 말합니다. "이전 위치와 매우 유사한 곳에 있다면, 목표까지의 거리 추정이 급격히 변해서는 안 됩니다." 이는 지도를 안정적이고 매끄럽게 유지합니다.

3. "계층적" 상사와 하급자:
매우 긴 작업 (거대한 미로 등) 의 경우 로봇이 계획이 필요합니다.

  • 비유: LAVL 은 2 단계 시스템을 사용합니다.
    • 상사 (고수준): 큰 그림을 봅니다. "우리는 출구로 가야 합니다. 먼저 모서리를 향해 가죠."
    • 하급자 (저수준): 세부 사항을 처리합니다. "알겠습니다, 모서리에 도착했습니다. 이제 왼쪽으로 돌아 앞으로 걸어가겠습니다."
  • LAVL 은 상사와 하급자가 같은 "비밀 언어"(잠재 정렬) 로 대화하도록 하여 혼란을 방지합니다.

결과: 왜 중요한가

저자들은 거대한 미로에서 로봇 팔로 큐브를 쌓는 등 22 가지 다른 과제를 포함한 거대한 벤치마크인 OGBench에서 이를 테스트했습니다.

  • 점수: LAVL 은 22 개 데이터셋 중 20 개에서 승리했습니다.
  • 장거리: "거대한" 미로 (경로가 수천 단계에 달하는 경우) 에서 다른 방법들은 실패하거나 갇혔습니다. LAVL 은 꾸준히 좋은 성능을 유지했습니다.
  • 연결: 일부 데이터셋은 로봇이 전체 경로를 형성하기 위해 "연결"해야 하는 짧고 끊긴 비디오 클립으로 구성되어 있었습니다. LAVL 은 이전 방법들보다 이러한 점들을 연결하는 데 훨씬 뛰어났습니다.

요약

이 논문은 오래된 데이터로 로봇을 가르치는 데 있어 가장 큰 병목 현상은 진전을 측정하는 "거리"의 종류가 잘못되었다고 주장합니다. 사물이 어떻게 보이는지가 아니라 도달하는 것이 얼마나 어려운지를 측정해야 합니다.

LAVL은 이를 다음과 같이 수정합니다:

  1. 진정한 난이도를 측정하기 위한 "비밀 언어"(잠재 정렬) 를 학습합니다.
  2. 로봇의 내부 지도를 매끄럽게 만들어 흔들리지 않도록 합니다.
  3. 길고 복잡한 작업을 처리하기 위해 상사/하급자 시스템을 사용합니다.

그 결과 로봇은 비디오 라이브러리에서 학습하여 벽이나 긴 거리로 혼란을 겪지 않고 실제로 복잡한 목표에 도달하는 방법을 파악할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →