← 최신 논문
💻 computer science

Latent Actions from Factorized Transition Effects under Agent Ambiguity

이 논문은 모호한 관측 전이를 재사용 가능한 프리미티브로 분해하여, 감독 없이도 방해 요소가 많은 복잡한 환경에서 베이스라인보다 뛰어난 성능을 보이는 강건한 행동 유사 잠재 표현을 학습하는 Observed Transition Factorization(OTF) 및 그 변형인 OTF-LAM, OTF-LAM-Dino를 소개한다.

원저자: Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "시끄러운 주방"

당신이 요리사의 영상을 보며 요리하는 법을 배우고 있다고 상상해 보세요. 하지만 영상은 매우 어수선합니다. 요리사가 양파를 다지고 있는 동안(당신이 관심을 가져야 할 동작), 카메라는 흔들리고, 개가 바닥을 가로질러 뛰어다니며, 바람에 커튼이 휘날리고 있습니다.

AI의 세계에서는 이를 **에이전트 모호성(Agent Ambiguity)**이라고 부릅니다.

  • 에이전트: 요리사 (당신이 제어하고자 하는 대상).
  • 동작: 양파 다지기.
  • 모호성: 영상은 모든 변화를 한꺼번에 보여줍니다 (양파의 움직임, 개의 움직임, 커튼의 흔들림 등).

기존의 AI 모델들은 이 지저로운 영상 전체를 보고 "다지기" 동작을 추측하려고 노력했습니다. 그 결과, 개가 뛰어다니는 것을 요리 레시피의 일부라고 착각하거나, 요리사의 움직임과 카메라의 흔들림을 구분하지 못하는 등의 혼란을 겪곤 했습니다.

해결책: 영상을 "레고 블록"으로 나누기

저자들은 OTF-LAM이라는 새로운 방법을 제안합니다. 영상을 한 번에 통째로 예측하는 대신, 섞여 있는 레고 블록을 분류하듯 영상의 변화를 작고 재사용 가능한 조각들로 나눕니다.

이 조각들을 **관측된 전이 프리미티브(Observed Transition Primitives)**라고 부릅니다.

  • "요리사가 양파를 다진다"라고 보는 대신, AI는 "픽셀의 작은 영역이 왼쪽으로 이동함", "가장자리가 아래로 이동함", "배경이 흐릿해짐"과 같이 인식합니다.
  • 이것이 바로 레고 블록입니다. 이는 요리사, 로봇, 혹은 만화 캐릭터와 상관없이 어디에서나 일어날 수 있는 단순하고 재사용 가능한 움직임 패턴입니다.

작동 방식: 2단계 과정

1단계: "블록 분류기" (OTF)
먼저, AI는 수천 개의 영상을 관찰하며 영상 속의 모든 미세한 변화를 자신의 어휘 사전 속에 있는 특정 "블록"으로 분류하는 법을 배웁니다.

  • 비유: 책의 내용이 무엇인지에는 관심 없고, 오직 페이지가 어떻게 넘어가는지에만 집중하는 사서라고 상상해 보세요. 사서는 모든 페이지 넘김을 "빠른 넘김", "느린 미끄러짐", 또는 "찢어짐"과 같은 카테고리로 분류합니다.
  • AI는 사람이 책장을 넘기는 것이든 로봇 팔이 다이얼을 돌리는 것이든, "빠른 넘김"은 동일하게 보인다는 것을 학습합니다. 이 덕분에 이 "블록"들은 재사용 가능해집니다.

2단계: "요리사의 조수" (OTF-LAM)
블록이 분류되면, AI는 어떤 블록이 요리사에 의해 발생한 것인지, 아니면 개나 바람에 의한 것인지 파악해야 합니다.

  • 비유: AI는 현재 장면(주방)을 보고 이렇게 묻습니다. "요리사가 칼을 쥐고 있다는 점을 고려할 때, 이 '움직이는 블록'들 중 요리사의 행동일 가능성이 높은 것은 무엇인가?"
  • AI는 관련 있는 블록들을 선택하고, 소음(개)은 무시하며, 이들을 하나의 "동작 신호(Action Signal)"로 결합합니다. 이 신호는 AI에게 "요리사가 다지고 있다"라는 정보를 전달합니다.

"Frozen DINO" 기법 (OTF-LAM-Dino)

논문은 또한 더 똑똑한 버전인 OTF-LAM-Dino를 소개합니다.

  • 비유: 영상의 다음 프레임을 예측한다고 상상해 보세요. 보통의 AI는 모든 픽셀(양파의 색상, 테이블의 질감 등)을 다시 그려내려 합니다. 하지만 이는 조명이 변하거나 테이블의 모습이 달라질 수 있기 때문에 매우 어렵습니다.
  • 비결: 이 버전은 픽셀을 직접 다시 그리는 대신, 사물의 형태와 구조를 이미 이해하고 있는 숙련된 전문가(DINOv2)를 활용합니다. AI는 색상이 아닌 '구조'가 어떻게 변하는지만 예측하면 됩니다.
  • 이는 체스판의 나무 말들의 색깔을 일일이 칠하는 대신, 체스판의 위치(구조)를 보고 다음 수를 예측하는 것과 같습니다. 이 방식은 AI가 주변의 방해 요소들을 훨씬 더 잘 무시할 수 있게 해줍니다.

무엇을 증명했는가?

저자들은 두 가지 주요 테스트를 통해 검증했습니다.

  1. Moving MNIST ("숫자" 테스트): 숫자들이 움직이는 영상을 보여주었습니다. AI에게 04까지의 숫자를 학습시킨 후, 한 번도 본 적 없는 59까지의 숫자로 테스트를 진행했습니다.

    • 결과: AI는 특정 숫자의 생김새가 아니라 '움직임 패턴(블록)'을 학습했기 때문에, 새로운 숫자에서도 완벽하게 작동했습니다. 이는 "블록"이 재사용 가능하다는 것을 입증합니다.
  2. DCS ("로봇" 테스트): 로봇이 움직이는 동안 배경이 복잡하게 움직이는 정교한 로봇 시뮬레이션을 사용했습니다.

    • 결 result: 새로운 방식(OTF-LAM)은 기존 방식보다 로봇을 제어하는 법을 더 잘 학습했습니다. AI는 방해되는 배경을 성공적으로 무시하고 로봇의 움직임에 집중할 수 있었습니다.

핵심 요약

이 논문의 결론은 다음과 같습니다: "지저한 영상으로부터 전체 동작을 통째로 추측하려 하지 마세요. 대신, 영상의 변화를 작고 재사용 가능한 '움직임 블록'으로 나누세요. 먼저 이 블록들을 분류한 다음, 어떤 블록이 제어하고자 하는 에이전트의 것인지 파악하세요."

이 방법을 통해 AI는 수많은 방해 요소가 존재하는 복잡한 실제 환경에서도 훨씬 더 잘 학습하고 행동할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →