← 최신 논문
🤖 AI

PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation

PACT-WAM은 계층적 시간 인코딩과 조건부 흐름 샘플링을 사용하여 16단계 액션 궤적과 그에 대응하는 다중 뷰 시각적 예측을 효율적으로 예측하며, 로봇 조작 작업에서 높은 성공률을 달리는 동시에 추가적인 성능 향상을 위한 시각-언어 기반의 제안 검토를 가능하게 하는 컴팩트한 월드 액션 모델이다.

원저자: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

게시일 2026-09-17
📖 1 분 읽기☕ 가벼운 읽기

원저자: Yushan Liu, Jingjing Fan, Shoujie Li, Yifan Xie, Xiao-Ping Zhang, Wenbo Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: PACT-WAM

문제 정의

로봇 조작 정책은 동작의 맥락과 이전 상호작용을 제공하는 **이력(history)**과, 상태 변화를 예측하고 제안된 행동을 평가하기 위한 **시각적 예견(visual foresight)**이라는 두 가지 형태의 시간적 정보가 필요합니다. 세계-행동 모델(World-Action Models, WAMs)은 이력, 행동, 그리고 미래의 관찰을 효과적으로 연결하지만, 상당한 계산적 병목 현상에 직면해 있습니다. 과거 및 미래 관찰의 조밀한 표현(dense representations)은 막대한 처리 비용을 발생시킵니다. 예를 들어, 64개의 토큰을 가진 16개의 이력 프레임을 인코딩하려면 뷰당 1,024개의 토큰이 필요하며, 다단계 예측은 별도의 시각적 잠재(visual-latent) 시퀀스를 추가합니다. 기존 방법들은 이러한 과제들을 개별적으로 해결합니다. 즉, 이력을 압축하거나, 별도의 컨트롤러를 가진 모듈형 시각적 예견을 사용하거나, 추론 시 미래 생성을 생략하는 방식입니다. 핵심 과제는 역사적 범위를 보존하면서도 각 전이(transition)에서 독립적으로 디코딩 가능한 상태를 제공하는 압축된 표현을 설계하는 동시에, 과도한 계산 오버헤드 없이 실행을 가이드하기 위해 이러한 예측을 사용하는 프로토콜을 수립하는 것입니다.

방법론: PACT-WAM

저자들은 조건부 플로우 샘플링(conditional flow sampling)을 통해 16단계의 행동 궤적과 그에 시간적으로 대응하는 다중 뷰 시각적 예측을 공동으로 생성하는 세계-행동 모델인 PACT-WAM(Predicting Actions and Visual Foresight with Compact Temporal Encoding)을 제안합니다. 이 아키텍처는 세 가지 주요 설계 선택 사항에 기반합니다.

1. 계층적 이력 인코딩 (Hierarchical History Encoding)

균일한 인코딩 대신, PACT-WAM은 **최신성 기반 이력 할당(recency-based history allocation)**을 채택합니다. 이는 오래된 관찰에는 조밀하지 않은 공간 표현을, 최근의 관찰에는 더 정밀한 표현을 할당합니다.

  • 메커니즘: 고정된 DINOv3 ViT-B/16 백본을 사용하여 모델은 16개의 이력 프레임을 처리합니다. 가장 오래된 8개 프레임은 뷰당 4개의 토큰으로 압축하고, 중간 6개는 16개로, 최신 2개는 64개의 토큰으로 압축합니다.
  • 효용성: 이를 통해 모든 16개의 관찰을 단 256개 토큰 per view로 유지하며, 이는 조밀한 인코딩(1,024개 토큰) 대비 75% 감소한 수치임과 동시에 높은 시간적 범위를 유지합니다.
  • 통합: 이러한 압축된 특징들은 병합되어 태스크 지침과 함께 Qwen3-VL-4B 언어 모델로 투영되어 공유 컨텍스트 hth_t를 형성합니다.

2. 공동 행동-시각 플로우 생성 (Joint Action-Visual Flow Generation)

PACT-WAM은 연속적인 행동과 시각적 상태를 공동으로 업데이트하기 위해 **전이별 인과적 어텐션(transition-wise causal attention)**을 갖춘 공유 플로우 트랜스포머를 활용합니다.

  • 시각적 잠재 (Visual Latents): 미래 이미지는 시간적 다운샘플링 없이 연속적인 TiTok-VAE 잠재값(K=32K=32 위치 per 이미지)으로 표현됩니다. 이는 모든 행동이 독립적으로 디코딩 가능한 후속 시각 상태와 쌍을 이루도록 보장합니다.
  • 공유 백본: 트랜스포머는 노이즈가 섞인 행동 및 시각 상태, 플로우-타임 임베딩, 그리고 고정된 컨텍스트를 입력받습니다. 모델은 블록 jj(jj번째 전이를 나타냄)의 쿼리가 kjk \leq j인 블록들의 모든 위치에 어텐션을 줄 수 있는 블록-인과적 마스크(block-causal mask)를 사용합니다.
  • 이중 헤드 (Dual Heads): 두 개의 모달리티별 속도 헤드(gag_a는 행동, gvg_v는 시각)가 정규화된 공간에서 속도를 예측합니다. 모달리티는 허용된 시간적 접두사 내의 노이즈 섞인 상태들에 대한 공유 의존성을 통해 샘플링 과정 동안 정보를 교환합니다.
  • 학습: 모델은 선형 경로 속도 회귀 목적 함수를 사용하는 조건부 플로우 매칭(conditional flow matching)을 사용하여 학습되며, DINOv3와 Ti-Tok-VAE 인코더/디코더를 고정한 상태에서 압축 브랜치, 컨텍스트 경로, 플ow 트랜스포머 및 출력 헤드를 최적화합니다.

3. 제안 검토 (Proposal Review, PR)

실행을 가이드하기 위해, PACT-WAM은 시각-언어 모델(VLM)을 사용하는 제안 검토(Proposal Review) 메커니즘을 도입합니다.

  • 프로세스: 네 개의 병렬 VLM 요청이 4, 8, 12, 16단계의 중첩된 예측 접두사를 평가합니다. 이들은 태스크 일관성 진행도를 평가하고 가시적인 실패(예: 정렬 불량, 충돌)를 감지합니다.
  • 실행 로직: 컨트롤러는 보고된 거부(veto) 아래에서 연속적으로 승인된 가장 큰 접두사를 선택합니다. 만약 제안이 거절되면, 시스템은 제한된 예산 내에서 공동 재샘플링(joint resampling)(최대 3회 재시도)을 수행합니다. 모든 재시도가 실패하면 에피소드가 종료됩니다.

주요 기여

  1. 최신성 기반 이력 할당: 본 논문은 최근 프레임을 우선시하여 뷰당 256개의 토큰을 할당하는 전략을 소개합니다. LIBERO 벤치마크에서 이 방식은 동일한 16개 프레임의 균일 인코딩(98.6% vs 87.5% 성공률)보다 우수한 성능을 보였으며, 75% 적은 이력 토큰으로도 조밀한 인코딩(98.0%)에 필적하는 성능을 달로했습니다.
  2. 압축된 잠재 공간에서의 공동 생성: PACT-WAM은 압축된 이미지당 잠재 공간에서 행동 궤적과 시각적 상태를 공동으로 생성하여, 각 물리적 전이마다 독립적으로 디코딩 가능한 예측을 제공합니다. 이는 제안 검토 메커니즘을 통해 실행 접두사를 검증할 수 있게 하며, 압축된 이력 인코딩과 결합하여 통합된 세계-행동 프레임워크를 구축합니다.
  3. 테스트 타임 향상을 통한 성능: 기본 정책은 시뮬레이션 및 실제 환경 벤치마크에서 높은 성공률을 달성합니다. 제안 검토(PR)의 추가는 핵심 정책을 재학습시키지 않고도 견고성을 높여 테스트 타임 성능을 크게 향상시킵니다.

실험 결과

모델은 LIBERO, RoboTwin 2.0, 그리고 실제 AgileX Piper 플랫폼에서 평가되었습니다.

  • LIBERO (시뮬레이션):
    • PR 미사용 시: 평균 성공률 98.6%.
    • PR 사용 시: 평균 성공률 99.5% (Object 및 Goal 서브셋에서 100% 도달).
  • RoboTwin 2.0 (시뮬레이션):
    • PR 미사용 시: 50개 양팔(bimanual) 태스크에서 평균 성공률 92.3%.
    • PR 사용 시: 평균 성공률 93.4%.
  • 실제 환경 Piper:
    • PR 미사용 시: Sorting, Handover, Cleanup 태스크에서 평균 성공률 78.0%.
    • PR 사용 시: 평균 성공률 86.7%.
  • 절제 연구 (Ablation Studies):
    • 이력 (History): 8:6:2 토큰 계층 구조는 효율성과 성공률 측면에서 균일 인코딩 및 조밀한 인코딩보다 유의미하게 우수했습니다.
    • 공동 생성 (Joint Generation): 행동과 시각을 공동으로 학습하는 것이 행동 전용(93.6%) 또는 시각 보조(96.4%) 변형 모델보다 제어 성공률(98.6%)을 높였습니다.
    • 시각적 용량 (Visual Capacity): 잠재 용량을 K=32K=32에서 K=64K=64로 늘리면 예측 충실도(PSNR, SSIM)는 향상되지만 제어 성공률은 약간 감소(97.3% vs 98.6%)하여, 기본 설정인 K=32K=32가 성능과 계산 비용 사이의 균형을 맞춘다는 것을 시사했습니다.
    • 제안 검토 (Proposal Review): PR은 실패한 궤적을 효과적으로 필터링하며, 현재 관찰만을 사용하는 것보다 예측된 프리뷰를 사용할 때 오탐지 거부율을 낮춥니다.

의의 및 주장

본 논문은 PACT-WAM이 표현 비용과 실행 결정을 위한 시각적 예견 가용성 사이의 트레이드오프를 성공적으로 해결했다고 주장합니다. 계층적 이력 인코딩과 압축되고 디코딩 가능한 시각적 잠재력을 결합함으로써, 모델은 시간적으로 쌍을 이루는 행동과 예측의 공동 샘플링을 가능하게 합니다. 이 아키텍처는 중첩된 접두사를 검증하여 실행을 가이드하는 제안 검토 프로토콜을 허용하며, 이를 통해 복잡한 조작 작업에서 신뢰성을 높입니다.

저자들은 이 접근 방식이 행동 선택에 필요한 시간적 정보를 보존하면서도 이력에 필요한 토큰 수를 획기적으로 줄였다는 점을 강조합니다. 또한 기본 정책이 경쟁력 있는 성능을 보이지만, 시각적 예견을 VLM 기반 검토 메커니즘과 통합하는 것이 신뢰성을 개선하는 독특한 경로를 제공한다고 언급합니다. 이 연구는 높은 예측 충실도가 항상 높은 제어 성공으로 이어지는 것은 아니라는 점을 밝히며, 의사결정을 위한 예측의 유용성이 원시 재구성 품질보다 더 중요하다는 것을 시사합니다.

저자들이 언급한 한계점: 현재 시스템은 태스크 관련성에 따라 적응하지 않는 고정된 최신성 기반 할당을 사용하며, 고정된 16단계 호라이즌과 체크포인트 사이의 짧은 실패를 놓칠 수 있는 검토 프로세스를 가지고 있습니다. 향-후 연구로는 태스크 적응형 압축 및 가변 호라이즌 생성을 탐구할 것을 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →