← 최신 논문
💻 computer science

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

이 논문은 과거의 맥락을 활용하는 것이 로봇 조작 작업에 필수적임을 지적하며, 시간 대비 학습을 통해 시점 토큰을 생성하고 경량 메모리 모듈을 적용해 기존 비전 - 언어 - 행동 (VLA) 모델을 역사 인식 정책으로 변환하는 HAMLET 프레임워크를 제안하여 장기 작업 수행 능력을 획기적으로 향상시켰음을 보여줍니다.

원저자: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

게시일 2026-04-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🤖 HAMLET: 로봇에게 '기억력'을 심어주는 마법의 지팡이

이 논문은 최신 로봇 기술인 **'시각 - 언어 - 행동 (VLA) 모델'**의 큰 약점을 발견하고, 이를 해결하는 획기적인 방법을 제안합니다.

1. 문제점: 로봇은 '지금'만 보고 '과거'를 잊어버려요

지금까지의 로봇 AI 는 마치 매번 눈을 감았다가 다시 뜨는 사람과 같았습니다.

  • 현재 상황: 로봇이 컵을 잡으려는데, 그 컵이 테이블 아래에 숨겨져 있다면?
  • 기존 로봇의 반응: "어? 컵이 어디 있지? (현재 화면에 없으니) 못 찾겠다."
  • 실제 상황: 로봇은 1 초 전까지 컵이 테이블 위에 있었음을 알고 있어야 합니다. 하지만 기존 모델은 현재 프레임 (화면) 만 보고 행동을 결정하기 때문에, 물체가 가려지거나 복잡한 순서 (예: A 를 먼저 치우고 B 를 집으라) 를 요구할 때 엉뚱한 행동을 하거나 실패합니다.

2. 해결책: HAMLET (해밀렛) - 로봇의 '단기 기억'을 깨우는 기술

저자들은 기존 로봇 AI 를 뜯어고치지 않고, 기존 모델에 '기억력'을 추가하는 가벼운 프레임워크인 HAMLET을 제안합니다.

🧩 핵심 아이디어 1: '순간 토큰 (Moment Tokens)' - 로봇의 '포스트잇'

로봇이 매순간 보는 화면은 너무 방대하고 불필요한 정보 (배경, 벽 등) 가 많습니다. HAMLET 은 매 순간의 중요한 정보만 뽑아내어 **'포스트잇 (Moment Token)'**에 적어둡니다.

  • 마법 같은 초기화: 이 포스트잇은 **'시간 대비 학습 (Time-Contrastive Learning)'**이라는 기술을 통해 훈련됩니다. 마치 사람이 "어제와 오늘은 뭐가 달랐지?"라고 스스로 질문하며 중요한 변화 (물체가 움직인 것, 손이 잡은 것) 만 포스트잇에 적는 것과 같습니다. 정적인 배경은 무시하고, 움직이는 물체나 중요한 사건의 순간만 기억하게 됩니다.

🧠 핵심 아이디어 2: '메모리 모듈' - 로봇의 '작은 두뇌'

단순히 포스트잇을 쌓아두기만 하면 정보가 너무 많아져서 혼란스럽습니다. HAMLET 은 이 포스트잇들을 **가볍고 똑똑한 '메모리 모듈'**에 넣습니다.

  • 선택적 기억: 이 모듈은 **"지금 이 순간에 필요한 과거 정보는 무엇일까?"**를 스스로 판단합니다.
    • 예시: "방금 파란 컵으로 빨간 컵을 덮었는데, 이제 어떤 컵을 들어야 하지?"라고 생각할 때, 메모리 모듈은 **"아, 3 초 전에 파란 컵이 어디에 있었지?"**라는 과거의 포스트잇만 집중해서 보고, 나머지 불필요한 정보는 무시합니다.

3. 왜 이것이 혁신적인가요? (비유로 설명)

  • 기존 방식 (멀티프레임): 과거의 영상 4 개를 모두 화면에 띄워놓고 로봇에게 "이거 봐!"라고 외치는 것과 같습니다.
    • 단점: 화면이 너무 복잡해지고, 로봇이 처리해야 할 데이터가 폭증하여 속도가 느려지고 (35% 감소), 메모리 사용량이 3.6 배나 폭증합니다. 마치 책상 위에 과거의 일기장을 4 권이나 펼쳐놓고 공부하는 것처럼 비효율적입니다.
  • HAMLET 방식: 과거의 영상은 버리고, **핵심 내용만 적힌 '요약 노트 (메모리)'**만 참고합니다.
    • 장점: 속도는 거의 그대로 유지하면서 (약 2% 증가), 기억력은 폭발적으로 향상됩니다. 마치 시험 직전에 두꺼운 교과서 대신, 핵심만 정리된 요약 노트를 보는 것처럼 효율적입니다.

4. 실제 성과: 로봇이 '현명'해지다

이 기술을 적용한 결과, 로봇은 다음과 같은 놀라운 변화를 보였습니다.

  • 장기 미션 성공: "상자를 치우고, 컵을 덮고, 그 위에 다른 컵을 쌓아라"처럼 여러 단계가 필요한 복잡한 작업에서 성공률이 47.2%나 급상승했습니다.
  • 실제 실험: 로봇이 물체를 집어 올렸다가 놓는 과정에서, "아, 방금 그 물체를 놓았으니 이제 다른 쪽으로 가야지"라고 과거의 맥락을 이해하고 올바른 행동을 취했습니다.
  • 범용성: 특정 로봇 모델뿐만 아니라, 다양한 최신 로봇 AI 모델에 **플러그인 (Plug-in)**처럼 쉽게 적용되어 모두 성능을 높였습니다.

📝 한 줄 요약

HAMLET은 기존 로봇 AI 가 가진 **'현재 순간만 보는 단점'**을, **과거의 핵심 정보만 뽑아내는 '지능형 메모리'**로 보완하여, 로봇이 복잡한 장기 미션에서도 과거를 기억하고 현명하게 행동할 수 있게 만든 기술입니다.

"로봇에게 과거를 잊지 않는 '기억력'을 심어주니, 이제 로봇도 복잡한 문제를 해결하는 현명한 조수가 되었습니다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →