← 최신 논문
💻 computer science

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS는 VLM 레이어를 업데이트 빈도에 따라 계층화하고 다중 스케일 특징 상호작용을 재라우팅하여 효율성과 정확성 사이의 트레이드오프를 해결하는 통합된 fast-to-slow 계층 구조를 시각-언어-행동(Vision-Language-Action) 모델에 도입함으로써, LIBERO 벤치마크와 실제 로봇 플랫폼에서 최첨단 성능을 달성하고 지연 시간을 크게 단축했습니다.

원저자: Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 블록 쌓기나 컵 집기 같은 섬세한 작업을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 두 가지 요소가 함께 작동해야 합니다:

  1. 두뇌 (시각-언어 모델 - Vision-Language Model): 이 부분은 장면을 관찰하고, 지시 사항을 읽으며, "큰 그림"을 이해합니다 (예: "빨간 블록을 파란 블록 위에 쌓아야 해"). 똑똑하지만 생각하는 속도는 느립니다.
  2. 손 (액션 전문가 - Action Expert): 이 부분은 실제로 로봇의 팔을 움직입니다. 물건을 떨어뜨리지 않도록 즉각적으로 반응해야 하므로 매우 빨라야 합니다.

문제점: "속도 vs 지능"의 딜레마

현재의 로봇 두뇌는 좌절스러운 캐치-22(진퇴양난) 상황에 직면해 있습니다.

  • 기존 방식: "두뇌"와 "손"이 분리되어 있습니다. 두뇌는 손에게 느린 업데이트를 보냅니다. 만약 두뇌가 너무 자주 업데이트하면 로봇은 느리고 둔해집니다. 만약 두뇌가 너무 드물게 업데이트하면, 손이 명령을 받았을 때 두뇌의 지시가 이미 구식이 되어 버립니다 (마치 이미 움직여 버린 공을 잡으려는 것과 같습니다).
  • 정보 손실: 더 심각한 문제는, 손이 두뇌의 '최종적인 생각'만을 전달받는다는 점입니다. 손은 두뇌가 그 과정에서 거친 모든 흥미로운 "사고 단계"를 놓치게 되며, 이는 로봇의 움직임을 정밀하게 만드는 데 한계를 줍니다.

해결책: UniFS (다중 속도 두뇌)

이 논문의 저자들은 UniFS를 통해 인간의 뇌가 어떻게 작동하는지 주목했습니다. 그들은 우리의 뇌가 단 하나의 속도로만 작동하는 것이 아니라, 동시에 서로 다른 속도로 정보를 처리한다는 점을 발견했습니다. 빠른 파동은 즉각적인 감각적 세부 사항(예: 갑작스러운 소음)을 처리하고, 느린 파동은 깊고 안정적인 사고(예: 당신의 이름이나 장기적인 계획)를 처리합니다.

UniFS는 이 아이디어를 로봇에 적용하여 **통합된 Fast-to-Slow 아키텍처(Unified Fast-to-Slow Architecture)**를 구축했습니다. 작동 방식은 다음과 같습니다:

1. "계층적 팀" (층별 구조 - Stratified Layers)

전체 두뇌가 하나의 속도로 생각하는 대신, UniFS는 두뇌의 레이어들을 서로 다른 교대 근무 일정을 가진 팀으로 나눕니다.

  • 얕은 레이어 (정찰병 - The Shallow Layers): 이들은 네트워크의 바깥쪽 레이어입니다. 이들은 매우 빠르게 업데이트됩니다 (매 단계마다). 이들은 마치 주변을 끊임없이 돌며 즉각적인 환경 변화를 보고하는 정찰병과 같습니다 (예: "컵이 방금 흔들렸어요!").
  • 깊은 레이어 (전략가 - The Deep Layers): 이들은 안쪽 레이어입니다. 이들은 매우 느리게 업데이트됩니다 (몇 단계마다 한 번씩). 이들은 명령 센터의 장군들과 같아서, 작은 흔들림에 주의를 빼앗기지 않고 안정적인 계획("빨간 블록을 쌓아라")을 유지합니다.

결과: 로봇은 즉각적인 변화에 대한 반응성과 안정적인 장기 계획이라는 두 마리 토끼를 모두 잡게 됩니다. 이 모든 것이 단일한 두뇌 안에서 이루어집니다.

2. "비밀스러운 인계" (잠재 벡터 역전 - Latent Vector Inversion)

까다로운 문제가 하나 있었습니다. 표준 AI에서는 깊은 레이어(느린 전략가들)가 실제 동작 출력과 너무 가까이 있기 때문에 너무 빠르게 변한다는 점이었습니다. 이는 "느린" 계획의 원칙을 깨뜨렸습니다.

이를 해결하기 위해 UniFS는 **잠재 벡터 역전(Latent Vector Inversion)**이라는 영리한 트릭을 사용합니다.

  • 비유: 보통 "빠른" 주자가 "느린" 주자에게 바톤을 넘기는 이어달리기와 달리, UniFS는 이 순서를 뒤집습니다. 일반적인 경우와 달리, UniFS는 "빠른" 감각적 세부 사항을 미세한 운동 기술을 담당하는 레이어로 보내고, "느린" 안정적인 계획은 큰 그림을 담당하는 레이어로 보냅니다.
  • 효과: 이를 통해 "전략가"들은 차분하고 안정적인 상태를 유지하고, "정찰병"들은 혼란스럽고 빠르게 움직이는 세부 사항들을 처리할 수 있게 됩니다. 이는 적절한 정보를 적절한 역할에 맞게 정렬해 줍니다.

3. "코치의 휘슬" (다단계 감독 - Multi-Level Supervision)

로봇이 올바르게 학습하도록 하기 위해, 훈련 과정에는 다단계 감독이 사용됩니다.

  • 비유: 선생님이 학생(로봇)을 평가할 때 최종 시험(최종 동작)만 채점하는 것이 아니라, 학습 과정의 모든 단계에서 피드백을 주는 것과 같습니다.
  • 목표: 이를 통해 "느린" 레이어는 장기적인 계획을 세우는 법을 배우고, "빠른" 레이어는 신속한 교정법을 배우도록 강제하여, 로봇이 지름길을 택하거나 혼란에 빠지는 것을 방지합니다.

결과: 더 빠르고 더 똑똑하게

논문은 이 새로운 시스템을 LIBERO(로봇 조작 작업 세트) 벤치마크와 실제 로봇 팔(Franka)에서 테스트했습니다.

  • 속도: 이 새로운 시스템은 이전 방식보다 2.1배 더 빠릅니다. 의사 결정에 걸리는 시간을 36.5밀리초에서 단 17.8밀리초로 단축했습니다. 이는 마치 느릿느릿한 달팽이가서 빠르게 달리는 스프린터가 된 것과 같습니다.
  • 성공률: 98.3%의 성공률을 달성했으며, 이는 다른 모델들과 비교했을 때 가장 높은 수준(State-of-the-art)입니다.
  • 메모리: "느린" 레이어는 매 단계마다 업데이트되지 않기 때문에, 별도의 메모리 뱅크 없이도 자연스럽게 과거의 맥락을 유지합니다. 이는 몇 초 전에 무슨 일이 있었는지 자동으로 기억하는 내장된 단기 기억 장치를 가진 것과 같습니다.

요약

UniFS는 로봇에게 동시에 여러 속도로 생각할 수 있는 두뇌를 부여하는 것과 같습니다. 즉각적인 안전을 위한 빠른 반응형 외곽 레이어와 장기 계획을 위한 느리고 안정적인 내부 레이어를 갖추고 있습니다. 이러한 레이어들이 로봇의 손과 소통하는 방식을 뒤집고 각 단계마다 특정 피드백으로 훈련함으로써, 로봇은 그 어느 때보다 빠르고 정확해졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →