← 최신 논문
🤖 machine learning

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Deltoris는 시간적 인지 비트 희소성(temporal-aware bit-sparsity), 추측적 추론(speculative inference), 그리고 맞춤형 비트 직렬 시스톨릭 가속기(custom bit-serial systolic accelerator)를 활용하여 기존 솔루션 대비 상당한 속도 향상을 달달성함으로써 엣지 디바이스에서 확산 기반 시각-언어-행동(Vision-Language-Action) 모델의 실시간적이고 에너지 효율적인 추론을 가능하게 하는 알고리즘-하드웨어 공동 설계 프레임워크이다.

원저자: Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 공 던지기 놀이를 배우려고 노력하는 모습을 상상해 보세요. 이를 위해 로봇은 공을 보고, 규칙을 이해하며, 팔을 정확히 어떻게 움직일지 결정할 수 있는 두뇌가 필요합니다. 로봇 공학의 세계에서 이 '두뇌'는 흔히 시각-언어-행동(Vision-Language-Action, VLA) 모델이라고 불리는 특별한 종류의 컴퓨터 프로그램입니다. 이것은 로봇이 보고 듣는 것을 물리적인 움직임으로 바꾸어 주는 매우 똑똑한 번역가와 같습니다. 오랫동안 이 로봇들은 움직임을 만들기 위한 수학적 계산이 벽돌이 가득 담긴 배낭을 메고 마라톤을 하는 것처럼 매우 무거웠기 때문에 다소 느리고 서툴렀습니다.

최근 과학자들은 '확산(diffusion)'이라 불리는 새로운 방식으로 로봇에게 움직임을 가르치는 방법을 발견했습니다. 마치 로봇이 안개가 자욱한 방에서 처음에는 비틀거리며 걷다가, 단계적으로 안개를 걷어내며 완벽한 경로를 찾아가는 과정을 상상해 보세요. 이 방식은 이전보다 로봇을 훨씬 더 부드럽게 움직이게 하고 새로운 상황에 더 잘 대처하게 만듭니다. 하지만 문제가 하나 있습니다. 이 '안개를 걷어내는' 과정은 계산량이 너무 많아서 실시간 사용에는 너무 느리다는 점입니다. 로봇은 균형을 잡고 안전을 유지하기 위해 초당 50에서 200번의 결정을 내려야 하지만, 이 새로운 모델들은 치와의 경주에서 승리하려는 달팽이처럼 너무 오래 걸렸습니다. 이것이 바로 연구진이 해결하고자 했던 문제입니다. 어떻게 하면 이 초스마트하고 부드럽게 움직이는 로봇들을 실제 세상의 속도에 맞출 수 있을까요?

여기서 등장한 것이 바로 **델토리스(Deltoris)**입니다. 이는 로봇의 두뇌를 멍청하게 만들지 않으면서도 속도를 높이기 위해 설계된 영리한 새로운 시스템입니다. 연구진은 로봇이 사는 세상이 모든 것이 순식간에 변하는 세상이 아니라는 점에 주목했습니다. 만약 로봇이 컵을 향해 손을 뻗고 있다면, 1밀리초 전과 후의 컵의 모습은 거의 동일합니다. 이는 영화의 프레임 중 98%가 동일한 것을 보는 것과 같습니다. 매번 전체 그림을 다시 그릴 필요 없이, 아주 미세하게 변한 부분만 그리면 되는 것입니다.

델토리스는 **시공간 인지적 비트 수준 희소성(temporal-aware bit-level sparsity)**이라는 기술을 통해 이 관찰을 유리하게 활용합니다. 시스템은 매 움직임마다 전체 수학 문제를 다시 계산하는 대신, 현재의 순간과 지난 순간 사이의 '차이'만을 계산합니다. 이는 마치 매번 자신의 전기를 새로 쓰는 대신 "손을 2인치 위로 올렸음"이라는 짧은 메시지만 보내는 것과 같습니다. 이 방식은 불필요한 작업의 상당 부분을 건너뛰어 계산량을 90% 이상 줄여줍니다.

하지만 난관이 있었습니다. '차이'만을 보내는 방식 때문에, 시스템은 새로운 정보와 비교하기 위해 메모리에서 끊임없이 '이전' 정보를 가져와야 했고, 이로 인해 데이터 파이프라인에 교통 체증이 발생했습니다. 이를 해결하기 위해 팀은 **추측적 추론(speculative inference)**이라는 두 번째 기술을 추가했습니다. 이는 마치 작고 빠른 조수가 다음 몇 수의 움직임을 예측하면, 크고 느리지만 매우 똑똑한 감독이 그 예측들을 한꺼번에 확인하는 것을 상상해 보세요. 이를 통해 시스템은 무거운 데이터를 단 한 번만 로드하여 여러 단계를 검증하는 데 사용할 수 있고, 데이터 병목 현상을 완화할 수 있습니다.

이 모든 마법을 실현하기 위해 연구진은 단순히 소프트웨어만 작성한 것이 아니라, 이러한 '차이' 계산을 전문적으로 처리할 수 있도록 설계된 맞춤형 하드웨어 칩(가속기)을 직접 제작했습니다. 그들은 서로 완벽하게 협력하는 작은 프로세서들의 특수 조립 라인을 만들어, 데이터가 도착하기를 기다리며 아무도 놀고 있지 않도록 보장했습니다.

그들의 실험 결과는 매우 인상적입니다. 델토리스를 표준 모바일 컴퓨터 칩(고성능 스마트폰에 들어가는 칩 등) 및 다른 특수 로봇 칩들과 비교했을 때, 압도적인 승리를 거두었습니다. 델토리스는 모바일 GPU보다 최대 34.2배 더 빨랐으며, 이전의 특수 가속기보다 6.1배 더 빨랐습니다. 더욱 중요한 점은 에너지를 최대 822배 적게 사용했다는 것인데, 이는 배터리로 작동하는 로봇에게 매우 중요한 요소입니다. 또한 연구진은 이러한 지름길을 이용해도 로봇이 혼란을 느끼지 않는지 확인했으며, 정확도는 거의 동일하게 유지되었고 성능 저하는 무시할 수 있는 아주 미미한 수준이었습니다.

요약하자면, 델토리스는 우리가 무엇을 계산할지(변화하는 부분만) 그리고 어떻게 계산할지(예측을 그룹화하여) 영리하게 결정함으로써, 마침내 구현된 AI(embodied AI)가 실시간으로 움직이는 데 필요한 속도와 효율성을 갖출 수 있음을 보여줍니다. 이는 로봇이 단순히 생각하는 것을 넘어, 우리만큼 빠르게 행동할 수 있게 하는 중요한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →