← 최신 논문
🤖 machine learning

NAC: Neural Action Codec for Vision-Language-Action Models

이 논문은 로봇 행동 궤적을 다채널 1D 신호로 취급하여 기존의 토큰화 방식보다 시각-언어-행동(Vision-Language-Action) 모델에서 고충실도 압축과 우수한 다운스트림 성능을 달성하는, 신경 오디오 코덱(Neural Audio Codec, NAC)에서 영감을 받은 아키텍처인 Neural Action Codec(NAC)을 소개한다.

원저자: Ahad Jawaid, Yu Xiang

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ahad Jawaid, Yu Xiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 팔에게 블록 쌓기나 음료 따르기와 같이 섬세한 작업을 수행하도록 가르치려 한다고 상상해 보십시오. 로봇은 부드럽고 정밀하게 움직여야 하지만, 이를 제어하는 컴퓨터 두뇌(시각-언어-행동 모델, Vision-Language-Action model)는 단어와 그림으로 생각하는 데 사용됩니다.

이들이 서로 대화할 수 있게 하려면, 로봇의 부드러운 움직임을 컴퓨터가 이해할 수 있는 언어, 즉 일련의 이산적인 단계 또는 "토큰(tokens)"으로 번역해야 합니다. 이것은 마치 매끄럽게 흐르는 노래를 일련의 음표로 변환하는 것과 같습니다.

문제점: 기존 방식은 투박했습니다

이전에는 과학자들이 이 번역을 수행하기 위해 크게 두 가지 방법을 시도했습니다.

  1. "빈닝(Binning)" 방식: 아주 적은 눈금이 있는 자를 사용하여 매끄러운 곡선을 묘사하려고 노력하는 것과 같습니다. 이 방식은 움직임을 아주 작고 울퉁불퉁한 단계로 쪼개야 합니다. 이는 처리 속도가 느리고 부정확하며, 엄청나게 긴 명령 목록을 만들어냅니다.
  2. "주파수(Frequency)" 방식: 어떤 이들은 움직임을 압축 파일처럼 압축하려 했지만, 인간의 음성에 설계된 도구들을 사용했습니다. 이 방식이 도움이 되기는 했지만 완벽하지는 않았습니다. 왜냐하면 로봇의 움직임과 인간의 목소리는 근본적으로 다르기 때문입니다.

해결책: 음악에서 빌려오기 (NAC)

이 논문의 저자인 아하드 자와이드(Ahad Jawaid)와 유 샹(Yu Xiang)은 영리한 아이디어를 냈습니다. "왜 음악을 압축하는 기술을 사용하지 않을까?"

음악을 생성하거나 스포티파이(Spotify) 파일을 압축하는 데 사용되는 현대의 오디오 AI 모델들은 복잡한 음파를 컴팩트한 코드 목록으로 변환한 다음, 나중에 이를 완벽하게 재구성하는 데 매우 뛰어납니다. 그들은 이를 "뉴럴 오디오 코덱(Neural Audio Codec)"이라고 부릅니다.

연구팀은 로봇의 움직임이 사실 변장한 음파라는 점을 깨달았습니다.

  • 오디오: 시간에 따라 변화하는 공기 압력의 파동 (고주파).
  • 로봇 행동: 시간에 따라 변화하는 관절 각도의 파동 (저주파).

그들은 **NAC (Neural Action Codec)**라는 새로운 시스템을 구축했습니다. 그들은 "음악 압축" 엔진을 가져와 로봇의 움직임을 "압축"하도록 용도를 변경했습니다.

반전: 로봇의 소리를 듣지 마세요

이 논문이 발견한 가장 중요한 사실은 다음과 같습니다: 로봇에게 그 소리를 듣는 방식으로 움직임을 가르칠 수는 없습니다.

오디오 코덱은 인간의 귀에 좋게 들리도록 훈련됩니다. 이들은 인간의 청각을 모방하는 "멜-스펙트로그램(Mel-spectrogram)"이라는 특수 필터를 사용합니다. 저자들은 만약 로봇에게 이 인간의 귀를 위한 필터를 사용한다면, 로봇이 완전히 실패할 것이라는 점을 발견했습니다. 그것은 마치 개 짖는 소리를 듣고 기타를 조율하려는 것과 같습니다. 도구가 서로 맞지 않는 것입니다.

대신, 그들은 "인간의 귀" 필터를 제거하고 단순히 정확도만을 중시하는 수학적 계산으로 대체했습니다. 그들은 AI에게 이렇게 말했습니다. "어떻게 들리는지는 신경 쓰지 마. 대신 로봇의 손이 정확히 올바른 위치에 도달하는지에만 집중해."

작동 원리 (비유)

로봇의 움직임을 길고 복잡한 영화라고 생각해 보십시오.

  1. 인코더 (요약기 - The Encoder): NAC 시스템은 영화를 살펴보고 이를 몇 개의 핵심 장면(거친 구조)으로 나누고, 그다음 세부적인 움직임(미세한 움직임)을 채워 넣습니다. 이 과정을 통해 전체 영화를 짧고 효율적인 코드 목록으로 변환합니다.
  2. 디코더 (프로젝터 - The Decoder): 로봇이 움직여야 할 때, 시스템은 그 짧은 코드 목록을 가져와 특별한 프로젝터(ISTFT 헤드라고 불림)를 사용하여 움직임의 부드럽고 고해상도인 영화로 다시 변환합니다.
  3. "판별기" (비평가 - The Discriminator): 움직임이 부드럽지 않고 끊기지 않도록 하기 위해, 시스템은 "비평가" AI를 사용하여 원래의 움직임과 비교 검토합니다. 만약 움직임이 너무 툭툭 끊긴다면, 비평가는 "안 돼!"라고 외치며 시스템이 다시 시도하도록 강제하여 움직임을 부드럽게 만듭니다.

결과

연구팀은 컴퓨터 시뮬레이션과 실제 환경에서 이 새로운 방법을 기존 방식들과 비교 테스트했습니다.

  • 시뮬레이션에서: NAC를 사용하는 로봇은 기존 방식들을 사용하는 로봇보다 작업(블록 쌓기 등)을 완료하는 능력이 현저히 뛰어났습니다. 더 정밀했고 실수도 적었습니다.
  • 실제 환경에서: 실제 물리적 로봇에 적용했을 때도 NAC는 여전히 승리했으며, 다른 방법들에 비해 훨씬 낮은 성공률을 보인 것에 비해 50%의 성공률을 달성했습니다.

핵심 요약

이 논문은 로봇의 움직임을 오디오 파동처럼 취급하고 음악 산업의 최신 도구들을 사용하되(단, "인간의 귀" 필터는 제거하고), 이를 통해 로봇이 훨씬 더 효율적으로 움직일 수 있다고 주장합니다. 이는 무질서하고 연속적인 물리적 문제를 현대 AI가 쉽게 학습하고 예측할 수 있는 깔끔하고 조직적인 명령 목록으로 변환해 줍니다.

요약하자면: 그들은 로봇에게 움직임을 "노래"하도록 가르침으로써 움직이는 법을 가르쳤지만, 로봇이 인간의 언어가 아닌 자신만의 언어로 노래하도록 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →