QuantWAMs: Calibrating at the Right Granularity for World Action Models
QuantWAMs는 세 가지 새로운 전략을 통해 양자화 결정을 World Action Model의 특정 캘리브레이션 컨텍스트와 정렬함으로써, 시뮬레이션 벤치마크와 실제 로봇 조작 작업 모두에서 성능 저하를 최소화하면서 효율적인 W4A4 배포를 가능하게 하는 포스트 트레이닝 양자화 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 식사 준비를 가르치거나 블록으로 탑을 쌓는 법을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 단순히 사진을 보고 추측하는 것이 아니라, '월드 액션 모델(World Action Model)'을 사용합니다. 이 모델을 미래지향적인 초스마트 영화 감독이라고 생각해 보세요. 이 감독은 현재의 장면을 관찰하고, 다음에 무슨 일이 일어날지 예측하며, 동시에 그 미래를 만들기 위해 로봇의 팔이 어떻게 움직여야 할지를 결정합니다. 이것은 폐쇄 루프(closed loop)입니다. 로봇이 움직이면 세상이 변하고, 로봇은 그 변화를 보고, 다음 동작을 결정합니다. 이는 매우 강력하지만, 마치 거대한 블록버스터 영화를 아주 작은 배터리로 작동하는 계산기에서 실행하려는 것과 같습니다. 미래를 예측하고 팔을 움직이는 데 필요한 수학적 연산량이 너무 방대하여 보통 거대하고 비싼 컴퓨터가 필요하기 때문입니다.
로봇을 우리 집이나 공장에서 실용적으로 만들기 위해, 과학자들은 이 거대한 컴퓨터 뇌를 더 작은 칩에 들어갈 수 있도록 줄이고 싶어 합니다. 그들은 이 과정을 '양자화(quantization)'라는 기술을 통해 수행하는데, 이는 고화질 영화를 더 작은 파일 크기로 압축하는 것과 비슷합니다. 화질을 아주 조금 희생하는 대신 속도와 저장 공간에서 엄청난 이득을 얻는 것입니다. 하지만, 이 파일을 압축하는 표준 방식들은 정적인 이미지나 단순한 텍사를 위해 설계된 것이지, 끊임없이 움직이며 세상에 반응하는 로봇을 위한 것이 아닙니다. 만약 기존의 규칙대로 로봇의 뇌를 압축한다면, 로봇은 환각을 일으키거나, 컵을 잡는 법을 잊어버리거나, 벽에 충돌하게 될 수도 있습니다. 왜냐하면 '압축'이 의사결정 루프의 섬세한 균형을 망가뜨릴 수 있기 때문입니다.
여기서 새로운 논문인 QuantWAMs가 등장합니다. 연구진은 로봇의 뇌를 망가뜨리지 않고 줄이려면, 단순히 범용적인 압축 도구를 사용하는 것만으로는 부족하다는 것을 깨달았습니다. 로봇이 살아가는 세계의 특유한 '분위기(vibe)'에 맞춰 압축을 조정해야 합니다. 그들은 기존 방식들이 세 가지 큰 실수를 저지른다는 것을 발견했습니다. 기존 방식은 로봇의 뇌를 고립된 상태로 바라보고(동작이 세상을 어떻게 바꾸는지 무시함), 뇌의 모든 부분을 동일하게 취급하며(비디오 부분과 액션 부분이 서로 다르다는 점을 무시함), 무엇을 줄일지 결정할 때 잘못된 종류의 데이터를 사용한다는 점입니다.
연구팀은 로봇의 뇌를 솔로 악기가 아닌 복잡한 오케스트라처럼 다룸으로써 이 문제를 해결하는 QuantWAMs라는 새로운 방법을 제안했습니다. 그 방법은 다음과 같습니다.
첫째, 그들은 로봇 뇌의 일부는 '좌표 호환성(coordinate-compatible)'을 가져서 같은 언어를 사용하고 정보를 공유할 수 있는 반면, 다른 부분은 완전히 다르다는 것을 깨달았습니다. 소프라노와 테너는 같은 악보를 공유할 수 있지만, 드럼 연주자는 자신들만의 악보가 필요한 합창단을 상상해 보세요. 기존 방식은 모두에게 똑같은 악보를 주려고 하여 혼란을 야기했습니다. QuantWAMs는 호환 가능한 부분들만을 그룹화하여 그들의 '아웃라이어(outlier)' 데이터(압축하기 어려운 크고 튀는 음들)를 공유하게 함으로써, 압축이 각 섹션의 독특한 목소리를 왜곡하지 않도록 주의 깊게 관리합니다.
둘째, 그들은 뇌의 어떤 부분이 고화질을 유지하고 어떤 부분이 압축될지를 결정하는 방식을 바꿨습니다. 비디오 부분과 액션 부분을 따로 보는 대신, 그들이 함께 어떻게 작동하는지를 보았습니다. 이는 댄스 듀오를 심사하는 것과 같습니다. 무용수의 발놀림과 파트너의 리프트 동작을 각각 따로 평가하는 것이 아니라, 그들이 얼마나 잘 싱크를 맞춰 움직이는지를 평가하는 것입니다. '결합 그래디언트(joint gradient, 비디오와 액션의 결합된 노력)'를 분석함으로써, 그들은 로봇의 성공에 가장 결정적인 역할을 하는 뇌의 층(layer)이 어디인지 정확히 찾아내어 그 부분은 높은 정밀도로 보호하고, 나머지는 안전하게 압축할 수 있었습니다.
셋째, 가장 중요한 점은, 그들이 압축된 뇌를 '가짜' 세계에서 테스트하는 것을 멈췄다는 것입니다. 표준 방식들은 닫힌 트랙에서의 운전 면허 시험처럼 정적인 이미지 세트를 가지고 로봇을 테스트합니다. 하지만 실제 로봇은 매 순간의 회전이 다음 장면을 바꾸는 울퉁불퉁한 도로를 달리고 있습니다. 저자들은 '고정 개입 감사(fixed-intervention audit)'를 만들었습니다. 그들은 로봇의 실제 전체 정밀도 움직임을 가져와서, 잠시 멈춘 뒤 이렇게 물었습니다. "만약 이 정확한 순간에 압축된 뇌를 사용했다면, 로봇이 회복할 수 있었을까?" 이를 통해 그들은 보호 스케줄을 동적으로 조정하여, 세상이 혼란스러워지더라도 로봇이 안전하게 유지되도록 했습니다.
이 새로운 접근 방식의 결과는 인상적이지만, 저자들은 이것이 시뮬레이션과 특정 실세계 실험에 기반했다는 점을 주의 깊게 명시하고 있습니다. 그들이 두 가지 다른 로봇 모델(Fast-WAM 및 LingBot-VA)에 대해 매우 공격적인 압축 설정(가중치와 활성화 함수 모두에 4비트 정밀도를 사용하는 W4A4)을 사용하여 테스트했을 때, 로봇의 성능은 거의 떨어지지 않았습니다. 시뮬레이션에서 성공률은 원래의 압축되지 않은 버전보다 단 0.2~0.7 퍼센트 포인트 낮았습니다. 예를 들어, RoboTwin 2.0 작업에서 압축된 로봇은 원래 버전의 91.9%에 비해 **91.7%**의 성공률을 보였습니다.
더 중요한 것은, 이 압축이 엄청난 이점을 가져왔다는 점입니다. 로봇의 비디오 및 액션 블록에 필요한 메모리가 원래 버전의 약 **29%**로 줄어들었습니다. 이로 인해 로봇은 의사결정 속도가 1.4~1.6배 빨라졌습니다. 그들은 심지어 압축된 로봇을 AgiBot G2 로봇과 함께 실제 환경으로 가져가 사과 집기, 블록 쌓기, 수건 접기 등의 작업을 수행하게 했습니다. 이 실세계 실험에서 압축된 로봇은 전체 정밀도 버전의 30번 중 19번 성공한 것에 비해, 30번 중 17번 성공하며 압축된 뇌가 물리적 환경에서도 실제로 기능할 수 있음을 증명했습니다.
이 논문은 동작이 세상을 바꾸고, 세상이 다음 동작을 바꾼다는 로봇 학습의 독특한 폐쇄 루프 특성을 존중함으로써, 우리가 언젠가 일상에서 보게 될 로봇에서 실행될 수 있을 만큼 강력한 AI 모델을 작게 만들 수 있다고 시사합니다. 이것이 모든 것을 즉시 해결하는 마법의 지팡이는 아니지만, 로봇의 뇌를 똑똑하면서도 작게 만드는 데 있어 중요한 단계입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.