StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design
StepX-Edge는 UI 인지형 아키텍처, 시너지 효과를 내는 5단계 학습 커리큘럼, 그리고 고정밀 양자화 전략의 새로운 공동 설계를 통해 최첨단 UI 이해 능력과 모바일 칩에서의 효율적인 실시간 배포를 달성한 0.9B 파라미터 규모의 온디바이스 시각-언어 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 책을 읽고, 사진을 보고, 그 사진에 대해 질문에 답할 수 있는 초지능적인 로봇 두뇌를 가지고 있다고 상상해 보세요. 이것이 바로 **시각-언어 모델(Vision-Language Models, VLMs)**의 세계입니다. 오랫동안 이 두뇌들은 엄청난 양의 전력과 메모리를 필요로 했기 때문에, 거대한 서버가 있는 클라우드 기반의 대형 데이터 센터에 거주해야 했습니다. 하지만 이 두뇌를 당신의 스마트폰 안에 들어갈 정도로 줄일 수 있다면 어떨까요? 그것이 바로 꿈꾸는 목표입니다. 인터넷 연결 없이도 당신의 휴대폰 화면을 보고, 당신이 무엇을 하고 있는지 이해하며, 적절한 버튼을 누를 수 있도록 도와주는 AI를 갖는 것입니다.
문제는 고전적인 트레이드오프(trade-off) 관계에 있습니다. 화면의 작은 글자를 읽거나 특정 아이콘을 찾을 수 있을 만큼 똑똑한 두뇌를 만들려면 보통 많은 "뉴런"(파라미터)이 필요한데, 이는 모델을 무겁고 느리게 만듭니다. 하지만 당신의 휴대폰은 배터리, 메모리, 프로세싱 능력에 엄격한 제한이 있습니다. 두뇌를 너무 많이 줄이면 모델이 멍청해져서 "닫기" 버튼을 "저장" 버튼으로 착각하는 등의 실수를 하기 시작합니다. 반대로 모델을 크게 유지하면 배터리가 몇 분 만에 방전됩니다. 과학자들은 이 "정확도 대 효율성"이라는 퍼즐을 풀기 위해 노력해 왔으며, 종종 똑똑하지만 느린 모델과 빠르지만 멍청한 모델 사이에서 하나를 선택해야만 했습니다.
여기서 StepX-Edge라는 새로운 프로젝트가 등장하여 이 암호를 해독했다고 주장합니다. 연구진은 모바일 폰에서 직접 구동되는 단 **0.9B(9억 개)**의 파라미터만을 가진 아주 작은 AI 모델을 구축했습니다(이러한 작업 치고는 매우 작은 크기입니다). 그들은 단순히 기존의 거대한 모델을 축소한 것이 아니라, 전체를 처음부터 다시 설계했습니다. 이것은 트럭에 더 작은 엔진을 얹는 대신, 맞춤형 레이싱 카를 제작하는 것과 같습니다.
첫째, 그들은 아키텍처(자동차의 프레임)를 재설계했습니다. 그들은 스마트폰 화면의 독특한 형태(정사각형 사진과 달리 종종 길고 가느다란 형태)에 집착하는 특별한 "눈"을 만들었고, 눈이 보는 것을 뇌의 언어 능력과 연결하면서도 어떤 세부 정보도 놓치지 않는 "다리"를 만들었습니다. 또한 휴대폰이 잘 처리할 수 없는 화려하고 복잡한 부품들을 피하고, 모바일 칩에서 매끄럽게 작동하는 표준적이고 신뢰할 수 있는 부품들을 사용했습니다.
둘째, 그들은 학습(운전 학교) 방식을 바꿨습니다. 모델을 모든 종류의 데이터가 뒤섞인 혼란스러운 환경에 던져 넣는 대신, "커리큘럼" 접근 방식을 사용했습니다. 그들은 텍스트 읽기(OCR), 화면 레이아웃 이해, 질문 답변, 그리고 특정 버튼 가리키기라는 네 가지 기술을 동시에 가르치는 것이 실제로 이 모든 기술을 함께 향상시킨다는 것을 발견했습니다. 이는 마치 학생이 피아노와 체스를 동시에 배우는 것과 같아서, 한 가지에 집중하는 과정이 다른 데에도 도움이 되는 것과 같습니다. 그들은 단순한 정렬(alignment)에서 시작하여 점차 복잡한 실제 화면 상호작용으로 나아가는 5단계 과정을 통해 모델을 훈련시켰으며, 이를 통해 네 가지 기술이 서로의 주의를 빼앗는 대신 서로를 강화하도록 보장했습니다.
마지막으로, 그들은 배포(엔진 튜닝)를 마스터했습니다. 모델을 휴대폰에 맞추기 위해 그들은 모델을 대폭 압축해야 했는데, 이는 보통 지능을 망가뜨리곤 합니다. 팀은 영리한 2단계 압축 기법을 사용했습니다. 그들은 "눈"(시각 부분)과 "뇌"(언어 부분)를 다르게 취급하여, 뇌는 4비트 크기로 아주 작게 압축하는 동시에 눈의 정밀도는 더 높게 유지했습니다. 그런 다음 압축된 뇌가 디테일의 손실을 어떻게 보완할지 "가르치는" 특별한 학습 방법을 사용하여 정확도 손실을 1% 미만으로 유지했습니다.
결과는 어떠했을까요? 고성능 폰 칩(Snapdragon 8 Gen 5)에서 이 작은 모델은 안정적으로 구동됩니다. 이 모델은 스크린샷을 보고 이해한 뒤 약 0.84초 만에 질문에 답하기 시작하며, 98 토큰/초의 속도로 텍스트를 생성하는 동시에 단 1.4 GB의 메모리만 사용합니다. 테스트 결과, 이 0.9B 모델은 화면상의 중국어 텍스트를 읽거나 디스플레이에 있는 내용에 대해 질문에 답하는 작업에서 20억~23억 개의 파라미터를 가진 훨씬 더 큰 모델들과 대등하거나 그들을 능가했습니다. 저자들은 아키텍처, 학습, 배포를 정교하게 공동 설계함으로써, 속도를 위해 정확도를 희생하지 않으면서도 매우 유능한 온디바이스(on-device) AI를 가질 수 있음을 보여주었으며, 이는 당신의 휴대폰 안에서 완전히 살아 움직이는 스마트 비서의 문을 열어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.