← 최신 논문
🤖 machine learning

MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

본 논문은 하드웨어 인지형 프록시 모델과 새로운 최적화 알고리즘을 활용하여 혼합 정밀도 양자화 기법을 효율적으로 탐색함으로써, 상당한 지연 시간 감소와 최소한의 정확도 손실을 통해 엣지 AI 모델의 신속한 배포를 가능하게 하는 엔드 투 엔드 하드웨어-소프트웨어 공동 설계 프레임워크인 MiCoPro를 제시한다.

원저자: Zijun Jiang, Yangdi Lyu

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zijun Jiang, Yangdi Lyu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 고화질 영화를 아주 작은 구식 MP3 플레이어에 넣으려고 노력한다고 상상해 보세요. 이 영화는 고양이들을 인식하거나, 언어를 번역하거나, 자동차를 운전하는 법을 배우는 컴퓨터 두뇌인 '신경망(Neural Network)'입니다. 문제는 이 두뇌들이 보통 많은 공간을 차지하고 처리하는 데 많은 에너지를 요구하는 무거운 부동 소수점 숫자(예: 32비트 또는 64비트)로 구축되어 있다는 점입니다. 스마트워치나 드론 같은 작은 기기에서 이들을 실행하기 위해 엔지니어들은 '양자화(Quantization)'를 사용합니다. 이것은 영화를 압축하는 것과 같습니다. 수백만 가지의 색상을 사용하는 대신, 이미지가 오직 몇 가지 회색조만을 사용하도록 강제하는 것입니다. 이렇게 하면 파일 크기가 작아지고 재생 속도가 빨라지지만, 너무 많이 압축하면 화면이 흐릿해져서 AI가 더 이상 고양이를 인식하지 못하게 됩니다.

오랫동안 엔지니어들은 전체 영화를 동일한 낮은 품질로 압축하려고 시도했습니다. 마치 모든 프레임을 4비트 스케치로 만드는 것과 같습니다. 하지만 이는 느린 슬로우 모션 액션 장면과 조용한 대화 장면 모두를 동일한 저해상도로 만드는 것과 같아서, 조용한 부분에서는 공간을 낭비하고 액션 부분에서는 화질을 망치게 됩니다. 더 똑똑한 아이디어는 '혼합 정밀도 양자화(Mixed Precision Quantization, MPQ)'입니다. 이것은 액션 장면은 고화도(8비트)로 유지하면서, 지루한 대화 장면은 아주 작은 스케치(2비트)로 줄이는 스마트한 압축 알고리즘과 같습니다. 하지만 문제는 정확히 어떤 장면을 얼마나 줄일지 결정하는 것입니다. 만약 예측을 잘못하면 영화는 엉망이 됩니다. 반대로 예측에 성공하면, 여전히 훌륭한 화질을 유지하면서도 아주 작은 용량의 파일을 얻을 수 있습니다. 이것이 바로 이 논문의 연구자들이 해결하고자 했던 퍼즐입니다.

이 논문은 이 퍼즐을 자동으로 해결하기 위해 MiCo(그리고 업그레이드 버전인 MiCoPro)라는 새로운 툴킷을 소개합니다. 사람이 신경망의 모든 레이어를 수동으로 조정하는 것(이는 100시간짜리 영화를 프레임 단위로 편집하려는 것과 같습니다) 대신, MiCo 시스템은 초스마트하고 빠른 감속 편집자처럼 작동합니다. 이 시스템은 '프록시 모델(Proxy Model)'을 사용하는데, 이는 특정 압축 방식이 실제 하드웨어에서 얼마나 빠르게 실행될지를 실제로 실행해보지 않고도 예측할 수 있는 일종의 수정구슬입니다.

연구진은 기존의 속도 예측 방식이 책을 읽는 데 시간이 얼마나 걸릴지 추측하기 위해 단순히 책의 단어 수를 세는 것과 같다는 것을 발견했습니다. 그것은 대략적인 추정치는 될 수 있지만, 글자 크기가 작은지, 독자가 피곤한지, 혹은 책이 무거운지는 무시합니다. 이 논문은 이러한 기존 방식(BOPs라고 불리는 '비트 연산')이 하드웨어의 특수한 특성을 이해하지 못하기 때문에 잘못된 선택을 유도할 수 있다고 주장합니다. 반면, MiCoPro는 각 특정 장치에 맞는 맞춤형 '속도계'를 구축합니다. 이는 서로 다른 하드웨어가 다양한 유형의 수학 연산을 어떻게 처리하는지 학습하여, 정확도를 잃지 않으면서도 AI를 가장 빠르게 실행할 수 있는 최적의 고정밀 및 저정밀 조합을 찾아냅니다.

실험에서 팀은 단순한 이미지 인식기부터 더 큰 언어 모델에 이르기까지 다양한 AI 모델을 테스트했습니다. 그들은 새로운 '하드웨어 인지 프록시(Hardware-Aware Proxy)'를 사용하여 AI가 생각하는 데 걸리는 시간(지연 시간, Latency)을 최대 **40%**까지 줄이면서도 정확도는 3% 미만으로만 손실했다는 것을 발견했습니다. 이는 휴대폰 화면을 어둡게 만들지 않고도 배터리를 40% 더 오래 지속시키는 방법을 찾아낸 것과 같습니다.

또한 이 논문은 이것이 단순한 이론이 아님을 강조합니다. 그들은 파이썬(Python)으로 설계된 모델을 특수 가속기나 수정된 RISC-V 프로세서를 포함한 칩에서 직접 실행될 수 있는 순수한 베어 메탈(Bare-metal) C 코드로 변환하는 소프트웨어를 실제로 구축했습니다. 그들은 자신들의 방법이 엄청난 수의 가능한 조합 속에서 길을 잃는 기존의 '탐색(Search)' 알고리즘보다 더 뛰어나다는 것을 보여주었습니다. '근접 제약 샘플링(Near-Constraint Sampling)'이라는 기술을 사용하여, MiCo는 너무 느리거나 너무 빠른 옵션들을 확인하며 시간을 낭비하는 대신, 속도 제한 바로 근처의 '스윗 스팟(Sweet Spot)'에 집중하여 탐색합니다.

궁극적으로 이 논문은 엣지 AI(Edge AI)에서 최대한의 성능을 얻기 위해 신경망의 모든 레이어를 동일하게 취급하는 것을 멈춰야 한다고 제안합니다. 고정밀도와 저정밀도의 수준을 혼합하고 조합하는 스마트한 하드웨어 인지 가이드를 사용함으로써, 우리는 AI를 더 빠르고 효율적으로 만들 수 있습니다. 저자들은 이 접근 방식이 견고하여 다양한 종류의 칩과 모델에 걸쳐 작동함을 입증했으며, 다른 사람들이 사용할 수 있도록 오픈 소스 프레임워크를 제공합니다. 비록 결과가 시뮬레이션과 특정 하드웨어 테스트를 기반으로 하고 있지만, 다양한 시나리오에서 나타난 일관된 성공은 이 '스마트 압축' 전략이 엣지 AI의 미래를 위한 강력한 도구임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →