← 최신 논문
💻 computer science

EdgeFM: Efficient Edge Inference for Vision-Language Models

EdgeFM 는 불필요한 기능을 제거하고 AI 가 생성한 저수준 커널을 활용하여 독점 도구 체인보다 우수한 성능과 이식성을 달성함으로써 비전-언어 모델을 크로스 플랫폼 산업용 엣지 배포에 최적화하는 경량의 에이전트 기반 추론 프레임워크입니다.

원저자: Mengling Deng, Yuanpeng Chen, Sheng Yang, Wei Tao, Wenhai Zhang, Hui Song, Linyuanhao Qin, Kai Zhao, Xiaojun Ye, Shanhui Mo, Jingli Fan, Shuang Zhang, Bei Liu, Tiankun Zhao, Xiangjing An

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mengling Deng, Yuanpeng Chen, Sheng Yang, Wei Tao, Wenhai Zhang, Hui Song, Linyuanhao Qin, Kai Zhao, Xiaojun Ye, Shanhui Mo, Jingli Fan, Shuang Zhang, Bei Liu, Tiankun Zhao, Xiangjing An

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 그림을 보고 이해하며 지시를 내릴 수 있는 천재적이고 초지능적인 로봇 비서 (시각 - 언어 모델) 를 가지고 있습니다. 당신은 이 비서를 자율주행차나 창고용 드론처럼 즉시 반응해야 하는 배터리로 작동하는 작은 로봇 안에 넣고 싶습니다.

문제는 무엇일까요? 이러한 지능형 비서들은 보통 거대하고 무거운 도서관처럼 설계되어 있습니다. 이들은 클라우드에 있는 거대하고 강력한 서버에서 실행되도록 고안되었습니다. 이들을 작은 로봇 안에 밀어 넣으려는 시도는 전체 크기의 도서관을 배낭에 넣으려는 것과 같습니다. 너무 무겁고, 너무 느리며, 로봇은 답변을 기다리는 동안 멈춰 서게 됩니다.

EdgeFM은 이러한 지능형 비서들을 작은 로봇에 실어 나르기 위해 특별히 설계된 새로운 경량 "배낭"입니다. 간단한 비유를 사용하여 작동 방식을 설명해 보겠습니다.

1. 문제: "불필요하게 부풀어 오른" 여행가방

작은 로봇에서 이러한 AI 모델을 실행하기 위한 기존 도구들은 불필요한 물건으로 가득 찬 여행가방과 같습니다. 가능한 모든 장치에 대한 호환성을 위한 추가 레이어를 포함하고 있어 무겁고 느립니다. 더 나쁘게도, 이러한 도구들 중 많은 부분이 특정 하드웨어 회사에서 만든 "오픈 소스"가 아닌 블랙박스입니다. A 회사에서 로봇을 구매하면 그들의 특정 도구를 사용하도록 강요받습니다. 그들이 새로운 AI 모델을 위해 소프트웨어를 업데이트하지 않으면, 당신은 기다릴 수밖에 없습니다. 마치 자신의 문을 열기 위해 특정 브랜드의 열쇠에만 갇혀 있는 것과 같습니다.

2. 해결책: "에이전트" 재봉사

EdgeFM 의 제작자들은 현대의 AI 코딩 에이전트 (코드를 작성하는 지능형 프로그램) 가 특정 작업을 수행하는 가장 효율적인 방법을 찾는 데 탁월하다는 점을 깨달았습니다.

  • 비유: 미리 만들어진 무거운 정장을 구매하는 대신, EdgeFM 은 "재봉사 에이전트"를 사용하여 로봇의 특정 하드웨어를 측정하고 해당 작업에 맞는 맞춤형 경량 정장을 재단합니다.
  • 작동 방식: 이 시스템은 컴퓨터가 수학 계산을 수행하는 데 필요한 작고 빠른 지시사항인 "커널"을 자동으로 생성합니다. 이러한 커널은 재사용 가능한 "기술" 라이브러리로 저장됩니다. 로봇이 생각해야 할 때, 하드웨어 회사가 이를 구축해 주기를 기다리는 대신 도구상자에서 올바른 기술을 선택하기만 하면 됩니다.

3. 설계: "단일 작업"에 초점

클라우드 서버는 한 번에 수천 개의 요청을 처리하도록 설계되었습니다 (고량). 하지만 에지 (Edge) 의 로봇은 보통 한 번에 하나의 작업만 수행합니다. "이 장애물을 보고 이동하라."

  • 비유: 클라우드 서버는 500 명을 위해 50 명의 요리사가 요리하는 바쁜 레스토랑 주방과 같습니다. EdgeFM 은 가능한 한 빠르게 하나의 완벽한 요리를 만드는 데 집중하는 푸드트럭의 단일하고 매우 효율적인 요리사와 같습니다.
  • 결과: 수천 명을 처리하는 데 필요한 모든 것을 제거함으로써 EdgeFM 은 그 단일 요청을 처리하는 데 놀라울 정도로 빨라집니다. 로봇이 초가 아닌 밀리초 단위로 반응하도록 "불필요한 무게"를 잘라냅니다.

4. "이중 단계" 전략

로봇이 질문 (예: "이 그림에는 무엇이 있나요?") 을 받으면 EdgeFM 은 사고 과정을 두 가지 뚜렷한 단계로 나눕니다.

  1. "프리필" (메뉴 읽기): 로봇은 문맥을 이해하기 위해 전체 질문을 한 번에 읽습니다.
  2. "디코드" (요리하기): 로봇은 단어별로 답변을 생성합니다.
  • 혁신: EdgeFM 은 이 두 단계가 약간 다른 "레시피" (최적화) 를 사용할 수 있도록 합니다. 메뉴를 읽기 위해서는 중장비 방법을 사용할 수 있고, 요리를 하기 위해서는 초고속 방법을 사용할 수 있어 로봇이 첫 번째 단어가 나타날 때까지 멈춰 서지 않도록 합니다.

5. "메모리" 트릭 (KV 캐시)

로봇은 종종 "문이 열려 있나요?"나 "멈추세요!"와 같이 비슷한 질문을 반복적으로 합니다.

  • 비유: 시험을 본다고 상상해 보세요. 시험의 첫 번째 절반이 항상 동일한 지시사항이라면, 매번 다시 읽을 필요가 없습니다. 그냥 기억해 두면 됩니다.
  • EdgeFM 의 방식: EdgeFM 은 이러한 일반적인 지시사항에 대한 "메모리"를 미리 계산하여 저장합니다. 로봇이 같은 시작으로 새로운 질문을 받으면, 읽기 부분을 건너뛰고 바로 답변으로 넘어갑니다. 이는 막대한 시간과 메모리를 절약합니다.

6. 결과: 더 빠르고 개방적

이 논문은 EdgeFM 을 세 가지 다른 유형의 하드웨어에서 테스트했습니다.

  • 일반 서버 (x86): 업계 표준 (NVIDIA 의 TensorRT) 보다 빨랐습니다.
  • 소형 엣지 칩 (NVIDIA Orin): 공식 도구보다 최대 1.49 배 빨랐습니다.
  • 국내 칩 (Horizon Journey): 일반적으로 독점 폐쇄형 도구가 필요한 칩에서 복잡한 "시각 - 언어 - 행동" 모델 (보고 움직이는 로봇) 을 성공적으로 실행했습니다. 이는 고급 AI 를 실행하기 위해 한 회사의 생태계에 종속될 필요가 없음을 입증하기 때문에 큰 의미가 있습니다.

요약하자면: EdgeFM 은 AI 에이전트를 사용하여 지능형 로봇을 실행하기 위한 맞춤형 경량 엔진을 구축하는 새로운 오픈 소스 툴킷입니다. 불필요한 무게를 제거하고 특정 하드웨어 브랜드에 종속되지 않도록 하며, 로봇이 훨씬 더 빠르게 생각하고 반응하도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →