← 최신 논문
💻 computer science

Benchmarking Edge Inference Strategies for Deep Learning Models in Industrial Machine Vision

이 논문은 다양한 산업용 하드웨어 및 모델 아키텍처에 걸쳐 네 가지 추론 프레임워크(PyTorch, ONNX Runtime, OpenVINO, TensorRT)를 비교 연구하여, OpenVINO와 TensorRT가 각각 CPU와 GPU에서 최상의 성능을 제공하지만 TensorRT가 트랜스포머 기반 모델의 경우 항상 일반 PyTorch보다 우수한 성능을 보이는 것은 아니라는 점을 밝히고 있습니다.

원저자: Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 뇌(딥러닝 모델)로부터 로봇 손(산업용 기계)에 메시지를 최대한 빨리 전달하려고 한다고 상상해 보세요. 산업용 머신 비전의 세계에서는 속도가 전부입니다. 로봇이 너무 느리면 자동차 부품의 결함을 놓치거나 포도를 제대로 분류하지 못하게 됩니다. 보통 이 데이터를 거대한 클라우드 서버로 보내는 것은 너무 느리거나 위험하기 때문에, 엔지니어들은 이 "뇌"를 로봇의 로컬 컴퓨터(엣지)에서 직접 실행하려고 노력합니다.

하지만 여기 반전이 있습니다. 뇌를 가졌다고 해서 반드시 적절한 배달 서비스까지 갖춘 것은 아니라는 점입니다. 이 논문은 네 가지 서로 다른 "배달 트럭"(소프트웨어 프레임워크)을 비교하여 어떤 것이 로봇에게 메시지를 가장 빠르게 전달하는지 확인하는 거대한 레이스 트랙 테스트와 같습니다. 네 가지 트럭은 PyTorch(표준적이고 신뢰할 수 있는 베이스라인), ONNX Runtime(유연한 올라운더), OpenVINO(Intel 엔진을 위한 전문가), 그리고 TensorRT(NVIDIA 엔진을 위한 스피드 데몬)입니다.

연구진은 단순히 추측한 것이 아니라, 동일한 세 가지 유형의 "뇌"를 네 가지 다른 "섀시"(컴퓨터)에서 실행하고 밀리초 단위로 시간을 측정했습니다. 이 경주가 밝혀낸 결과는 다음과 같습니다.

CPU 레이스: 엔진 브랜드가 핵심이다

표준 Intel 프로세서(많은 데스크톱에서 발견되는 종류)를 사용하는 컴퓨터의 경우, 결과는 놀라울 정도로 일관적이었습니다. OpenVINO가 그 엔진을 위해 특별히 설계된 터보차저처럼 작동하며 명백한 승자가 되었습니다.

  • Intel 데스크톱에서 OpenVINO는 테스트된 모든 모델에 대해 가장 빨랐습니다.
  • YOLOv8 모델(빠른 객체 탐지기)의 경우, OpenVINO는 엄청난 양의 시간을 단축했습니다. 가장 빠른 Intel 데스크톱(i9-9820X)에서 OpenVINO는 단 10.9 ms 만에 완료한 반면, 표준 PyTorch는 28.7 ms가 걸렸습니다. 이는 엄청난 도약입니다!
  • ONNX Runtime은 보통 2위를 차지했고, PyTorch가 가장 느렸습니다.

하지만 연구진이 (Intel이 아닌) ARM 칩을 사용하는 로봇용 강력한 소형 컴퓨터인 Jetson AGX Orin으로 교체하자 경기는 완전히 바뀌었습니다. 갑자기 OpenVINO의 마법이 사라졌습니다.

  • 이 ARM 기반 기기에서는 ONNX Runtime이 금메달을 차지했습니다.
  • Grounding DINO 모델(텍스트와 이미지를 이해하는 복잡한 모델)에서의 격차는 충격적이었습니다. Jetson CPU에서 OpenVIO는 무려 102,720 ms(100초 이상!)가 걸린 반면, ONNX Runtime은 단 13,580 ms 만에 완료했습니다! 이는 7배 이상 빠른 속도입니다. 이는 당신의 특정 엔진에 맞지 않는 "잘못된" 배달 트럭을 사용하는 것이 재앙이 될 수 있음을 시사합니다.

GPU 레이스: CNN vs. Transformer의 대결

연구진이 NVIDIA의 강력한 그래픽 카드(GPU)로 전환했을 때, 이야기는 더욱 흥게로워졌습니다. 그들은 두 가지 유형의 "뇌"를 테스트했습니다:

  1. CNNs(YOLOv8 및 UNet과 같은): 컴퓨터 비전의 고전적이고 신뢰할 수 있는 일꾼들입니다.
  2. Transformers(Grounding DINO와 같은): 언어를 이해할 수 있는 더 새롭고 화려한 모델들입니다.

고전적인 일꾼들을 위한 경우 (YOLOv8 및 UNet):
TensorRT가 독보적인 챔피언이었습니다. 마치 트랙 위에 포뮬러 1 자동차를 놓은 것과 같았습니다.

  • 데스크톱 GPU에서 TensorRT는 경쟁자들을 압도했습니다. RTX 2080 Ti에서 YOLOv8을 실행했을 때, TensorRT는 2.100 ms 만에 완료한 반면 PyTorch는 5.270 ms가 걸렸습니다.
  • 작은 Jetson GPU에서도 TensorRT가 가장 빨랐으며, PyTorch의 20.84 ms와 비교해 10.57 ms 만에 YOLOv8을 완료했습니다.
  • 이 논문은 이러한 특정 유형의 모델에 대해서는 NVIDIA 하드웨어에 TensorRT가 최선의 선택이라고 제안합니다.

화려한 신모델을 위한 경우 (Grounding DINO):
여기서 논문은 예상치 못한 결과를 던집니다. "스피드 데몬"(TensorRT)이 승리하지 못했습니다.

  • 데스크톱 NVIDIA GPU에서는 표준 PyTorch가 실제로 가장 빨랐으며, 테스트된 모든 경우에서 가장 낮은 추론 시간을 제공했습니다.
  • TensorRT는 오히려 PyTorch보다 느렸으며, 작업을 완료하는 데 1.6배에서 2.1배 더 긴 시간이 걸렸습니다.
  • 예를 들어, RTX 6000에서 PyTorch는 7.780 ms가 걸린 반면, TensorRT는 현저히 느렸습니다.
  • 유일한 예외는 Jetson GPU였는데, 여기서 TensorRT가 PyTorch를 약간 앞질렀지만(1082.7 ms vs 1290.8 ms), 여전히 데스크톱 결과보다는 훨씬 느렸습니다.

핵심 요점

이 논문의 주요 교훈은 모두를 위한 단 하나의 "최고" 소프트웨어는 없다는 것입니다. 논문은 당신의 선택이 전적으로 두 가지, 즉 어떤 종류의 컴퓨터를 가지고 있는지어떤 종류의 모델을 실행하고 있는지에 달려 있다고 제안합니다.

  • 만약 Intel CPU를 사용한다면, OpenVINO를 사용하세요.
  • 만약 ARM CPU(Jetson과 같은)를 사용한다면, ONNX Runtime을 사용하세요.
  • 만약 NVIDIA GPU를 가지고 있고 고전적인 모델(YOLO 또는 UNet 등)을 실행 중이라면, TensorRT를 사용하세요.
  • 하지만, 만약 NVIDIA GPU를 가지고 있고 새로운 텍스트 기반 모델(Grounding DINO와 같은)을 실행 중이라면, 이 논문은 데스크톱 GPU에서 표준 PyTorch를 그대로 사용하는 것이 더 나을 수 있다고 제안합니다. 왜냐하면 TensorRT의 화려한 최적화가 도움이 되지 않았고 오히려 속도를 늦췄기 때문입니다.

연구진은 결과를 확신하기 위해 이 시간들을 반복해서 측정했습니다(테스트당 1,000회 실행!). 그들은 단순히 결과를 시뮬레이션한 것이 아니라 실제 하드웨어에서 직접 실행했습니다. 그러므로 만약 당신이 산업용 로봇을 제작하고 있다면, 단순히 들리는 대로 "가장 빠른" 소프트웨어를 집어 들지 마세요. 당신의 엔진과 뇌의 유형을 먼저 확인하십시오. 그렇지 않으면 로봇이 슬로우 모션으로 움직이게 될 수도 있습니다!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →