← Derniers articles
💻 computer science

Benchmarking Edge Inference Strategies for Deep Learning Models in Industrial Machine Vision

Cet article présente une étude comparative de quatre frameworks d'inférence (PyTorch, ONNX Runtime, OpenVINO et TensorRT) à travers divers matériels industriels et architectures de modèles, révélant qu'OpenVINO et TensorRT offrent respectivement les meilleures performances CPU et GPU, bien que TensorRT ne surpasse pas toujours le PyTorch classique pour les modèles basés sur les transformers.

Auteurs originaux : Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de transmettre un message d'un cerveau (un modèle de deep learning) à une main robotique (une machine industrielle) le plus rapidement possible. Dans le monde de la vision industrielle, la vitesse est primordiale. Si le robot est trop lent, il rate un défaut sur une pièce de voiture ou échoue à trier des raisins. Habituellement, envoyer ces données vers un énorme serveur dans le cloud est trop lent ou risqué, donc les ingénieurs essaient de faire tourner le « cerveau » directement sur l'ordinateur local du robot (l'« edge »).

Mais voici le rebondissement : posséder le cerveau ne signifie pas que vous avez le bon service de livraison. Ce document agit comme un immense test sur circuit de course, comparant quatre différents « camions de livraison » (frameworks logiciels) pour voir lequel transmet le message au robot le plus vite. Les quatre camions sont PyTorch (la base standard et fiable), ONNX Runtime (le polyvalent flexible), OpenVINO (le spécialiste pour les moteurs Intel) et TensorRT (le démon de la vitesse pour les moteurs NVIDIA).

Les chercheurs n'ont pas seulement deviné ; ils ont réellement fait rouler les trois types de « cerveaux » sur quatre différents « châssis » (ordinateurs) et les ont chronométrés à la milliseconde près. Voici ce que la course a révélé :

La course des CPU : Tout est question de marque de moteur

Lorsque les ordinateurs utilisaient des processeurs Intel standards (ceux que l'on trouve dans beaucoup d'ordinateurs de bureau), les résultats étaient étonnamment cohérents. OpenVINO était le grand vainqueur, agissant comme un turbocompresseur spécifiquement conçu pour ce moteur.

  • Sur les ordinateurs de bureau Intel, OpenVINO était le plus rapide pour chaque modèle testé.
  • Pour le modèle YOLOv8 (un détecteur d'objets rapide), OpenVINO a réduit une part massive du temps. Sur l'ordinateur de bureau Intel le plus rapide (i9-9820X), il a terminé en seulement 10,9 ms, alors que le PyTorch standard a pris 28,7 ms. C'est un bond énorme !
  • ONNX Runtime arrivait généralement en deuxième position, et PyTorch était le plus lent.

Cependant, la course a totalement changé lorsqu'ils sont passés à un Jetson AGX Orin (un petit ordinateur puissant utilisé dans les robots, qui utilise des puces ARM, et non Intel). Soudain, OpenVINO a perdu sa magie.

  • Sur cette machine à base d'ARM, ONNX Runtime a décroché la médaille d'or.
  • L'écart était choquant pour le modèle Grounding DINO (un modèle complexe qui comprend le texte et les images). Sur le CPU du Jetson, OpenVIO a pris un temps stupéfiant de 102 720 ms (plus de 100 secondes !), tandis qu'ONNX Runtime a terminé en seulement 13 580 ms. C'est plus de sept fois plus rapide ! Cela suggère que l'utilisation du « mauvais » camion de livraison pour votre moteur spécifique peut être un désastre.

La course des GPU : Le duel CNN contre Transformer

Lorsque les chercheurs sont passés aux cartes graphiques (GPU) puissantes de NVIDIA, l'histoire est devenue encore plus intéressante. Ils ont testé deux types de « cerveaux » :

  1. Les CNN (comme YOLOv8 et UNet) : Ce sont les chevaux de bataille classiques et fiables de la vision par ordinateur.
  2. Les Transformers (Grounding DINO) : Ce sont les modèles plus récents et plus sophistiqués qui peuvent comprendre le langage.

Pour les chevaux de bataille classiques (YOLOv8 et UNet) :
TensorRT était le champion incontesté. C'était comme avoir une voiture de Formule 1 sur une piste.

  • Sur les GPU de bureau, TensorRT a écrasé la concurrence. Pour YOLOv8 sur une RTX 2080 Ti, TensorRT a terminé en 2,100 ms, tandis que PyTorch a pris 5,270 ms.
  • Même sur le petit Jetson GPU, TensorRT était le plus rapide, terminant YOLOv8 en 10,57 ms contre 20,84 ms pour PyTorch.
  • Le document suggère que pour ces types de modèles spécifiques, TensorRT est le meilleur choix pour le matériel NVIDIA.

Pour le nouveau modèle sophistiqué (Grounding DINO) :
C'est ici que le document lance une courbe imprévue. Le « démon de la vitesse » (TensorRT) n'a pas gagné.

  • Sur les GPU NVIDIA de bureau, le PyTorch standard était en fait le plus rapide, offrant le temps d'inférence le plus bas dans tous les cas testés.
  • TensorRT était en fait plus lent que PyTorch, prenant entre 1,6 et 2,1 fois plus de temps pour terminer la tâche.
  • Par exemple, sur la RTX 6000, PyTorch a pris 7,780 ms, tandis que TensorRT était nettement plus lent.
  • La seule exception a été le GPU Jetson, où TensorRT a légèrement battu PyTorch (1082,7 ms contre 1290,8 ms), mais il était tout de même beaucoup plus lent que les résultats sur bureau.

La grande conclusion

La principale leçon de ce document est qu'il n'existe pas un seul « meilleur » logiciel pour tout le monde. Le document suggère que votre choix dépend entièrement de deux choses : quel type d'ordinateur vous avez et quel type de modèle vous exécutez.

  • Si vous avez un CPU Intel, utilisez OpenVINO.
  • Si vous avez un CPU ARM (comme le Jetson), utilisez ONNX Runtime.
  • Si vous avez un GPU NVIDIA et que vous exécutez un modèle classique (comme YOLO ou UNet), utilisez TensorRT.
  • MAIS, si vous avez un GPU NVIDIA et que vous exécutez un modèle textuel plus récent (comme Grounding DINO), le document suggère qu'il est peut-être préférable de rester sur le PyTorch standard sur les GPU de bureau, car les optimisations sophistiquées de TensorRT n'ont pas aidé et ont même ralenti les choses.

Les chercheurs ont mesuré ces temps de nombreuses fois (1 000 passages par test !) pour être sûrs. Ils n'ont pas seulement simulé les résultats ; ils les ont testés sur du matériel réel. Ainsi, si vous construisez un robot industriel, ne vous contentez pas de prendre le logiciel le plus « rapide » dont vous entendez parler. Vérifiez d'abord votre moteur et votre type de cerveau, sinon vous pourriez vous retrouver avec un robot qui bouge au ralenti !

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →