← Nieuwste papers
💻 computer science

Benchmarking Edge Inference Strategies for Deep Learning Models in Industrial Machine Vision

Dit artikel presenteert een vergelijkende studie van vier inferentiekaders (PyTorch, ONNX Runtime, OpenVINO en TensorRT) over diverse industriële hardware en modelarchitecturen, waarbij wordt onthuld dat OpenVINO en TensorRT respectievelijk de beste CPU- en GPU-prestaties bieden, hoewel TensorRT voor transformer-gebaseerde modellen niet altijd beter presteert dan gewone PyTorch.

Oorspronkelijke auteurs: Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een bericht van een brein (een deep learning-model) zo snel mogelijk naar een robotarm (een industriële machine) wilt krijgen. In de wereld van industriële machinevisie is snelheid alles. Als de robot te traag is, mist hij een defect aan een auto-onderdeel of slaagt hij er niet in om druiven correct te sorteren. Meestal is het versturen van deze gegevens naar een enorme cloudserver te traag of te riskant, dus proberen ingenieurs het "brein" direct op de lokale computer van de robot (de "edge") te draaien.

Maar hier komt de twist: alleen omdat je het brein hebt, betekent dat niet dat je ook de juiste bezorgdienst hebt. Dit artikel fungeert als een enorme racebaan-test waarbij vier verschillende "bezorgwagens" (softwareframeworks) worden vergeleken om te zien welke het bericht het snelst bij de robot krijgt. De vier wagens zijn PyTorch (de standaard, betrouwbare baseline), ONNX Runtime (de flexibele alleskunner), OpenVINO (de specialist voor Intel-motoren) en TensorRT (de snelheidsduivel voor NVIDIA-motoren).

De onderzoekers hebben niet simpelweg geraden; ze hebben dezelfde drie soorten "breinen" op vier verschillende "chassis" (computers) gedraaid en ze tot op de milliseconde getimed. Dit is wat de race onthulde:

De CPU-race: Het draait om het merk motor

Wanneer de computers standaard Intel-processors gebruikten (de soort die in veel desktops wordt gevonden), waren de resultaten verrassend consistent. OpenVIO was de duidelijke winnaar en fungeerde als een turbocharger die specifiek voor die motor is ontworpen.

  • Op de Intel-desktops was OpenVINO de snelste voor elk geteste model.
  • Voor het YOLOv8-model (een snelle objectdetector), bespaarde OpenVINO een enorme hoeveelheid tijd. Op de snelste Intel-desktop (i9-9820X) voltooide het de taak in slechts 10,9 ms, terwijl de standaard PyTorch 28,7 ms nodig had. Dat is een enorme sprong!
  • ONNX Runtime kwam meestal als tweede uit de bus, en PyTorch was de langzaamste.

De race veranderde echter volledig toen ze overschakelden naar een Jetson AGX Orin (een kleine, krachtige computer die in robots wordt gebruikt en ARM-chips gebruikt, geen Intel). Plotseling verloor OpenVINO zijn magie.

  • Op deze ARM-gebaseerde machine won ONNX Runtime de gouden medaille.
  • Het verschil was schokkend voor het Grounding DINO-model (een complex model dat tekst en afbeeldingen begrijpt). Op de Jetson CPU duurde OpenVINO een verbijsterende 102.720 ms (meer dan 100 seconden!), terwijl ONNX Runtime in slechts 13.580 ms klaar was. Dat is meer dan zeven keer sneller! Dit suggereert dat het gebruik van de "verkeerde" bezorgwagen voor je specifieke motor een ramp kan zijn.

De GPU-race: De strijd tussen CNN en Transformer

Toen de onderzoekers overschakelden naar krachtige grafische kaarten (GPU's) van NVIDIA, werd het verhaal nog interessanter. Ze testten twee soorten "breinen":

  1. CNN's (zoals YOLOv8 en UNet): Dit zijn de klassieke, betrouwbare werkpaarden van computer vision.
  2. Transformers (Grounding DINO): Dit zijn de nieuwere, flitsendere modellen die taal kunnen begrijpen.

Voor de klassieke werkpaarden (YOLOv8 en UNet):
TensorRT was de onbetwiste kampioen. Het was alsoal een Formule 1-auto op een circuit.

  • Op de desktop-GPU's verpletterde TensorRT de concurrentie. Voor YOLOv8 op een RTX 2080 Ti voltooide TensorRT de taak in 2,100 ms, terwijl PyTorch 5,270 ms nodig had.
  • Zelfs op de kleine Jetson GPU was TensorRT de snelste, met een tijd van 10,57 ms voor YOLOv8 vergeleken met de 20,84 ms van PyTorch.
  • Het artikel suggereert dat voor dit specifieke type modellen, TensorRT de beste keuze is voor NVIDIA-hardware.

Voor het flitsende nieuwe model (Grounding DINO):
Hier gooit het artikel een verrassing in de wacht. De "snelheidsduivel" (TensorRT) won niet.

  • Op de desktop NVIDIA-GPU's was de standaard PyTorch eigenlijk de snelste, met de laagste inferentietijd in alle geteste gevallen.
  • TensorRT was eigenlijk langzamer dan PyTorch, en deed er tussen de 1,6 en 2,1 keer langer over om de klus te klaren.
  • Bijvoorbeeld, op de RTX 6000 duurde PyTorch 7,780 ms, terwijl TensorRT aanzienlijk langzamer was.
  • De enige uitzondering was de Jetson GPU, waar TensorRT de PyTorch net versloeg (1082,7 ms vs 1290,8 ms), maar het was nog steeds veel langzamer dan de desktop-resultaten.

De belangrijkste les

De belangrijkste les van dit artikel is dat er niet één enkele "beste" software is voor iedereen. Het artikel suggereert dat je keuze volledig afhangt van twee dingen: wat voor soort computer je hebt en wat voor soort model je draait.

  • Als je een Intel CPU hebt, gebruik dan OpenVINO.
  • Als je een ARM CPU hebt (zoals Jetson), gebruik dan ONNX Runtime.
  • Als je een NVIDIA GPU hebt en een klassiek model draait (zoals YOLO of UNet), gebruik dan TensorRT.
  • MAAR, als je een NVIDIA GPU hebt en een nieuwer tekstgebaseerd model draait (zoals Grounding DINO), suggereert het artikel dat je er misschien beter aan doet om vast te houden aan de standaard PyTorch op desktop-GPU's, omdat de fancy optimalisaties in TensorRT niet hielpen en de boel zelfs vertraagden.

De onderzoekers hebben deze tijden herhaaldelijk gemeten (1.000 runs per test!) om er zeker van te zijn. Ze hebben de resultaten niet alleen gesimuleerd; ze hebben ze op echte hardware gedraaid. Dus als je een industriële robot bouwt, pak dan niet zomaar de "snelste" software die je hoort over. Controleer eerst je motor en je type brein, anders eindig je met een robot die in slow motion beweegt!

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →