← Últimos artículos
💻 computer science

Benchmarking Edge Inference Strategies for Deep Learning Models in Industrial Machine Vision

Este artículo presenta un estudio comparativo de cuatro marcos de inferencia (PyTorch, ONNX Runtime, OpenVINO y TensorRT) a través de diversos hardware industriales y arquitecturas de modelos, revelando que OpenVINO y TensorRT ofrecen el mejor rendimiento de CPU y GPU respectivamente, aunque TensorRT no siempre supera a PyTorch puro para modelos basados en transformadores.

Autores originales: Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enviar un mensaje desde un cerebro (un modelo de aprendizaje profundo) a una mano robótica (una máquina industrial) lo más rápido posible. En el mundo de la visión artificial industrial, la velocidad lo es todo. Si el robot es demasiado lento, pierde un defecto en una pieza de coche o no logra clasificar correctamente las uvas. Normalmente, enviar estos datos a un servidor gigante en la nube es demasiado lento o arriesgado, por lo que los ingenieros intentan ejecutar el "cerebro" directamente en la computadora local del robot (el "edge" o extremo).

Pero aquí está el giro: tener el cerebro no significa que tengas el servicio de mensajería adecuado. Este artículo actúa como una enorme prueba en una pista de carreras, comparando cuatro "camiones de reparto" diferentes (marcos de software) para ver cuál lleva el mensaje al robot más rápido. Los cuatro camiones son PyTorch (el estándar, fiable y base), ONNX Runtime (el todoterreno flexible), OpenVINO (el especialista para motores Intel) y TensorRT (el demonio de la velocidad para motores NVIDIA).

Los investigadores no se limitaron a suponer; de hecho, ejecutaron los mismos tres tipos de "cerebros" en cuatro "chasis" diferentes (computadoras) y cronometraron los tiempos hasta el milisegundo. Esto es lo que reveló la carrera:

La carrera de las CPU: Todo depende de la marca del motor

Cuando las computadoras usaron procesadores Intel estándar (los que se encuentran en muchas computadoras de escritorio), los resultados fueron sorprendentemente consistentes. OpenVINO fue el claro ganador, actuando como un turbocompresor diseñado específicamente para ese motor.

  • En las computadoras de escritorio Intel, OpenVINO fue el más rápido para cada modelo probado.
  • Para el modelo YOLOv8 (un detector de objetos rápido), OpenVINO recortó una enorme parte del tiempo. En la computadora de escritorio Intel más rápida (i9-9820X), terminó en solo 10.9 ms, mientras que el PyTorch estándar tardó 28.7 ms. ¡Ese es un salto enorme!
  • ONNX Runtime usualmente quedó en segundo lugar, y PyTorch fue el más lento.

Sin embargo, la carrera cambió por completo cuando cambiaron a una Jetson AGX Orin (una computadora diminuta pero potente utilizada en robots, que utiliza chips ARM, no Intel). De repente, la magia de OpenVINO desapareció.

  • En esta máquina basada en ARM, ONNX Runtime se llevó la medalla de oro.
  • La brecha fue impactante para el modelo Grounding DINO (un modelo complejo que entiende texto e imágenes). En la CPU de la Jetson, OpenVINO tomó unos estupefactos 102,720 ms (¡más de 100 segundos!), mientras que ONNX Runtime terminó en solo 13,580 ms. ¡Eso es más de siete veces más rápido! Esto sugiere que usar el "camión de reparto equivocado" para tu motor específico puede ser un desastre.

La carrera de las GPU: El enfrentamiento entre CNN y Transformer

Cuando los investigadores cambiaron a potentes tarjetas gráficas (GPUs) de NVIDIA, la historia se puso aún más interesante. Probaron dos tipos de "cerebros":

  1. CNNs (como YOLOv8 y UNet): Estas son las clásicas y fiables máquinas de trabajo de la visión por computadora.
  2. Transformers (Grounding DINO): Estos son los modelos más nuevos y llamativos que pueden entender el lenguaje.

Para las máquinas de trabajo clásicas (YOLOv8 y UNet):
TensorRT fue el campeón indiscutible. Era como tener un coche de Fórmula 1 en la pista.

  • En las GPUs de escritorio, TensorRT aplastó a la competencia. Para YOLOv8 en una RTX 2080 Ti, TensorRT terminó en 2.100 ms, mientras que PyTorch tomó 5.270 ms.
  • Incluso en la pequeña GPU de la Jetson, TensorRT fue el más rápido, terminando YOLOv8 en 10.57 ms frente a los 20.84 ms de PyTorch.
  • El artículo sugiere que para estos tipos específicos de modelos, TensorRT es la mejor opción para el hardware de NVIDIA.

Para el nuevo modelo llamativo (Grounding DINO):
Aquí es donde el artículo lanza una curva inesperada. El "demonio de la velocidad" (TensorRT) no ganó.

  • En las GPUs NVIDIA de escritorio, el PyTorch estándar fue en realidad el más rápido, proporcionando el menor tiempo de inferencia en todos los casos probados.
  • TensorRT fue en realidad más lento que PyTorch, tardando entre 1.6 y 2.1 veces más en terminar el trabajo.
  • Por ejemplo, en la RTX 6000, PyTorch tomó 7.780 ms, mientras que TensorRT fue significativamente más lento.
  • La única excepción fue la GPU de la Jetson, donde TensorRT superó ligeramente a PyTorch (1082.7 ms frente a 1290.8 ms), pero seguía siendo mucho más lento que los resultados de escritorio.

La gran conclusión

La lección principal de este artículo es que no existe un único "mejor" software para todos. El artículo sugiere que tu elección depende enteramente de dos cosas: qué tipo de computadora tienes y qué tipo de modelo estás ejecutando.

  • Si tienes una CPU Intel, usa OpenVINO.
  • Si tienes una CPU ARM (como Jetson), usa ONNX Runtime.
  • Si tienes una GPU NVIDIA y estás ejecutando un modelo clásico (como YOLO o UNet), usa TensorRT.
  • PERO, si tienes una GPU NVIDIA y estás ejecutando un modelo más nuevo basado en texto (como Grounding DINO), el artículo sugiere que podrías estar mejor quedándote con el PyTorch estándar en GPUs de escritorio, porque las optimizaciones sofisticadas de TensorRT no ayudaron y de hecho ralentizaron las cosas.

Los investigadores midieron estos tiempos una y otra vez (¡1,000 ejecuciones por prueba!) para estar seguros. No solo simularon los resultados; los ejecutaron en hardware real. Así que, si estás construyendo un robot industrial, no elijas simplemente el software "más rápido" que escuches hablar. Revisa primero tu motor y tu tipo de cerebro, ¡o podrías terminar con un robot que se mueve en cámara lenta!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →