Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
Ultralytics YOLO26 introduce una familia unificada de modelos de visión en tiempo real de extremo a extremo que elimina la supresión de no máximo y la Pérdida Focal de Distribución mediante una arquitectura de doble cabeza y estrategias de entrenamiento avanzadas, logrando un rendimiento de precisión-latencia de vanguardia en múltiples tareas, incluyendo detección, segmentación, estimación de pose e inferencia de vocabulario abierto.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes a un guardia de seguridad superrápido cuyo trabajo es detectar objetos en una transmisión de video en tiempo real. Durante años, los mejores guardias (llamados modelos "YOLO") han sido excelentes, pero tenían algunos hábitos molestos: necesitaban un paso de "doble verificación" lento después de detectar algo, cargaban con mochilas pesadas de datos extra que los ralentizaban y a menudo perdían objetos diminutos y distantes porque sus reglas de entrenamiento eran demasiado estrictas.
El artículo presenta a YOLO26, una nueva generación de estos guardias de visión diseñados para ser más rápidos, ligeros y agudos que nunca. Así es como solucionaron los viejos problemas, explicados con analogías de la vida cotidiana:
1. La regla de "No hacer doble verificación" (Inferencia libre de NMS)
El viejo problema: Anteriormente, cuando un guardia detectaba un coche, podía verlo tres o cuatro veces en puntos ligeramente diferentes. Tenía que detenerse y realizar un proceso de "Supresión de No Máximos" (NMS), una doble verificación manual y lenta, para elegir solo la mejor suposición y descartar los duplicados. Esto tomaba tiempo.
La solución de YOLO26: YOLO26 utiliza un diseño de doble cabeza (dual-head). Piensa en esto como tener dos trabajadores especializados:
- Trabajador A (El Velocista): Este trabajador está entrenado para elegir exactamente una suposición perfecta para cada objeto de inmediato. Sin necesidad de doble verificación. Es como un francotirador que da en el blanco al primer intento.
- Trabajador B (El Maximizador): Este trabajador todavía observa todo y puede ser utilizado si necesitas la máxima precisión absoluta y no te importa el tiempo extra de la "doble verificación".
El resultado: Obtienes un sistema que es "extremo a extremo" (end-to-end), lo que significa que va directamente de ver la imagen a dar la respuesta sin detenerse por una segunda opinión.
2. Deshacerse de la mochila pesada (Eliminación de DFL)
El viejo problema: Los modelos recientes cargaban con una pesada mochila de "Pérdida Focal de Distribución" (DFL). Esta mochila intentaba predecir el tamaño de un objeto adivinando a partir de una lista de 16 posibilidades diferentes para cada uno de los bordes. Esto hacía que el modelo fuera pesado (más memoria) y lento, especialmente para los modelos pequeños. También tenía un límite de "tamaño máximo"; si un objeto era demasiado grande para la lista, el modelo se confundía.
La solución de YOLO26: Tiraron la mochila. En lugar de adivinar a partir de una lista, el modelo ahora simplemente mide directamente el tamaño, como si usara una regla en lugar de adivinar mediante un menú.
El resultado: El modelo es más ligero, más rápido y ahora puede medir con precisión objetos muy grandes sin alcanzar un "techo" de tamaño.
3. La red de seguridad para "Objetos Diminutos" (STAL)
El viejo problema: Las reglas de entrenamiento anteriores eran como un juego de "escondite" donde las reglas decían: "Solo puedes esconderte dentro de una caja que encaje en una cuadrícula específica". Si un objeto diminuto (como un pájaro distante) era más pequeño que los cuadros de la cuadrícula, el guardia simplemente no podía verlo. Recibía cero atención y era ignorado durante el entrenamiento.
**La solución de YOLO2: Introdujeron STAL (Asignación de Etiquetas Consciente de Objetos Pequeños). Imagina que al guardia se le entrega una lupa especial para cosas diminutas. Incluso si un objeto diminuto no encaja en la cuadrícula estándar, el sistema obliga al guardia a prestarle atención mediante el "estiramiento" temporal de la cuadrícula lo suficiente como para cubrirlo.
El resultado: El modelo ya no ignora los objetos más pequeños y difíciles de ver.
4. El "Entrenador Inteligente" (MuSGD y Pérdida Progresiva)
El viejo problema: Entrenar estos modelos solía ser como un maratón donde el entrenador gritaba las mismas instrucciones durante toda la carrera de 600 millas. Tomaba mucho tiempo llegar a ser bueno. Además, el entrenador trataba al trabajador "Velocista" y al trabajador "Maximizador" exactamente igual, a pesar de que tenían trabajos diferentes.
La solución de YOLO26:
- MuSGD (El Entrenador Inteligente): Reemplazaron el antiguo método de entrenamiento por un nuevo optimizador (MuSGD) que aprende más rápido, como un entrenador que sabe exactamente cómo marcar el ritmo del corredor para que termine en menos millas (menos épocas de entrenamiento).
- Pérdida Progresiva (El Currículo): Cambiaron el programa de entrenamiento. Al principio, se enfocan en el trabajador "Maximizador" para construir una base sólida. A medida que avanza el entrenamiento, cambian gradualmente el enfoque hacia el trabajador "Velocista", asegurando que el producto final esté perfectamente ajustado para la inferencia rápida y sin comprobaciones.
5. Habilidades Especializadas para Diferentes Trabajos
Que el guardia sea rápido detectando coches no significa que sea bueno en todo. YOLO26 añade herramientas especializadas para otras tareas:
- Recortar formas (Segmentación): Añadieron un sistema multiescala que ayuda al guardia a entender mejor el fondo, facilitando el trazado del contorno exacto de un objeto.
- Rastrear personas (Estimación de Pose): Añadieron una forma de adivinar qué tan "incierto" es el guardia sobre una articulación (como un codo). Si el codo está oculto, el modelo admite que no está seguro en lugar de adivinar erróneamente.
- Objetos rotados (OBB): Para cosas como barcos o aviones que no siempre están rectos hacia arriba y hacia abajo, arreglaron las matemáticas para que el modelo no se confunda cuando un objeto está inclinado.
6. La actualización de "Vocabulario Abierto" (YOLOE-26)
Finalmente, introdujeron YOLOE-26, que es como darle al guardia un traductor universal.
- Prompt de Texto: Puedes decirle al guardia: "Busca un hidrante de incendios rojo", y lo encontrará, incluso si nunca fue entrenado explícitamente en hidrantes de incendios.
- Prompt Visual: Puedes mostrarle al guardia la foto de un juguete específico, y él encontrará ese juguete en el video.
- Sin Prompt: También puede simplemente mirar alrededor y describir lo que ve por su cuenta.
La Conclusión
YOLO26 es una familia unificada de modelos que son más rápidos, más ligeros y más precisos que sus predecesores. Lo logran eliminando el equipaje innecesario, corrigiendo las reglas para detectar cosas diminutas y utilizando un entrenador de entrenamiento más inteligente. Ya sea que necesites la velocidad absoluta (la vía libre de NMS) o la máxima precisión posible (la vía con NMS), YOLO26 ofrece una versión que se sitúa en la cima de la tabla de "velocidad vs. precisión".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.