← Últimos artículos
⚡ electrical engineering

An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers

Este artículo presenta un proceso de visión computacional de dos etapas y de código abierto que combina RT-DETR y Vision Transformers para clasificar con precisión seis tipos de carrocería de vehículos de grano fino relevantes para la seguridad de los ciclistas, contando con un mecanismo de abstención basado en la confianza que mantiene una alta robustez en diferentes sitios de grabación al tiempo que evita clasificaciones erróneas silenciosas.

Autores originales: Gandhimathi Padmanaban, Fred Feng

Publicado 2026-06-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Gandhimathi Padmanaban, Fred Feng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando clasificar una pila enorme de correspondencia. Algunas cartas están claramente marcadas como "Periódico", otras como "Revista" y otras como "Correo no deseado". Pero también tienes miles de sobres que podrían ser cualquier cosa: una tarjeta de cumpleaños, una factura, un folleto o una carta de un abogado. Si simplemente adivinas, podrías cometer errores.

Este documento describe un nuevo "clasificador robótico" de código abierto diseñado para observar grabaciones de video de las calles y clasificar los vehículos en categorías muy específicas, no solo en las categorías generales que vemos habitualmente.

Así es como funciona el sistema, desglosado en pasos sencillos:

1. El Problema: Por qué necesitamos un mejor clasificador

Actualmente, la mayoría de las cámaras de tráfico y estudios de seguridad solo saben distinguir entre un "automóvil", un "camión" o un "autobús". Pero para la seguridad de los ciclistas, esto no es suficiente.

  • La Analogía: Imagina que un ciclista es atropellado. Si un sedán pequeño lo golpea, es malo. Pero si un SUV alto o un enorme camión comercial lo golpea, la lesión suele ser mucho peor porque la parte delantera del vehículo está más alta y golpea al ciclista de forma distinta.
  • La Brecha: Necesitamos saber exactamente qué tipo de vehículo pasa junto a un ciclista (por ejemplo, ¿es una Minivan o una Van Grande? ¿Es una Pickup o un Camión Comercial?). Las herramientas existentes no pueden distinguir estos tipos específicos en videos reales y desordenados.

2. La Solución: Un equipo de "Detectives" de dos etapas

Los autores construyeron un sistema de dos pasos, como un equipo de dos detectives trabajando juntos.

Detective #1: El Explorador Rápido (RT-DETR)

  • Trabajo: Este detective escanea el video rápidamente. No necesita saber el modelo exacto del coche; solo necesita decir: "¡Oye, hay un vehículo ahí!" y dibujar un cuadro alrededor de él.
  • Especialidad: Es muy bueno detectando cualquier cosa que parezca un coche, camión, autobús o motocicleta. Utiliza un cerebro preentrenado, por lo que no necesitó aprender a detectar coches desde cero.
  • Filtro: Si ve un autobús o una motocicleta, se detiene ahí. Si ve un "coche" o un "camión", le pasa el trabajo al Detective #2.

Detective #2: El Clasificador Experto (Vision Transformer)

  • Trabajo: Este detective toma el "recorte" específico (la imagen dentro del cuadro) del Detective #1 y lo observa muy de cerca.
  • Especialidad: Es el experto en detalles finos. Clasifica el vehículo en una de seis categorías específicas:
    1. Automóvil de pasajeros
    2. SUV
    3. Camioneta (Pickup)
    4. Minivan
    5. Van Grande
    6. Camión Comercial
  • El botón de "No lo sé": Esta es la parte más importante. Si la imagen es borrosa, el ángulo es extraño o el vehículo está parcialmente oculto, este detective podría sentirse inseguro. En lugar de adivinar y potencialmente cometer un error, tiene una regla: "Si no estoy un 60% seguro, diré 'Desconocido'".
    • Por qué esto importa: En la investigación de seguridad, es mejor decir "no lo sé" que decir con confianza "eso es una camioneta pickup" cuando en realidad es una minivan. Esto evita los "erroos silenciosos".

3. El Entrenamiento: Cómo le enseñaron al robot

Enseñar a un robot a distinguir entre una "Van Grande" y un "Camión Comercial" es difícil porque hay muy pocas fotos de esos camiones específicos en los conjuntos de datos estándar.

  • La Mezcla: Los investigadores construyeron una biblioteca de entrenamiento personalizada mezclando tres elementos:
    1. Fotos de Estudio: Fotos de alta calidad de coches de un conjunto de datos famoso (Stanford Cars).
    2. Extracción Web (Web Scraping): Recopilaron imágenes de vans y camiones de internet.
    3. Recortes de calles reales: Tomaron clips de video reales de Ann Arbor, Michigan, y recortaron los vehículos para mostrarle al robot cómo son las condiciones reales y desordenadas de la calle (borrosas, de lado, parcialmente ocultas).
  • El Desequilibrio: El robot vio muchas más imágenes de coches normales y SUVs que de camiones grandes. Para solucionar esto, se ajustó el proceso de entrenamiento para que prestara especial atención a las imágenes raras de camiones, de modo que el robot no las ignorara.

4. Los Resultados: ¿Qué tan bien funcionó?

El equipo probó este robot en dos conjuntos diferentes de video.

Prueba 1: El "Campo Local" (In-Distribution)

  • La Configuración: Lo probaron con video de la misma calle donde tomaron los clips de entrenamiento (Ann Arbor).
  • La Puntuación: Obtuvo un 94% de acierto.
  • Los Detalles: Fue increíble detectando SUVs (97% de precisión). También fue muy bueno con los automóviles de pasajeros y las camionetas pickup. La única vez que tuvo dificultades fue cuando el vehículo era difícil de ver, y utilizó correctamente su botón de "no lo sé" en lugar de adivinar erróneamente.

Prueba 2: El "Partido de Visitante" (Out-of-Distribution)

  • La Configuración: Lo probaron con un video de una ubicación completamente diferente, tomado por una bicicleta de investigación especial con cámaras y una iluminación distintas. No reentrenaron al robot para este nuevo lugar.
  • La Puntuación: Obtuvo un 89% de acierto.
  • Los Detalles: Este es un resultado muy sólido para un sistema que no fue reentrenado para un lugar nuevo.
    • Los SUVs y las Pickups mantuvieron una gran precisión.
    • Las Minivans se volvieron un poco más complicadas. La precisión bajó, pero principalmente porque el robot se volvió más cauteloso. Empezó a decir "Desconocido" con más frecuencia (el 25% de las veces) porque las minivans se veían diferentes en el nuevo video. No empezó a adivinar locamente; simplemente admitió su incertidumbre.

5. Por qué esto es importante

  • Es de Código Abierto: Los autores han publicado todo el código, el cerebro entrenado del robot y los datos de forma gratuita. Cualquiera puede descargarlo y usarlo para analizar sus propios videos de calles.
  • La Seguridad es lo Primero: Al distinguir entre un coche pequeño y un camión grande, los planificadores urbanos y los investigadores de seguridad pueden finalmente entender exactamente qué tipos de vehículos ponen en riesgo a los ciclistas.
  • Sin Trabajo Manual: Antes de esto, los humanos tenían que ver horas de video para contar estos vehículos. Ahora, esta herramienta puede hacerlo automáticamente.

En resumen, el documento presenta una herramienta inteligente y gratuita que actúa como un filtro de dos etapas. Primero, encuentra los coches. Segundo, los clasifica cuidadosamente en tipos específicos. Si no está seguro, lo admite, asegurando que los datos de seguridad no se vean corrompidos por malas conjeturas. Funciona bien incluso en calles nuevas sin necesidad de ser reentrenado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →