← Últimos artículos
🤖 AI

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

Este artículo presenta el benchmark Robusto-2 para evaluar y comparar el desempeño de conductores humanos de Lima y la ciudad de Nueva York frente a modelos de lenguaje-visión (VLM) en diversos escenarios de conducción a través de estas dos geografías desafiantes, revelando que, si bien las respuestas de humanos y VLM divergen según el tipo de pregunta, ninguno de los dos grupos muestra una variación significativa de desempeño atribuible a la ciudad específica debido a la naturaleza altamente fuera de distribución de los escenarios.

Autores originales: Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Pregunta: ¿Tienen los autos autónomos un "choque cultural"?

Imagina que estás enseñando a un robot a conducir. Lo entrenas en un pueblo tranquilo y ordenado. Luego, lo sueltas en una ciudad caótica y bulliciosa donde las reglas de tráfico son más como sugerencias que como leyes. ¿Entrará el robot en pánico? ¿Entenderá lo que está pasando?

Los autores de este artículo quisieron probar exactamente eso. Se preguntaron: Si mostramos a los "cerebros" de los autos autónomos (llamados VLMs) videos de dos ciudades muy diferentes y caóticas —Lima, Perú, y Nueva York, EE. UU.—, ¿reaccionarán de manera diferente a la de los conductores humanos? Y ¿reaccionarán los humanos de Lima de manera diferente a los de Nueva York?

El Experimento: Una prueba de manejo para humanos y robots

Piensa en este estudio como una enorme prueba de manejo multilingüe.

  1. Los Sujetos de Prueba:

    • 10 Humanos de Lima: Conductores reales que conocen las calles de Perú.
    • 10 Humanos de Nueva York: Conductores reales que conocen las calles de Nueva York.
    • 10 Modelos de IA: Diferentes "cerebros" de varias empresas tecnológicas (los VLMs).
    • Total: 30 "conductores" tomando la prueba.
  2. El Material de la Prueba:

    • No usaron metraje perfecto de un día soleado. Usaron videos de cámaras de tablero (dashcam) de Lima y Nueva York.
    • Seleccionaron específicamente los clips de 5 segundos más "desordenados": escenas donde la IA estaba más confundida o no se decidía. Estos son los "casos límite" (edge cases), como un taxi cortando el paso a alguien bajo la lluvia o un peatón cruzando imprudentemente.
  3. Las Preguntas de la Prueba:
    En lugar de solo observar, todos (humanos e IA) tuvieron que responder preguntas sobre el video, como un cuestionario. Las preguntas se dividieron en cuatro categorías:

    • Fácticas: "¿Qué está haciendo el auto?" (Observación simple).
    • Calificaciones: "En una escala del 1 al 10, ¿qué tan desordenado es este tráfico?" (Juicio subjetivo).
    • Contrafácticas: "¿Qué tendría que pasar para que ocurriera un choque?" (Imaginación).
    • Razonamiento: "¿Quién tiene la preferencia?" (Lógica y reglas).

Los Resultados Sorprendentes

Los investigadores esperaban que la IA se confundiera con la "ciudad extranjera" (por ejemplo, que una IA entrenada con datos de EE. UU. fallara en Lima). También esperaban que los conductores de Lima vieran las cosas de forma distinta a los de Nueva York. Esto es lo que realmente encontraron:

1. El Mito de la "Geografía"

  • La Expectativa: "Los conductores de Lima verán Lima de forma diferente a como los de Nueva York ven Lima".
  • La Realidad: No. Los humanos de Lima y los humanos de Nueva York dieron respuestas casi idénticas, independientemente de qué ciudad estuvieran viendo en el video.
  • La Analogía: Imagina mostrarle la foto de una tormenta a un pescador del Amazonas y a un pescador del Ártico. Aunque vivan en lugares diferentes, ambos coinciden: "Eso es una tormenta". El caos de conducir en Lima o Nueva York es tan universal que los cerebros humanos lo procesan de la misma manera.

2. La Brecha entre Humanos y Robots

  • La Expectativa: Tal vez la IA es tan buena como los humanos.
  • La Realidad: No. Los humanos y la IA dieron respuestas muy diferentes a menudo.
  • La Analogía: Si le preguntas a un humano y a un robot: "¿Está ese auto a punto de chocar?", el humano podría decir: "Sí, el conductor parece distraído", mientras que el robot podría decir: "No, la distancia es segura". Están viendo la misma escena pero "pensando" en lenguajes completamente distintos.

3. El "Tipo de Pregunta" Importa Más que el "Lugar"

  • La mayor diferencia en las respuestas no provino de dónde se filmó el video (Lima vs. Nueva York). Provino de qué tipo de pregunta se hizo.
  • Cuando se hicieron preguntas de hechos simples, todos estuvieron de acuerdo. Cuando se les pidió imaginar escenarios de "qué pasaría si", la IA y los humanos divergieron dramente.

La Conclusión "Caótica"

El artículo concluye con un giro. Usualmente, pensamos que los datos "Fuera de Distribución" (OOD) son algo extraño y único de un lugar. Pero los autores descubrieron que el caos es universal.

Ya sea una calle caótica en Lima o una calle caótica en Nueva York, la "desorganización" se ve igual tanto para los humanos como para la IA. La brecha no está entre las ciudades; la brecha está entre los cerebros biológicos (humanos) y los cerebros digitales (IA).

Por qué esto importa (según el artículo)

Los autores sugieren que, debido a que estas ciudades son tan caóticas y actualmente no operan autos autónomos allí, son en realidad "pruebas de estrés" perfectas.

  • La Analogía: Si quieres probar si el motor de un auto nuevo es resistente, no lo conduces por una autopista suave. Lo conduces sobre rocas. Lima y Nueva York son las "rocas" del mundo de la conducción.
  • Al probar la IA con estos datos desordenados, podemos ver exactamente dónde se rompe la "columna vertebral cognitiva" de la IA en comparación con un conductor humano.

En resumen: Los humanos de diferentes culturas ven el caos del tráfico de la misma manera. La IA, sin embargo, lo ve de forma distinta a los humanos, independientemente de dónde haya sido entrenada. El artículo proporciona un nuevo conjunto de datos para ayudar a los investigadores a cerrar esta brecha.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →