AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery
Este estudio demuestra que los Modelos de Visión y Lenguaje, particularmente cuando se mejoran con la técnica de cadena de pensamiento (Chain-of-Thought), pueden alcanzar aproximadamente un 70% de precisión en la predicción de tipologías de edificios a partir de imágenes de vistas de calle mediante el aprovechamiento del reconocimiento de patrones visuales, aunque difieren de los expertos humanos al depender menos de las claves contextuales más amplias y del conocimiento especializado.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando comprender una ciudad, pero en lugar de caminar por sus calles, la estás observando a través de una cámara gigante y de alta tecnología que lo ve todo desde el suelo hacia arriba. Este es el mundo del análisis urbano, un campo donde los científicos y planificadores intentan mapear cómo funcionan las ciudades, desde los materiales de los que están hechos los edificios hasta cuántos pisos tienen. Durante mucho tiempo, para obtener esta información, los expertos tenían que visitar cada edificio, tomar notas y adivinar para qué se usaba, un trabajo lento, costoso y agotador. Pero recientemente, un nuevo tipo de "cerebro" ha entrado en el juego: el Modelo de Visión y Lenguaje (VLM, por sus siglas en inglés). Piensa en un VLM como un robot superinteligente que ha leído casi todos los libros de internet y también ha aprendido a "ver" imágenes. Puede mirar la foto de una casa y decirte no solo cómo se ve, sino también de qué está hecha, cuántos pisos tiene y qué hace la gente dentro, todo combinando lo que ve con lo que sabe sobre el lenguaje. La gran pregunta que todos se hacen es: ¿Puede este robot hacer el trabajo tan bien como un experto humano, como un arquitecto o un ingeniero, especialmente en lugares donde los datos son difíciles de encontrar?
Este artículo lleva esa pregunta a las calles bulliciosas, caóticas y vibrantes de Yakarta del Norte, Indonesia, un lugar donde los edificios a menudo se construyen a mano, se amplían con el tiempo y no siempre siguen las reglas oficiales. Los investigadores querían ver si estos robots de IA podían mirar fotos de vistas de calle y adivinar correctamente la "tipología" (la palabra elegante para el tipo y uso) de miles de edificios. Establecieron una competencia amistosa entre tres de los modelos de IA más famosos —GPT-4o, Claude 3.5 Sonnet y Gemini 2.0 Flash— y un equipo de expertos humanos. Los humanos, que son ingenieros civiles y arquitectos, actuaron como el "estándar de oro", proporcionando las respuestas correctas basadas en sus años de formación. Los modelos de IA recibieron un conjunto especial de instrucciones, o "prompts", para ver si pedirles que "piensen paso a paso" (una técnica llamada Cadena de Pensamiento o Chain-of-Thought) les ayudaría a obtener mejores calificaciones.
Los resultados fueron una mezcla de altas impresionantes y algunos errores divertidos y muy humanos. Los modelos de IA resultaron ser bastante buenos adivinando lo básico. En cuanto a contar cuántos pisos tenía un edificio, los robots y los humanos coincidieron entre el 70% y el 80% de las veces. Es como si la IA fuera muy buena contando las ventanas para adivinar la altura. Sin embargo, cuando se trataba de adivinar para qué se usaba el edificio (como una tienda, una casa o una fábrica), el acuerdo descendió a alrededor del 60-70%. La IA a veces se confundía porque una casa y una pequeña tienda pueden parecerse mucho desde la calle. El estudio encontró que el método de "Cadena de Pensamiento", donde la IA se ve obligada a explicar su razonamiento antes de dar una respuesta, hizo que los modelos fueran más estables y fiables, de la misma manera que un estudiante rinde mejor en un examen cuando muestra sus procedimientos.
Uno de los descubrimientos más interesantes fue cómo pensaban la IA y los humanos de manera diferente. La IA era como un detective que solo confía en lo que puede ver con sus ojos: se centraba fuertemente en cosas físicas como "paredes", "ventanas", "materiales" y "altura". Los expertos humanos, por el contrario, eran como lugareños experimentados que conocían el vecindario. Miraban las mismas fotos pero también consideraban la "vibra" de la zona, el estado del edificio y el contexto del barrio. Por ejemplo, si un edificio se veía un poco desgastado pero estaba en una zona de mercado concurrida, un humano podría adivinar que es una tienda, mientras que la IA podría simplemente ver "ladrillos viejos" y adivinar que es un almacén. El artículo sugiere que, aunque la IA aún no es perfecta, puede hacer aproximadamente el 70% del trabajo que hacen los humanos, y puede hacerlo a una escala masiva, mirando 30,000 edificios en una fracción del tiempo.
Los investigadores concluyen que estas herramientas de IA no están listas para reemplazar por completo a los expertos humanos, especialmente para trabajos complicados como adivinar el uso de edificios en vecindarios informales y desordenados. Sin embargo, son socios poderosos. Pueden actuar como un "primer pase", clasificando rápidamente miles de imágenes para dar a los planificadores una idea de cómo es su ciudad, lo cual es de gran ayuda en lugares donde los datos son escasos o están desactualizados. El estudio demuestra que, al combinar la capacidad de la IA para detectar patrones visuales con la experiencia humana para comprender el contexto, podemos construir una imagen mucho más clara de nuestras ciudades. No se trata de que el robot gane; se trata de que el robot y el humano trabajen juntos para resolver el rompecabezas del mundo urbano.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.