Using street view images and visual LLMs to predict heritage values for governance support: Risks, ethics, and policy implications
Este artículo evalúa el uso de modelos de lenguaje extensos multimodales para analizar imágenes de vistas de calle con el fin de identificar valores patrimoniales en el parque de edificios de Suecia para apoyar los Planes Nacionales de Renovación de Edificios, al tiempo que aborda críticamente los riesgos asociados, las preocupaciones éticas y las implicaciones políticas con respecto a la transparencia, la detección de errores y la sicofancia en la gobernanza.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando renovar las casas de toda una ciudad para ahorrar energía, pero tienes un enorme punto ciego: no sabes qué casas son edificios "patrimoniales" especiales que requieren un cuidado adicional. En Suecia, no existe una lista completa de estas casas especiales. Es como intentar hacer la maleta para un viaje sin saber qué artículos son antigüedades frágiles y cuáles son solo camisetas viejas.
Este documento describe un proyecto en el que las autoridades suecas intentaron resolver este problema utilizando un nuevo tipo de "ojo digital" llamado Modelo de Lenguaje Extenso Multimodal (LLM). Así es como lo hicieron, lo que descubrieron y las advertencias que hallaron en el camino.
El detective digital
En lugar de enviar expertos humanos a recorrer cada calle de Suecia (lo que llevaría una eternidad y costaría una fortuna), los investigadores utilizaron una IA entrenada para "ver" y "leer". Alimentaron a la IA con más de 150.000 fotos de fachadas de edificios tomadas de Google Street View.
Imagina a la IA como un estudiante de arte muy rápido y muy culto. Los investigadores le dieron una lista de verificación específica (basada en cómo los expertos humanos juzgan los edificios) y le preguntaron: "Mira esta foto. ¿Parece este edificio que tiene valor histórico o cultural? Califícalo del 1 al 100".
No le enseñaron reglas nuevas a la IA; simplemente le pidieron que usara su conocimiento existente para hacer una suposición "zero-shot" (sin entrenamiento previo específico). Es como pedirle a un amigo culto que juzgue una pintura sin mostrarle primero un libro de texto.
Los resultados: Un buen comienzo, pero no es perfecto
La IA logró escanear una gran área del parque de edificios (unos 5 millones de metros cuadrados de superficie de construcción) y señaló aproximadamente el 1-2% de los edificios como "potencialmente patrimoniales".
- La buena noticia: La IA fue sorprendentemente buena detectando los edificios "viejos y elegantes" obvios. Si un edificio tenía ornamentos clásicos o parecía muy antiguo, la IA le daba una puntuación alta.
- La mala noticia: La IA fue un poco "conservadora". Tendió a ignorar edificios modestos y cotidianos que aún podrían ser importantes para una comunidad local. También pareció tener un sesgo: le encantaban los edificios en zonas ricas y en Estocolmo (la capital) más que los edificios en zonas más pobres o pueblos pequeños.
El problema del "sifofante" (el adulador)
Uno de los hallazgos más interesantes del documento es sobre la personalidad de la IA. Los investigadores llaman a esto "sifofancia" (sycophancy).
Imagina a un "siempre te doy la razón" que siempre está de acuerdo contigo y habla con mucha confianza, incluso cuando está equivocado. Los LLM están entrenados para ser educados y bien hablados. Si les haces una pregunta, te darán una respuesta muy segura y detallada, incluso si están alucinando (inventando cosas).
El documento advierte que, si las autoridades confían ciegamente en el texto seguro de la IA, podrían ser engañadas. Para solucionar esto, los investigadores obligaron a la IA a generar números (como una puntuación de 50 u 80) en lugar de largos párrafos de texto. Esto facilitó que los expertos humanos verificaran las matemáticas y detectaran errores, en lugar de dejarse impresionar por el discurso fluido de la IA.
La red de seguridad humana
El documento enfatiza que esta herramienta de IA no es un reemplazo para los expertos humanos. Es más bien como una máquina de clasificación de alta velocidad.
- El proceso: La IA clasifica millones de fotos y señala las que podrían ser especiales.
- El papel humano: Los expertos en patrimonio humano revisan los edificios señalados para tomar la decisión final.
Los investigadores probaron esto haciendo que los expertos revisaran una muestra aleatoria de las mejores elecciones de la IA. Los expertos coincidieron en que la IA había encontrado con éxito edificios que sí tenían características patrimoniales. Sin embargo, también señalaron que la IA pasó por alto muchos otros edificios que los humanos habrían considerado valiosos.
Las grandes advertencias
El documento termina con algunas "señales de precaución" cruciales para cualquiera que utilice esta tecnología:
- El sesgo es real: La IA aprendió de datos creados por humanos, y los humanos tienen sesgos. La IA tendía a pensar que los edificios en vecindarios ricos eran más "dignos de patrimonio" que los de vecindarios más pobres. Si se usa a ciegas, esto podría conducir a políticas injustas.
- El contexto importa: El valor de un edificio no se trata solo de cómo se ve desde la calle. Se trata de su historia, de quién vive allí y de lo que significa para la comunidad. La IA solo puede ver la "piel" del edificio (la fachada), no el "alma" (la historia).
- No confíes en el "adulador": Debido a que la IA es tan segura de sí misma, los humanos deben tener especial cuidado de no dejar que ella tome la decisión final. Es una herramienta para ayudar, no una herramienta para decidir.
La conclusión
Este proyecto demostró que la IA puede ser un "asistente" poderoso para los gobiernos, ayudándoles a escanear rápidamente un país para encontrar edificios que podrían necesitar protección. Sin embargo, no es una varita mágica. Funciona mejor cuando se utiliza como un primer paso para reducir una lista enorme, dejando las decisiones finales y matizadas a los expertos humanos que comprenden la historia y la cultura local.
En resumen: Usa la IA para encontrar las agujas en el pajar, pero deja que el experto humano decida cuáles de esas agujas son realmente preciosas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.