Ethology of Latent Spaces
Este estudio emplea una perspectiva etológica para demostrar que los espacios latentes en los modelos de visión y lenguaje no son neutros, sino que exhiben «regímenes escópicos algorítmicos» distintos, impulsados por los datos de entrenamiento, que generan interpretaciones políticas y culturales divergentes y a menudo contradictorias del arte, lo que requiere una reevaluación crítica de cómo se utilizan estos modelos en la historia del arte digital.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes tres críticos de arte diferentes. Todos están observando la misma colección de 301 pinturas y esculturas, que abarcan desde el siglo XV hasta la década de 1900. Podrías esperar que coincidan en lo que ven. Pero en este estudio, los "críticos" no son humanos; son tres modelos de IA diferentes (OpenAI CLIP, OpenCLIP/LAION y SigLIP).
El artículo argumenta que estos modelos de IA no son lienzos en blanco y neutrales. En cambio, cada uno ha desarrollado su propia "personalidad" única y su propia forma de ver el mundo, moldeada enteramente por los datos específicos con los que fue alimentado y por la forma en que fue construido. El autor llama a esto una "etología de los espacios latentes" —básicamente, estudiar el "comportamiento" de estos cerebros de IA tal como un biólogo estudia el comportamiento de los animales en la naturaleza—.
Aquí tienes un desglose de los puntos principales del artículo utilizando analogías sencillas:
1. La analogía de las "Gafas Invisibles"
Piensa en estos modelos de IA como si llevaran puestas unas gafas invisibles.
- Las matemáticas: Dentro de la computadora, la IA ve las imágenes como una nube de números (vectores) en un espacio gigante y multidimensional.
- El significado: Cuando le preguntamos a la IA: "¿Es esta imagen política?", no "piensa" sobre la política. En su lugar, mira su nube de números y observa qué números "políticos" están más cerca de la imagen.
- El giro: El artículo muestra que las "gafas" que lleva cada modelo son diferentes. Un modelo puede ver una foto en blanco y negro como "oscura y lúgubre", mientras que otro la ve como "de alto contraste y dramática", simplemente debido a cómo fueron entrenados.
2. Tres "Personalidades" Diferentes
El estudio compara tres modelos específicos y encuentra que actúan como tres personas muy distintas:
- OpenAI CLIP (El Curador de Museo): Este modelo fue entrenado con un conjunto de datos privado y cuidadosamente seleccionado. Actúa como un historiador del arte tradicional. Tiende a ver la "política" solo en movimientos artísticos institucionales y famosos (como el cubismo o el dadaísmo). Si le muestras una máscara africana, la ve como "arte" o "cultura", pero no necesariamente como algo "político".
- OpenCLIP/LAION (El Navegador de Internet): Este modelo fue entrenado con un vertido masivo y desordenado de datos extraídos de todo internet. Actúa como un usuario de internet caótico. Ve la "política" en todas partes, pero a menudo de una manera aleatoria y ruidosa. Podría etiquetar una pintura como "colonial" solo porque la palabra "colonial" aparecía en el pie de foto de una imagen similar en la web, incluso si la pintura en sí no trata sobre el colonialismo.
- SigLIP (El Teórico Crítico): Este modelo utiliza una arquitectura técnica diferente. Actúa como un crítico agudo y moderno. Ve la "política" en casi todo. Por ejemplo, etiqueta las máscaras africanas como altamente "políticas" (el 59% de las veces), mientras que los otros modelos dicen que son apolíticas. Parece haber aprendido que el arte no occidental está inherentemente ligado a la lucha política, mientras que el arte occidental es "neutral".
3. La confusión del "Letrero de Neón"
El artículo ofrece un gran ejemplo de cómo estas IA se confunden con la diferencia entre un objeto físico y una palabra.
- La prueba: Los investigadores pidieron a los modelos que clasificaran las imágenes por "brillo".
- El resultado: OpenAI CLIP clasificó el arte de neón de Joseph Kosuth (que a menudo se fotografía contra un fondo negro) como una de las cosas más brillantes de la colección.
- ¿Por qué? La IA no "vio" los píxeles. Vio la palabra "neón" en los datos de entrenamiento y asoció la palabra "neón" con el concepto de "luz brillante". Confundió la etiqueta con la realidad.
- SigLIP, sin embargo, realmente miró los píxeles e identificó correctamente que las fotos oscuras eran oscuras.
4. "Sesgo Emergente" vs. "Sesgo Estadístico"
Normalmente, cuando hablamos de sesgo en la IA, pensamos en un "sesgo estadístico" (por ejemplo, "el conjunto de datos no tenía suficientes fotos de mujeres").
- La nueva idea del artículo: Este estudio introduce el "Sesgo Emergente". Este es un sesgo que aparece de la nada, como una reacción química. No está en los datos brutos directamente; emerge de la compleja forma en que la IA conecta los puntos entre palabras e imágenes.
- La analogía: Imagina una receta. Si dejas fuera la sal, el plato queda insípido (sesgo estadístico). Pero si mezclas harina, azúcar y levadura de una manera específica, obtienes pan que sube (propiedad emergente). Las opiniones "políticas" de la IA son como el pan que sube: no se pusieron en el cuenco, pero subieron debido a la forma en que se mezclaron los ingredientes (los datos).
5. Los "Tres Escopos" (Cómo Miran)
El autor utiliza una metáfora de la historia del arte para describir cómo estos modelos "miran" al mundo:
- La mirada entrópica (LAION): Una mirada caótica y ruidosa que recoge todo lo que dice internet, reforzando a menudo los estereotipos encontrados en las búsquedas web.
- La mirada institucional (OpenAI): Una mirada controlada, de tipo museo, que refuerza las reglas establecidas de la historia del arte occidental.
- La mirada semiótica (SigLIP): Una mirada teórica que intenta encontrar significados críticos profundos en todo, a veces forzando interpretaciones políticas donde los humanos podrían simplemente ver una forma.
La Conclusión
El artículo concluye que la IA no es una herramienta neutral para la historia del arte.
Si utilizas una IA para analizar el arte, no estás obteniendo simplemente la "opinión de una computadora". Estás obteniendo la "personalidad" específica y oculta de los datos de entrenamiento de ese modelo.
- Si usas el Modelo A, podrías ver el arte como "neutral y estético".
- Si usas el Modelo B, podrías ver la misma obra de arte como "profundamente política y colonial".
El autor advierte que no podemos simplemente "delegar" la interpretación del arte a la IA sin entender que la IA tiene sus propias reglas e sesgos invisibles que no podemos ver a menos que comparemos diferentes modelos entre sí. La "verdad" de lo que la IA ve depende enteramente de qué "gafas" lleva puestas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.