Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers
Este artículo revela que los modelos de visión y lenguaje preentrenados de forma contrastiva contienen un subespacio sustancial e invariante de ruido multimodal compartido que puede eliminarse de forma segura sin perjudicar el rendimiento en tareas posteriores, ofreciendo así nuevas perspectivas mecanísticas sobre su estructura representacional latente.
Imagina que tienes un asistente robótico superinteligente (como CLIP) que ha sido entrenado para comprender tanto imágenes como palabras. Le pides: "Muéstrame una foto de un perro", y lo encuentra al instante. Parece perfecto. Pero este artículo argumenta que este robot en realidad lleva consigo una mochila pesada e inútil llena de chatarra que no necesita para hacer su trabajo.
Aquí está el desglose de lo que descubrieron los investigadores, usando analogías simples:
1. La "Estática" en la Señal
Piensa en el cerebro del robot como un gigantesco receptor de radio con 768 canales diferentes (dimensiones) escuchando al mundo.
Los Canales Buenos: La mayoría de estos canales están sintonizados a la "señal"—el significado real de la imagen o la palabra (como "perro", "iglesia" o "feliz").
Los Canales Malos: Los investigadores descubrieron que aproximadamente 164 de estos canales solo están transmitiendo "estática". Esto no es ruido aleatorio; es un tipo específico y compartido de estática que aparece en cada imagen y en cada palabra que el robot ve, independientemente del contenido.
2. El Patrón "Fantasma"
La parte más sorprendente es que esta "estática" es idéntica entre diferentes grupos.
La Analogía: Imagina que tomas una foto de un Husky siberiano y una foto de un edificio de iglesia. No tienen nada en común. Sin embargo, si miras la parte de "chatarra" de la memoria del robot para ambas imágenes, la chatarra se ve casi exactamente igual (91% de superposición).
El Hallazgo: El robot tiene un patrón "fantasma" que se imprime sobre todo lo que ve. Es como si una impresora tuviera una mancha en el lente; cada documento que imprime, ya sea una receta o una carta de amor, tendría esa misma mancha en la esquina. Los investigadores descubrieron que esta mancha es tan consistente que pueden mapearla perfectamente.
3. El Experimento del "Cajón de Chatarra"
Los investigadores decidieron probar qué sucede si simplemente tiran a la basura este "cajón de chatarra" (las 164 dimensiones de ruido).
El Resultado: Tomaron el robot, eliminaron esos 164 canales y le pidieron que realizara sus tareas habituales (como identificar animales en fotos o emparejar palabras con imágenes).
La Sorpresa: El robot no empeoró. De hecho, mejoró ligeramente al emparejar palabras con imágenes. Fue como quitarle a un corredor una mochila llena de piedras; no se ralentizaron, sino que corrieron más rápido porque no estaban cargados.
4. ¿Por Qué Sucede Esto?
El artículo sugiere que este "ruido" no es un error en el código, sino un efecto secundario de cómo se construyó el robot.
La Analogía: Imagina una fábrica que construye coches. Los ingenieros diseñaron la línea de montaje tan eficientemente que los coches son excelentes, pero la vibración de la maquinaria imprime accidentalmente un pequeño y inútil arañazo en cada puerta de coche. El arañazo no impide que el coche circule, pero está ahí en cada uno de ellos.
Los investigadores descubrieron que este "arañazo" (el ruido) es una parte fundamental de la arquitectura, no solo un error con un conjunto de datos específico.
Resumen
El artículo afirma que los modelos de IA modernos como CLIP llevan consigo una cantidad masiva de "ruido compartido" (aproximadamente 164 dimensiones en algunas versiones) que no tiene nada que ver con el significado real de las imágenes o el texto.
La Buena Noticia: Puedes eliminar este ruido sin perjudicar el rendimiento de la IA.
La Gran Imagen: Un gran trozo del "espacio cerebral" de la IA en realidad solo está almacenando este patrón repetitivo y carente de significado, en lugar de conocimiento útil. Al limpiarlo, la IA se vuelve ligeramente más eficiente y precisa.
Resumen Técnico: "Tu CLIP tiene 164 dimensiones de ruido"
Enunciado del Problema Los Modelos Visuales-Lingüísticos (VLM) preentrenados de forma contrastiva, como CLIP y SigLIP, se despliegan ampliamente como extractores de características para tareas que van desde la clasificación zero-shot hasta la recuperación multimodal. Sin embargo, estos espacios latentes compartidos exhiben anomalías estructurales, actuando como repositorios de ruido no semántico y multimodal. Aunque investigaciones previas han identificado fenómenos como el "efecto cono", la "brecha de modalidad" y el "colapso dimensional" en modelos unimodales, existe la necesidad de comprender cómo estos modelos codifican datos irrelevantes dentro de sus espacios latentes de alta dimensión. Los autores postulan que una parte significativa de la geometría latente en los VLM modernos está gobernada por un ruido compartido a nivel de arquitectura, en lugar de por semánticas relevantes para la tarea.
Metodología Los autores emplean la descomposición espectral de matrices de covarianza para analizar la geometría de los espacios latentes de los VLM.
Estimación de Covarianza: Calculan matrices de covarianza empíricas (Σtext y Σimg) para las incrustaciones de texto e imagen por separado, derivadas de conjuntos de datos a gran escala (ImageNet-1K y LAION-2B). Se define una matriz de covarianza multimodal promedio (Σavg) para analizar el espacio latente conjunto.
Descomposición Espectral: Las matrices se descomponen para identificar valores y vectores propios. Los autores observan una caída constante y pronunciada en los valores propios a través de diversos modelos (variantes de CLIP y SigLIP) más allá de un umbral específico (aproximadamente 10−3.6).
Umbralización del Ruido: Utilizando el "método del codo" en Σavg, identifican un umbral de corte para separar la "señal" (los valores propios superiores) del "ruido" (la parte inferior masiva de los valores propios). Las dimensiones que caen por debajo de este umbral se identifican como el "subespacio de ruido compartido".
Alineación de Subespacios: Para verificar la universalidad de estas dimensiones de ruido, los autores calculan el Coseno Medio Cuadrático de los Ángulos de Subespacio (mSCSA) entre los vectores de ruido extraídos globalmente y los vectores propios de baja varianza de subconjuntos de datos específicos (por ejemplo, clases individuales de ImageNet).
Poda y Evaluación: Construyen una matriz de proyección de eliminación de ruido (P=I−VVT) para proyectar las incrustaciones sobre el complemento ortogonal del subespacio de ruido. Evalúan el impacto de esta poda en tareas posteriores: clasificación zero-shot en ImageNet y alineación imagen-texto en LAION-2B.
Resultados Clave
Existencia de Ruido Compartido: El análisis revela un "subespacio de ruido" distinto que comprende la parte inferior masiva de los valores propios de la covarianza. Para CLIP ViT-L/14, esto corresponde a 164 dimensiones (el 21% del espacio de 768 dimensiones).
Invarianza de Subgrupos: Las dimensiones de ruido identificadas muestran una fuerte invarianza a través de subconjuntos de datos distintos. Las puntuaciones mSCSA entre el subespacio de ruido global y los subespacios de baja varianza específicos de clase son altas (a menudo >90% para modelos más grandes), lo que indica que estas direcciones de ruido son ubicuas y no específicas de ninguna clase o subconjunto de datos individual.
Impacto de la Poda:
Clasificación: Eliminar las dimensiones de ruido resulta en una caída insignificante en la precisión Top-5 zero-shot de ImageNet (por ejemplo, CLIP ViT-L/14 desciende del 91.2% al 91.1%). Eliminar aleatoriamente el mismo número de dimensiones produce un rendimiento significativamente peor, confirmando que las dimensiones de ruido portan poca información semántica.
Alineación: Contrario a la hipótesis de que la poda podría perjudicar la alineación, los autores observan un aumento sistemático en la similitud del coseno promedio para pares imagen-texto en LAION-2B después de la eliminación del ruido. Esta mejora escala con el tamaño de la dimensión latente.
Inspección Cualitativa: La inspección visual de muestras con alta activación en el subespacio de ruido revela que a menudo corresponden a marcadores de posición de imágenes no disponibles o artefactos fuera de la distribución (por ejemplo, temas de películas de Marvel cuando se estiman solo sobre ImageNet), lo que respalda aún más la naturaleza no semántica de estas dimensiones.
Significado y Afirmaciones El artículo afirma proporcionar nuevas perspectivas mecanicistas sobre la estructura representacional de los VLM modernos. Al descomponer formalmente el espacio latente en señales semánticas multimodales y un subespacio de ruido compartido, los autores demuestran que:
Una fracción sustancial de la geometría latente en modelos preentrenados de forma contrastiva está gobernada por un ruido compartido a nivel de arquitectura, en lugar de por semánticas relevantes para la tarea.
Podar estas dimensiones de ruido compartido es "principalmente inofensivo" y puede mejorar activamente el rendimiento de alineación posterior sin degradar las capacidades de clasificación.
El fenómeno del colapso dimensional persiste en los VLM modernos, pero se manifiesta como un repositorio para datos irrelevantes en lugar de un colapso total del espacio.
Los autores mantienen una postura modesta, reconociendo que el umbral de ruido óptimo puede depender de arquitecturas de modelo específicas y distribuciones de datos. Señalan que, aunque la caída del espectro de valores propios es pronunciada, no es tan instantánea como la transición de fase observada en estudios previos de modelos unimodales, lo que sugiere un mecanismo subyacente complejo para la asignación de capacidad latente. Se propone trabajo futuro para expandir esta evaluación a un espectro más amplio de arquitecturas base y establecer un marco teórico formal que vincule este mecanismo de ruido con la aparición de la brecha de modalidad.