← Últimos artículos
💬 NLP

GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models

El artículo presenta GGSS, una intervención en el tiempo de inferencia que preserva la norma y que dirige los tokens visuales a lo largo de arcos geodésicos en una hiperesfera unitaria para reducir eficazmente el sesgo demográfico en los modelos generativos de visión y lenguaje, manteniendo al mismo tiempo sus capacidades fundamentales de visión y lenguaje.

Autores originales: Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh

Publicado 2026-08-27
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los sistemas de inteligencia artificial que pueden ver y hablar se están convirtiendo en asistentes comunes en nuestra vida diaria, ayudando a clasificar currículums, responder preguntas e interpretar imágenes médicas. Estos sistemas, conocidos como modelos de visión y lenguaje, aprenden estudiando millones de imágenes y las descripciones de texto que las acompañan. Sin embargo, debido a que aprenden de datos creados por humanos, a menudo absorben los mismos estereotipos injustos que nosotros tenemos sobre la raza, el género y la ocupación. Una computadora podría mirar la foto de una persona y, basándose únicamente en su raza o género percibidos, adivinar un salario o un título de trabajo diferente al que tendría para otra persona, incluso si los detalles visuales son idénticos. Este es un problema grave para la tecnología utilizada en decisiones de alto riesgo, pero solucionarlo es difícil. Tradicionalmente, para eliminar estos sesgos, los desarrolladores tenían que reentrenar todo el enorme modelo computacional desde cero, un proceso que requiere una potencia de cálculo y un tiempo inmensos. Además, muchos de los métodos existentes diseñados para corregir el sesgo fueron creados para tipos más antiguos de IA que procesan una imagen como un resumen único, en lugar de los sistemas modernos que descomponen una imagen en miles de piezas diminutas para entenderla.

Un equipo de investigadores ha desarrollado ahora una nueva forma de corregir estos sesgos sin reentrenar el modelo. Llaman a su método GGSS, que significa Dirección Esférica con Compuerta Geodésica (Geodesic-Gated Spherical Steering). En lugar de reconstruir la IA, insertan un ajuste pequeño y ligero que funciona mientras el modelo está pensando. Imagine la comprensión interna de una imagen por parte de la IA como una colección de direcciones que apuntan a diferentes conceptos. Cuando la IA ve un rostro, algunas de estas direcciones apuntan hacia la identidad de la persona, mientras que otras apuntan hacia su trabajo o trasfondo. Los investigadores descubrieron que el sesgo de la IA hacia la raza o el género se concentra en un conjunto específico de estas direcciones, mientras que el resto de la información permanece neutral. Su objetivo era alejar suavemente las direcciones sesgadas del estereotipo sin alterar la información útil sobre la apariencia real de la persona o el contexto de la imagen.

Los investigadores probaron su método en cuatro modelos diferentes de visión y lenguaje modernos. Primero, mostraron a los modelos una serie de imágenes cuidadosamente controladas donde solo cambiaba la raza o el género percibidos de la persona, mientras que todo lo demás, como la ropa, la postura y el fondo, permanecía exactamente igual. Al observar cómo cambiaban las señales internas del modelo cuando solo cambiaba la raza o el género, mapearon la "ruta de sesgo" específica que toma el modelo. Luego, crearon un proceso de dos pasos para solucionar esto durante el uso normal. El primer paso consiste en identificar qué partes específicas de la imagen activan el sesgo. No todas las partes de una imagen son igualmente sesgadas; por ejemplo, un rostro puede portar una señal fuerte de raza, mientras que el fondo o los zapatos de la persona casi no la portan. El nuevo método utiliza un filtro inteligente para centrar sus correcciones solo en las partes de la imagen que realmente portan el sesgo, dejando las partes neutrales solas.

El segundo paso es cómo ocurre la corrección. Los métodos más antiguos intentaban simplemente restar el sesgo, como borrar una línea en un dibujo. Los investigadores descubrieron que esta resta "dura" a menudo distorsionaba el significado de la imagen, haciendo que la IA perdiera su capacidad de entender la fotografía correctamente. En su lugar, utilizaron una técnica que mueve la información a lo largo de una ruta curva, similar a cómo un avión vuela la ruta más corta entre dos ciudades siguiendo la curva de la Tierra en lugar de una línea recta a través del suelo. Esto permite que la IA rote su comprensión lejos del estereotipo mientras mantiene la forma general y la fuerza de su percepción intactas. Al combinar este movimiento curvo con el filtro inteligente que apunta a las partes sesgadas, el sistema puede reducir la injusticia sin romper la inteligencia general del modelo.

Los resultados de sus pruebas fueron claros y significativos. Cuando aplicaron este método a los cuatro modelos de IA diferentes, redujeron el sesgo en las respuestas de los modelos por un margen amplio. En algunos casos, la brecha injusta en cómo los modelos juzgaban los salarios u ocupaciones cayó en más de un 90 por ciento. Crucialmente, los modelos no perdieron su capacidad para realizar otras tareas. Los investigadores verificaron el conocimiento general y las habilidades de razonamiento de los modelos utilizando una prueba estándar de 1,500 preguntas que cubren ciencia, matemáticas y lógica. Los modelos que recibieron la corrección de sesgo funcionaron tan bien como los modelos originales sin corregir, con su precisión cambiando en menos de un punto porcentual. Esto demostró que es posible hacer que estos sistemas sean más justos sin hacerlos más tontos.

El estudio también mostró que este enfoque es más confiable que otros intentos previos. Cuando intentaron usar métodos más antiguos y simples que no utilizaban la ruta curva o el filtro inteligente, los modelos a menudo se confundían o fallaban al responder preguntas. Los investigadores encontraron que la ruta curva era especialmente importante para los modelos más grandes y complejos, donde las correcciones simples causaban que el sistema fallara por completo. También demostraron que el método es flexible; al ajustar la fuerza con la que se aplica la corrección, los usuarios pueden elegir reducir el sesgo significativamente permitiendo al mismo tiempo que el modelo reconozca detalles demográficos si una tarea específica lo requiere, como en la documentación médica.

Este trabajo ofrece una herramienta práctica para hacer que la inteligencia artificial sea más equitativa. Muestra que no necesitamos desechar y reconstruir nuestros sistemas de IA más avanzados para solucionar sus prejuicios. En su lugar, un ajuste dirigido y cuidadoso realizado mientras el sistema está en funcionamiento puede eliminar los estereotipos injustos preservando la capacidad del modelo para ver y entender el mundo. Los investigadores han puesto su código a disposición para que otros puedan probar y utilizar este enfoque, proporcionando un nuevo camino hacia el despliegue de sistemas de IA que sean tanto potentes como justos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →