← Últimos artículos
💬 NLP

White-Box Sensitivity Auditing with Steering Vectors

Este artículo propone un marco de auditoría de sensibilidad de caja blanca para modelos de lenguaje grandes que aprovecha la dirección de activación para manipular conceptos internos, revelando una dependencia sustancial de atributos protegidos en tareas de decisión de alto riesgo que las evaluaciones estándar de caja negra a menudo no logran detectar.

Autores originales: Hannah Cyberey, Yangfeng Ji, David Evans

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hannah Cyberey, Yangfeng Ji, David Evans

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un nuevo empleado y tienes un programa informático (un Modelo de Lenguaje Grande, o LLM) que te ayuda a decidir a quién contratar. Quieres asegurarte de que la computadora no esté discriminando secretamente a las personas basándose en su género o raza.

Actualmente, la mayoría de las personas verifican este sesgo utilizando un método de "Caja Negra". Esto es como enviarle a la computadora un currículum con un nombre como "Juan" y ver si lo rechaza, y luego enviar un currículum con el nombre "Juana" y ver si la acepta. Si los resultados son los mismos, asumes que la computadora es justa.

El Problema:
Los autores de este artículo argumentan que este método de "Caja Negra" es como intentar averiguar cómo funciona el motor de un coche mirando solo el velocímetro. Puedes ver si el coche va rápido o lento, pero no puedes ver si el motor está fallando o si una marcha específica está rota. La computadora podría estar ignorando el nombre "Juan" o "Juana" en el texto, pero aún podría estar "pensando" en el género o la raza de una manera oculta dentro de su cerebro (su código interno) que la prueba basada en texto no puede ver.

La Solución: Auditoría de Sensibilidad de "Caja Blanca"
Los autores proponen una nueva forma de verificar la computadora llamada auditoría de "Caja Blanca". En lugar de solo enviar diferentes currículums, llegan al interior del cerebro de la computadora y empujan suavemente sus pensamientos internos.

Así es como lo hacen, utilizando una analogía creativa:

La Analogía: El "Selector de Pensamientos"

Imagina que el cerebro de la computadora tiene un panel de control gigante con miles de perillas. Cada perilla controla un concepto específico, como "Género", "Raza" o "Riesgo Crediticio".

  1. Encontrar la Perilla (Vectores de Dirección): Primero, los investigadores averiguan exactamente qué perilla controla el concepto de "Género". A esto lo llaman Vector de Dirección. Es como encontrar el botón exacto que sube o baja el volumen de "Hombre/Mujer" dentro de la máquina.
  2. Girar la Perilla (Dirección de Activación): En lugar de cambiar el texto del currículum (como cambiar "Juan" por "Juana"), dejan el texto exactamente igual. En su lugar, giran físicamente la "Perilla de Género" dentro de la computadora.
    • La giran ligeramente hacia el lado "Femenino".
    • Luego la giran ligeramente hacia el lado "Masculino".
    • Hacen esto mientras la computadora examina el mismo currículum exacto.
  3. Medir la Reacción (Sensibilidad): Si la computadora es verdaderamente justa, girar la "Perilla de Género" no debería cambiar su decisión sobre el currículum. La decisión debería permanecer igual sin importar cómo giren esa perilla específica.
    • Si la decisión cambia: La computadora es "sensible" al género. Significa que la decisión dependía secretamente de esa perilla oculta, incluso si el texto no decía "género".
    • Si la decisión permanece igual: La computadora es "invariante" (no afectada) por el género. En realidad, es justa.

Lo Que Encontraron

Los investigadores probaron esto en cuatro situaciones graves: Juicios Judiciales (decidir si alguien es culpable), Puntuación Crediticia (decidir si alguien obtiene un préstamo), Admisiones Universitarias y Diagnóstico Médico.

  • La Mentira de la Caja Negra: En muchos casos, el método antiguo (cambiar nombres en el texto) dijo que las computadoras eran justas. Mostraron casi ninguna diferencia entre los grupos.
  • La Verdad de la Caja Blanca: Cuando los investigadores giraron las perillas internas, descubrieron que las computadoras eran en realidad muy sensibles al género y a la raza.
    • Ejemplo: En la prueba de Puntuación Crediticia, el método antiguo dijo que una computadora era justa. Pero cuando giraron la "Perilla de Género" interna, la computadora comenzó a rechazar perfiles "femeninos" mucho más a menudo que los "masculinos", incluso aunque el texto nunca cambió. El sesgo estaba oculto dentro de la máquina, no en las palabras.

Por Qué Esto Importa

El artículo afirma que la antigua forma de probar es como revisar una casa en busca de fugas mirando solo las paredes exteriores. Podrías pasar por alto una fuga que ocurre dentro de la tubería.

Su nuevo método es como abrir las paredes y revisar las tuberías directamente. Encontraron que:

  1. El Sesgo Oculto es Real: Las computadoras a menudo tienen sesgos ocultos que las pruebas basadas en texto pasan por completo.
  2. Más Confiable: Su método da resultados consistentes sin importar cómo configuren la prueba, mientras que el método antiguo daba respuestas confusas y contradictorias dependiendo de cómo se formularan las palabras.
  3. Preciso: Pueden ajustar solo la perilla de género sin cambiar accidentalmente los pensamientos de la computadora sobre el trabajo o la educación de la persona.

En resumen: Los autores construyeron una herramienta para asomarse al cerebro de la computadora y torcer sus perillas internas para ver si está secretamente sesgada. Descubrieron que muchas computadoras tienen sesgos de formas que no podíamos ver antes, demostrando que necesitamos mirar bajo el capó, no solo en el tablero, para asegurar que la IA sea justa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →