← Últimos artículos
💬 NLP

Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails

Este artículo audita los filtros de preentrenamiento y las salvaguardas en tiempo de inferencia en los modelos de lenguaje, revelando que borran desproporcionadamente las menciones de grupos marginados mediante la dependencia de claves léxicas simplistas mientras fallan en detectar el discurso de odio real o la información privada, creando así una forma de injusticia epistémica que contradice el juicio humano.

Autores originales: Marco Antonio Stranisci, A Pranav, Rossana Damiano, Christian Hardmeier, Anne Lauscher

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Marco Antonio Stranisci, A Pranav, Rossana Damiano, Christian Hardmeier, Anne Lauscher

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás construyendo una biblioteca masiva de libros para enseñarle a un robot superinteligente a hablar y a comprender el mundo. Este robot, llamado Modelo de Lenguaje Extenso (LLM), necesita leer miles de millones de frases de internet para aprender.

Sin embargo, antes de que el robot comience a leer, los humanos colocan filtros (como un bibliotecario estricto) para desechar "malos" libros. Luego, cuando el robot comienza a hablar con las personas, los humanos colocan guardarraíles (como un inspector de seguridad) para evitar que diga algo "inseguro".

Este artículo es una auditoría —una investigación profunda— sobre cómo lo están haciendo estos bibliotecarios e inspectores de seguridad. Los investigadores descubrieron que, si bien intentan mantener al robot seguro, accidentalmente están borrando las voces de grupos marginados (como personas transgénero, mujeres y personas de Centroamérica) y reemplazando el juicio humano con reglas rígidas y, a menudo, erróneas.

Aquí hay un desglose de sus hallazgos utilizando analogías simples:

1. La trampa de la "palabra prohibida"

Los investigadores descubrieron que muchos de estos sistemas de seguridad funcionan como una "lista de mal comportamiento" de un niño.

  • Cómo funciona: Si una frase contiene una palabra específica "mala" (como un insulto o un término sexual), el sistema la elimina inmediatamente, sin mirar el contexto.
  • El problema: Es como un bibliotecario que desecha un libro sobre un procedimiento médico solo porque menciona una parte del cuerpo, o que elimina una historia sobre los derechos de las trabajadoras sexuales porque usa la palabra "sexo".
  • El resultado: Los sistemas son muy buenos detectando palabras en su "lista de mal comportamiento", pero son terribles para detectar el daño real, como filtraciones de privacidad, robo de derechos de autor o discurso de odio real que no utiliza las palabras específicas prohibidas.

2. El filtro "sobreprotector"

El estudio descubrió que estos filtros son sobreprotectores contra grupos específicos, actuando como un portero que sospecha de todos los que llevan un tipo determinado de sombrero.

  • Personas transgénero: Las frases que mencionaban identidades transgénero fueron marcadas para su eliminación con mucha más frecuencia que las frases sobre personas cisgénero (no trans).
  • Mujeres: Las menciones de mujeres fueron marcadas significativamente más a menudo que las de hombres.
  • Centroamericanos: El contenido que mencionaba a personas de Centroamérica fue casi siempre marcado para su eliminación, mientras que el contenido sobre personas de Europa Occidental rara vez fue tocado.
  • La analogía: Imagina a un guardia de seguridad en un museo que deja entrar a todos excepto a las personas de un vecindario específico. El guardia no intenta ser malo; simplemente sigue una regla defectuosa que asume que las personas de ese vecindario son "riesgosas". Esto resulta en que el museo (la IA) nunca aprenda sobre la cultura de ese vecindario.

3. El Robot vs. El Humano

Los investigadores pidieron a voluntarios humanos que miraran las frases que los robots marcaron y decidieran: "¿Debería quedarse o irse?"

  • La estadística impactante: Los humanos dijeron "Que se quede" el 88.5% de las veces en las frases que los filtros de preentrenamiento querían eliminar, y el 91.3% de las veces en las frases que los guardarraíles querían bloquear.
  • La analogía: Es como un chef robot que prueba una sopa, decide que es "venenosa" porque contiene una hierba específica, y tira toda la olla. Un chef humano la prueba, se da cuenta de que es solo una sopa picante y dice: "No, esto es delicioso y seguro de comer".
  • El conflicto: Los sistemas automatizados están eliminando contenido que los humanos realmente encuentran valioso, educativo o inofensivo. Al eliminar estas frases, la IA está perdiendo la capacidad de comprender a estos grupos y sus experiencias.

4. El "Borrado Silencioso"

El artículo llama a esto "Borrado Epistémico".

  • Qué significa: "Epistémico" se relaciona con el conocimiento. "Borrado" significa eliminar algo.
  • La metáfora: Imagina un mapa del mundo donde la IA está dibujando los continentes. Debido a que los filtros siguen eliminando frases sobre personas transgénero o centroamericanas, el mapa de la IA termina con espacios en blanco donde esos grupos deberían estar. La IA literalmente no "sabe" que existen o cómo son sus vidas porque los datos fueron eliminados antes de que pudiera aprender.

Resumen de las afirmaciones del artículo

  • Los sistemas no están de acuerdo: Los diferentes filtros y guardarraíles a menudo discrepan entre sí. Algunos detectan cosas que otros pasan por alto, y dependen en gran medida de listas de palabras simples en lugar de comprender el contexto.
  • El sesgo es sistémico: Esto no es solo un error; es un patrón. Los sistemas de diferentes empresas y de diferentes continentes parecen marcar en exceso a los mismos grupos marginados.
  • El juicio humano es diferente: Los humanos generalmente ven estas frases como seguras o importantes, mientras que las máquinas las ven como peligrosas.
  • La consecuencia: Al confiar en estos sistemas automatizados, estamos moldeando activamente a la IA para que sea ciega a las realidades de las personas transgénero, las mujeres y las personas de regiones específicas, silenciándolas efectivamente en el mundo digital.

El artículo concluye que, para solucionar esto, no podemos confiar solo en "listas de mal comportamiento" automatizadas. Necesitamos involucrar a las personas afectadas en el proceso de toma de decisiones y crear sistemas que entiendan el contexto en lugar de solo contar palabras malas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →