← Últimos artículos
💬 NLP

Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence Intervals

A través de tres experimentos factoriales que involucraron 4.320 llamadas a API a través de cuatro modelos de lenguaje de gran tamaño, este estudio demuestra que el prestigio institucional y el lugar de publicación ejercen efectos discriminatorios significativamente más fuertes en las evaluaciones de candidatos que la etnia del nombre del solicitante o el origen geográfico, con un "efecto de rescate" que muestra que las publicaciones de alto impacto pueden compensar desproporcionadamente el bajo prestigio institucional.

Autores originales: Maikel Leyva-Vazquez, Florentin Smarandache

Publicado 2026-08-20
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Maikel Leyva-Vazquez, Florentin Smarandache

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo moderno, la inteligencia artificial se ha convertido silenciosamente en un guardián. A estos programas informáticos, conocidos como modelos de lenguaje extensos, se les pide cada vez más que tomen decisiones que moldean las vidas humanas. Ayudan a decidir quién obtiene un trabajo, quién recibe una subvención de investigación y quién califica para un préstamo. Lo hacen leyendo solicitudes y asignando puntuaciones, actuando como jueces automatizados. Durante años, los científicos se han preocupado de que estos jueces digitales puedan portar los mismos prejuicios que los humanos que los construyeron. Sabemos que pueden ser sesgados contra las personas basándose en sus nombres, su género o su raza. Pero ha surgido una pregunta más nueva y sutil: ¿favorecen estos modelos también a los candidatos simplemente por el lugar donde estudiaron? No se trata de la calidad del trabajo que una persona ha realizado, sino de la reputación de la institución en su currículum. Si un programa informático otorga una puntuación más alta a un científico de una universidad famosa que a un científico igualmente cualificado de una menos famosa, no está siendo neutral; está reforzando las jerarquías existentes.

Un equipo de investigadores se propuso probar este tipo específico de sesgo utilizando cuatro modelos diferentes de inteligencia artificial. Querían saber si los modelos estaban reaccionando a la prestancia de una universidad o simplemente al país donde se encontraba esa universidad. Para encontrar la respuesta, crearon miles de solicitudes de empleo y de subvenciones falsas. Mantuvieron las habilidades y la experiencia del candidato exactamente iguales en cada uno de los escenarios. Lo único que cambiaron fue el nombre de la universidad a la que asistió el candidato y, en algunos casos, el nombre de la revista donde el candidato había publicado su trabajo. Probaron con candidatos de universidades estadounidenses de primer nivel, de instituciones respetadas en Chile y Colombia, y de una universidad en Ecuador que no aparece en las clasificaciones mundiales. También variaron los nombres en las solicitudes para incluir orígenes anglosajones, latinos y árabes para ver si los modelos seguían aferrados a los viejos estereotipos.

Los resultados fueron claros y estadísticamente robustos. Los modelos de inteligencia artificial otorgaron consistentemente puntuaciones más altas a los candidatos de universidades prestigiosas. Esta brecha no fue una pequeña fluctuación; fue una tendencia constante y mensurable. A través de los diferentes modelos y campos profesionales, un candidato de una universidad de alto rango recibió una puntuación casi tres décimas de punto superior a la de un candidato de una universidad no clasificada. En el mundo de la calificación automatizada, esta diferencia es significativa. Sin embargo, cuando los investigadores observaron los nombres en las solicitudes, la historia cambió. Los modelos no mostraron una preferencia estadísticamente significativa por candidatos con nombres anglosajones sobre aquellos con nombres latinos o árabes. Las puntuaciones para estos diferentes grupos de nombres fueron tan cercanas que la diferencia pudo atribuirse al azar. Esto sugiere que, si bien los modelos han sido entrenados con éxito para ignorar los nombres étnicos, no han sido entrenados para ignorar el estatus de la escuela en un currículum.

Para entender si este sesgo provenía de la reputación de la escuela o del país en el que se encontraba, los investigadores realizaron un segundo conjunto de experimentos. Compararon una universidad altamente clasificada en México con una universidad de bajo rango, no clasificada, en los Estados Unidos. Si los modelos fueran simplemente sesgados contra las naciones en desarrollo, deberían haber preferido la escuela estadounidense. En cambio, los modelos tendieron a favorecer a la universidad mexicana, aunque fuera menos famosa que las principales escuelas estadounidenses pero más famosa que la pequeña escuela estadounidense. Esto demostró que los modelos estaban reaccionando a la prestancia de la institución misma, no solo a la geografía. El sesgo era sobre la marca de la universidad, no sobre el pasaporte del solicitante.

El descubrimiento más sorprendente surgió cuando los investigadores introdujeron una tercera variable: la revista donde el candidato había publicado su investigación. Compararon a candidatos que habían publicado en la revista científica más famosa del mundo frente a aquellos que habían publicado en una revista más pequeña y de acceso abierto. La diferencia en las puntuaciones fue masiva. La prestancia de la revista importaba mucho más que la prestancia de la universidad. Un candidato de una universidad menos famosa que había publicado en la revista principal recibió una puntuación mucho más alta que un candidato de una universidad de primer nivel que había publicado en la revista más pequeña. De hecho, el impulso de una revista famosa fue casi seis veces más fuerte que el impulso de una universidad famosa. Esto creó un "efecto de rescate", donde publicar en una revista de primer nivel compensó completamente la falta de prestigio institucional. Los modelos parecían considerar una publicación de alto nivel como una señal de calidad tan fuerte que anulaba el sesgo contra la escuela.

Los investigadores también observaron qué tan consistentes eran los modelos en su calificación. Encontraron que, al evaluar a candidatos de instituciones menos famosas, los modelos eran más inconsistentes. Una vez, el modelo podía dar una puntuación baja a un candidato de una universidad más pequeña, y la siguiente vez, podía dar una puntuación ligeramente más alta para el mismo perfil exacto. Esta inconsistencia no ocurría con tanta frecuencia con los candidatos de las universidades de primer nivel. Esto sugiere que los modelos tienen menos certeza sobre cómo juzgar a las personas de las instituciones que conocen menos, lo que conduce a una doble desventaja: puntuaciones promedio más bajas y evaluaciones más impredecibles.

En última instancia, este estudio revela que, si bien la inteligencia artificial ha progresado en evitar algunas formas de discriminación, ha heredado un sesgo profundamente arraigado hacia el estatus. Los modelos actúan como amplificadores de las jerarquías sociales existentes, recompensando lo familiar y lo prestigioso mientras penalizan lo desconocido. No parecen importarles tanto el país de origen como les importa el nombre de la marca de la escuela. Sin embargo, el estudio también ofrece un camino a seguir. Muestra que el trabajo de alta calidad, cuando se publica en los lugares adecuados, puede romper estas barreras. Para los investigadores de instituciones menos famosas, el camino hacia una evaluación justa por parte de estos jueces digitales no reside en cambiar sus nombres o sus países, sino en el peso innegable de su trabajo publicado. Las máquinas están aprendiendo a valorar el trabajo, pero solo cuando este se presenta en el escenario más prestigioso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →