← Últimos artículos
💻 computer science

Benchmarking Open-Weight Foundation Models for Global AI Technical Governance

Este estudio aborda las limitaciones metodológicas en la investigación existente sobre el sesgo geográfico en la IA mediante la evaluación comparativa de cuatro modelos fundacionales de pesos abiertos frente a un conjunto de datos de verdad de terreno verificado (GAID v2), utilizando un esquema refinado de clasificación de respuestas de cinco categorías para medir y analizar con precisión las disparidades en el rendimiento de los modelos a través de 227 países.

Autores originales: Jason Hung

Publicado 2026-06-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jason Hung

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a cuatro bibliotecarios muy inteligentes y cultos (los modelos de IA). Les haces un millón de preguntas sobre cómo les va a diferentes países con la Inteligencia Artificial (IA). Quieres saber si están diciendo la verdad o si solo están inventando cosas para sonar seguros de sí mismos.

Este documento es una boleta de calificaciones para esos bibliotecarios, verificando específicamente si tienen un sesgo contra ciertos países o si simplemente se confunden con tipos específicos de datos.

Aquí está la historia de lo que encontraron, desglosada de forma sencilla:

1. La configuración: La "Verdad" vs. El "Supuesto"

Los investigadores tenían una "Clave de Respuestas" gigante y verificada (llamada Global AI Dataset) que contenía números reales sobre 227 países. Les pidieron a los cuatro modelos de IA que les dieran números específicos de esta clave.

  • El Objetivo: Ver si las IA aciertan los números.
  • El Problema: A veces, cuando una IA no sabe una respuesta, no dice "no lo sé". En su lugar, inventa un número con total confianza. Esto se llama Alucinación (o en el documento, "Fabricación Confiada").

2. La Gran Sorpresa: El "Sur Global" no fue el más perjudicado

Normalmente, la gente piensa que los modelos de IA tienen sesgos porque han sido entrenados principalmente con datos de países ricos y de habla inglesa (como EE. UU. y el Reino Unido). La creencia común es que las IA inventarían más mentiras sobre los países pobres (el "Sur Global") porque saben menos sobre ellos.

¡Pero los resultados fueron lo contrario!

  • ¡Las IA en realidad inventaron más mentiras sobre los países ricos (el Norte Global) que sobre los pobres!
  • ¿Por qué? Piénsalo de esta manera: Si le preguntas a un bibliotecario: "¿Cuántos granos de arena hay en esta pequeña playa?" y él adivina "500", podría estar cerca. Pero si le preguntas: "¿Cuántos granos de arena hay en este enorme desierto?" y él adivina "500", estará totalmente equivocado.
  • Los países ricos tienen números enormes (millones de patentes, miles de millones de dólares en capacidad de cómputo). Es mucho más difícil para una IA adivinar un número enorme correctamente que un número pequeño. Por eso, las IA fueron "atrapadas" inventando números grandes para los países ricos con más frecuencia.
  • Nota: Esto no significa que las IA lo sepan todo sobre los países pobres; simplemente significa que la "Clave de Respuestas" para los países ricos tenía números más grandes y difíciles de adivinar.

3. La Trampa de la "Seguridad": Las IA son pésimas en matemáticas

Los investigadores le preguntaron a las IA sobre números específicos y difíciles como: "¿Cuánta potencia de cómputo se utilizó para entrenar este modelo?" o "¿Cuántos parámetros tiene este modelo?".

  • El Resultado: Las IA fallaron casi por completo. Inventaron números el 98% de las veces para estas preguntas de "Seguridad".
  • La Analogía: Es como preguntarle a un chef: "Exactamente, ¿cuántos miligramos de sal hay en esta sopa?" y el chef simplemente lanza un número que suena elegante pero que es totalmente inventado.
  • La Lección: Si necesitas saber el tamaño exacto de un chip informático o la potencia de una supercomputadora, no confíes en estas IA. Están adivinando.

4. El Éxito del "Sí/No": Las IA son buenas con los hechos simples

Cuando los investigadores hicieron preguntas simples de "Sí o No", como "¿Publicó este país una estrategia nacional de IA?",

  • El Resultado: Las IA lo hicieron mucho mejor. Acertaron la respuesta aproximadamente el 42% de las veces (¡lo cual es alto para ellas!).
  • Por qué: Es más fácil recordar un "Sí" o un "No" que inventar un número específico como "14,502 patentes".

5. La Comparación de Bibliotecarios: ¿Quién es el mejor?

Los investigadores probaron cuatro "bibliotecarios" diferentes (modelos de IA):

  1. Mistral (Francia): El más preciso en general.
  2. DeepSeek (China): El segundo mejor.
  3. Qwen (China): El tercero.
  4. Llama (EE. UU.): El que más mentiras inventó.

Curiosamente, no importaba mucho si el bibliotecario era de EE. UU., Europa o China. Todos inventaban mentiras a una tasa aproximadamente similar. La "nacionalidad" de la IA no cambió realmente el resultado.

6. El Problema del "No lo sé"

Los investigadores esperaban que, si las IA no sabían una respuesta, dijeran cortésmente: "No lo sé".

  • La Realidad: Las IA casi nunca dijeron que no lo sabían. Incluso cuando estaban adivinando totalmente, sonaban 100% seguras de sí mismas.
  • El Peligro: Esto es como un estudiante que toma un examen, adivina en todas las preguntas, pero escribe las respuestas en letras grandes y negritas. No puedes saber si es inteligente o si solo tuvo suerte.

7. Cómo hacer mejores preguntas

Los investigadores descubrieron que la forma en que haces la pregunta importa.

  • Forma Mala: "¿Cuál es el número exacto de patentes de IA en el País X?" (La IA adivina un número).
  • Forma Mejor: "¿Cómo se compara el conteo de patentes del País X con el promedio de su región?"
  • Resultado: Cuando pides una comparación en lugar de un número específico, la IA inventa menos mentiras. Es como preguntar: "¿Es esta playa más grande que aquella?" en lugar de "¿Cuántos granos de arena hay aquí?".

La Conclusión

Si eres un funcionario gubernamental o un investigador que intenta usar la IA para entender el mundo:

  1. No confíes en los números: Si la IA te da un número específico sobre potencia de IA o patentes, verifícalo con un humano. Probablemente sea un supuesto confiado.
  2. Son malas con las matemáticas de "Seguridad": No pueden decirte cuánta potencia de cómputo se está utilizando.
  3. Son aceptables con el "Sí/No": Son mejores diciéndote si existe una ley que detallando exactamente sus pormenores.
  4. Nunca admiten ignorancia: Siempre responderán, incluso si están mintiendo.

El documento concluye que, aunque estos modelos de IA son impresionantes, actualmente son herramientas poco fiables para recopilar hechos precisos sobre la gobernanza global de la IA. Todavía se necesitan expertos humanos para verificar los datos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →