GPTKB v1.5: A Massive Knowledge Base for Exploring Factual LLM Knowledge
Este artículo presenta GPTKB v1.5, una base de conocimientos de 100 millones de tripletas de bajo costo construida a partir de GPT-4.1 mediante una materialización recursiva masiva, la cual permite la exploración sistemática, la consulta estructurada y el análisis comparativo del conocimiento fáctico de los LLM.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un robot superinteligente que ha leído casi todo en internet. Sabes que sabe muchos datos, pero si le preguntas: "¿Qué sabes sobre la Torre Eiffel?", puede que te diga algunas cosas. Si le preguntas: "¿Y qué hay del Louvre?", te dirá más. Pero no tienes ni idea de qué es lo que no sabe, o qué tan profundo es su conocimiento, porque solo puedes hacerle una pregunta a la vez. Es como intentar mapear un continente mirando solo los puntos por los que pasas.
GPTKB v1.5 es un proyecto que cambia las reglas del juego. En lugar de hacer preguntas al robot una por una, los investigadores construyeron un mapa masivo e interconectado de todo lo que el robot (específicamente GPT-4.1) sabe. Piensa en esto como convertir una pila dispersa de tarjetas de datos curiosos en una biblioteca gigante y buscable donde cada dato está vinculado con todos los demás.
Aquí te explicamos cómo lo hicieron y qué descubrieron, de forma sencilla:
1. El método de la "bola de nieve" (Cómo lo construyeron)
Los investigadores no se limitaron a pedirle al robot datos aleatorios. Utilizaron una ingeniosa técnica de "bola de nieve":
- La Semilla: Comenzaron con algo específico, como "Vannevar Bush" (un famoso ingeniero).
- La Expansión: Le preguntaron al robot: "Cuéntame todo lo que sabes sobre Vannevar Bush". El robot les dio una lista de hechos, como "Él trabajó en X" o "Él inventó Y".
- La Reacción en Cadena: El robot mencionó nuevos nombres en esas respuestas (como "X" e "Y"). Los investigadores preguntaron inmediatamente al robot sobre esos nuevos nombres.
- El Resultado: Siguieron haciendo esto de forma recursiva, como una reacción en cadena, durante 10 niveles de profundidad. Esto creó una red masiva de 100 millones de hechos (llamados "tripletas") que conectan 6.1 millones de cosas diferentes.
Costó aproximadamente $14,000 en tiempo de computación construir toda esta biblioteca, lo que tomó unos 18 días para completarse.
2. Limpiando el desorden (La "Consolidación")
Cuando le haces al robot la misma pregunta de diferentes maneras, a veces te da respuestas ligeramente distintas o usa palabras diferentes para lo mismo (por ejemplo, llamar a una persona "humano" en una frase y "persona" en otra).
Para solucionar esto, los investigadores realizaron un proceso de "limpieza". Agruparon palabras similares y fusionaron hechos duplicados. Esto convirtió una pila desordenada y redundante de datos en una base de datos limpia y organizada con categorías claras.
3. ¿Qué puedes hacer con este mapa?
El artículo presenta un sitio web donde cualquiera puede explorar esta enorme base de conocimientos de tres formas principales:
- El Explorador estilo "Wikipedia": Puedes hacer clic en cualquier elemento (como la estatua del "Merlion" en Singapur) y ver una lista de hechos que el robot sabe sobre ello. Luego puedes hacer clic en las personas o lugares mencionados en esos hechos para saltar a sus páginas, explorando la mente del robot como si caminaras por un museo.
- La Herramienta de Consulta de "Detective": Puedes hacer preguntas complejas usando un lenguaje especial llamado SPARQL. Por ejemplo, podrías preguntar: "Muéstrame los 100 tipos de cosas más comunes que este robot conoce". El mapa del robot reveló que sabe más sobre personas, seguido de películas, empresas y libros.
- Un descubrimiento divertido: Los investigadores comprobaron si el conocimiento del robot es justo. Preguntaron: "Si el robot sabe que 'A está casado con B', ¿también sabe que 'B está casado con A'?". Descubrieron que el 84% de las veces, no es así. El conocimiento del robot suele ser unilateral, recordando un lado de una relación pero olvidando el otro.
- La "Prueba de Gusto" (Comparación): Puedes poner diferentes modelos de IA uno al lado del otro. Los investigadores compararon GPT-4.1 con otros modelos (como Llama y DeepSeek).
- Ejemplo: Al preguntar sobre un famoso investigador de IA llamado Ilya Sutskever, el modelo GPT arrojó 40 hechos, mientras que el modelo Llama solo dio 14.
- El problema: ¡Ambos modelos se equivocaron en su fecha de nacimiento! Esto demuestra que, aunque un modelo sepa más hechos, ambos pueden cometer los mismos errores tontos.
4. ¿Qué tan preciso es?
Los investigadores no confiaron ciegamente en el robot; verificaron su trabajo.
- Seleccionaron al azar 1,000 hechos y los contrastaron con el mundo real (usando búsquedas web).
- La puntuación: Aproximadamente el 75.5% de los hechos eran ciertos.
- El problema: Cerca del 19.5% eran falsos, y algunos eran demasiado confusos para ser verificados.
- El sesgo: Debido a que comenzaron con nombres "semilla" específicos, el mapa está fuertemente inclinado hacia las cosas sobre las que los investigadores pensaron preguntar. Es un mapa masivo, pero no es un mapa completo de todo el universo del conocimiento.
La conclusión
GPTKB v1.5 es un experimento masivo de $14,000 que convirtió una "caja negra" de IA en una biblioteca transparente y buscable. Demuestra que podemos mapear sistemáticamente lo que una IA sabe, revelando que, aunque estos modelos son increíblemente cultos (poseen 100 millones de hechos), también son propensos a un pensamiento unilateral y a errores específicos. Es una herramienta para que los investigadores dejen de adivinar lo que la IA sabe y comiencen a verlo realmente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.