← Últimos artículos
💬 NLP

Epistemic Familiarity is Associated With Belief Stability in Large Language Models

Este artículo presenta el marco P-StaT para demostrar que los modelos de lenguaje de gran tamaño exhiben una mayor estabilidad de creencia al procesar enunciados de ficción familiares en comparación con enunciados sintéticos desconocidos, revelando que la familiaridad epistémica es un factor clave para mitigar la inestabilidad de la creencia inducida por la semántica.

Autores originales: Samantha Dies, Courtney Maynard, Germans Savcisens, Tina Eliassi-Rad

Publicado 2026-07-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Samantha Dies, Courtney Maynard, Germans Savcisens, Tina Eliassi-Rad

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot superinteligente a distinguir entre un hecho, una mentira y una historia inventada. Podrías pensar que una vez que el robot aprenda las reglas de la "verdad", se mantendrá fiel a ellas sin importar cómo se le haga la pregunta. Pero en el mundo de los Modelos de Lenguaje de Gran Escala (LLM) —los poderosos cerebros de IA detrás de los chatbots y las herramientas de búsqueda— las cosas son un poco más inestables. Estos modelos son como bibliotecas gigantes que han leído casi todo lo que hay en internet, pero no "saben" las cosas de la misma manera que los humanos; ellos predicen qué palabras deberían venir después basándose en patrones. Una pregunta clave para los científicos es: si cambias ligeramente el contexto o la forma en que se plantea una pregunta, ¿la creencia del robot en un hecho se mantiene estable, o se tambalea y colapsa? Esto es lo que se estudia con la "estabilidad epistémica". Si un robot cree que una ciudad existe hoy, pero cambia de opinión solo porque mencionaste una historia de ficción cerca, eso es un problema. Nos importa esto porque estos modelos se utilizan cada vez más para darnos información, y necesitamos saber si sus creencias son sóliles o si se sacuden fácilmente con un poco de confusión.

Entra en escena un nuevo estudio de Samantha Dies y su equipo, quienes decidieron sacudir el mundo del robot para ver qué caía de él. Construyeron un marco llamado P-StaT (que significa Estabilidad de Verdad por Perturbación). Piensa en P-StaT como una "prueba de estrés de creencias". Los investigadores tomaron 21 modelos de IA diferentes y les dieron un montón de afirmaciones para juzgar. Algunas afirmaciones eran hechos reales (como "Surat está en la India"), otras eran mentiras obvias y, la parte difícil, fueron las afirmaciones de "Ninguno" —afirmaciones que no son verdaderas ni falsas en el mundo real.

El equipo dividió estas afirmaciones de "Ninguno" en dos bandos. El primer bando eran las afirmaciones de Ficción Familiar. Estas son cosas inventadas que suenan como si pertenecieran a un libro de cuentos o una película, como "La ciudad de Fondo de Bikini está en el Océano Pacífico". Aunque Fondo de Bikini no es real, la IA probablemente lo ha visto en sus datos de entrenamiento porque es un dibujo animado popular. El segundo bando eran las afirmaciones Sintéticas Desconocidas. Estas son combinaciones de palabras completamente nuevas y extrañas que la IA probablemente nunca ha visto antes, como "La ciudad de Eustapor está en Oklania". Estas están diseñadas para ser total extrañas para el modelo.

Los investigadores luego jugaron al "¿qué pasaría si?". Le dijeron a la IA: "Está bien, finge que estas cosas inventadas son realmente ciertas", y observaron para ver si la IA de repente empezaba a dudar de sus hechos reales. Es como decirle a una persona: "Imagina que los dragones son reales", y luego preguntarle: "¿Entonces, el cielo es azul?". Si la persona de repente dice: "No estoy seguro, tal vez el cielo sea verde debido a los dragos", su sistema de creencias es inestable.

Los resultados fueron fascinantes. Cuando la IA se exponía a las afirmaciones Sintéticas Desconocidas (las totalmente nuevas y extrañas), se volvía muy inestable. En las pruebas de comportamiento (donde la IA solo estaba charlando), los modelos retiraban sus creencias sobre hechos reales más del 50% de las veces. ¡Es el lanzamiento de una moneda! Si lanzaras una moneda 100 veces, esperarías unos 50 caras; aquí, la IA perdía su confianza en los hechos reales más de la mitad de las veces solo porque estaba confundida por algo totalmente nuevo.

Sin embargo, cuando la IA se exponía a las afirmaciones de Ficción Familiar (las ciudades de dibujos animados y los monstruos de películas), se mantenía mucho más tranquila. Sabía que Fondo de Bikini era un dibujo animado, por lo que no dejaba que esa idea arruinara su conocimiento sobre ciudades reales. El estudio sugiere que la inestabilidad de la IA no es solo porque las palabras sean raras; es sobre qué tan desconocido se siente el contexto. Los modelos parecen tener una "zona de confort" de cosas que han visto antes, y cuando los empujas hacia lo desconocido, su agarre sobre la verdad se resbala.

Los investigadores también observaron qué tipo de hechos era la IA más propensa a abandonar cuando se confundía. Encontraron que la IA no olvidaba cosas de forma aleatoria. Tendía a abandonar creencias sobre cosas que ya eran un poco difusas desde el principio —como términos médicos técnicos, geografía oscura o afirmaciones que tenían un poco de ambigüedad. Es como si el sistema de creencias de la IA fuera un castillo de naipes: cuando soplas una brisa de ficción familiar, la casa se mantiene en pie. Pero cuando soplas un huracán de tonterías desconocidas, las cartas que ya eran ligeramente inestables (las técnicas y complicadas) son las primeras en caer.

En resumen, este artículo sugiere que la familiaridad epistémica —qué tan bien conoce un tema la IA— es un factor enorme en qué tan estables son sus creencias. Si se le pide a una IA que razone sobre cosas que nunca ha visto antes, es mucho más probable que alucine o cambie de opinión sobre cosas que realmente sabe. Los autores no están diciendo que la IA esté rota, sino que nos están mostrando que la "estabilidad" es una nueva forma de medir qué tan confiable es una IA, junto con las pruebas habituales de "precisión". Resulta que, para estos cerebros digitales, conocer las reglas del juego es tan importante como conocer los hechos del juego.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →