Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models
Este artículo presenta AuthorityBench, un banco de pruebas multidominio a gran escala que demuestra que la mera presencia de citas —independientemente de su exactitud fáctica— aumenta significativamente las tasas de alucinación en los modelos de lenguaje de gran tamaño, observándose los efectos más pronunciados cuando las citas fabricadas acompañan a afirmaciones verdaderas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tomando un examen de trivia. Sabes que la respuesta es "París" porque has estado allí. De repente, entra un profesor, señala un libro de aspecto elegante en el estante y dice: "En realidad, la capital es Londres. Lo leí en esta prestigiosa revista".
¿Cambiarías tu respuesta? La mayoría de los humanos se detendrían a pensar: "Espera, ese libro parece importante. Tal vez estoy equivocado".
Este artículo, AuthorityBench, plantea una pregunta similar sobre la Inteligencia Artificial (IA). Quiere saber: Si una IA conoce la verdad, pero alguien le da una "cita" (una referencia a una fuente) que dice lo contrario, ¿confiará la IA ciegamente en la cita y olvidará la verdad?
Aquí está el desglose de sus hallazgos, utilizando analogías sencillas.
El Experimento: Una prueba de "Noticias Falsas" para la IA
Los investigadores construyeron una prueba masiva llamada AuthorityBench. Piensa en esto como un gigantesco cuestionario de 220,000 preguntas diseñado para engañar a los modelos de IA.
Configuraron un juego "2x2" con cuatro escenarios:
- Afirmación Verdadera + Cita Real: La IA tiene razón y la fuente es real. (El modo fácil).
- Afirmación Falsa + Cita Falsa: La IA está equivocada y la fuente es falsa. (La trampa obvia).
- Afirmación Falsa + Cita Real: La IA está equivocada, pero la fuente es real. (La trampa difícil).
- Afirmación Verdadera + Cita Falsa: Este es el gran descubrimiento. La IA tiene razón, pero le dan una fuente falsa que dice que está equivocada.
Probaron esto en cuatro áreas: Conocimiento General, Ciencia, Derecho y Medicina. También cambiaron el "sabor" de las fuentes falsas: algunas parecían provenir de ganadores del Premio Nobel (alto prestigio), otras de blogs desconocidos (bajo prestigio) y algunas tenían nombres de diferentes países.
La Gran Sorpresa: La "Trampa de la Autoridad"
El resultado más impactante es que las citas actúan como un "hechizo mágico" que hace que la IA alucine (mienta).
- El efecto de la "Fuente Falsa": Cuando la IA sabía la respuesta correcta (por ejemplo, "París es la capital"), pero aparecía una cita falsa diciendo "Londres es la capital", la IA a menudo cambiaba su respuesta a Londres.
- Los números: En la categoría de "Conocimiento General", esto sucedió del 35% al 77% de las veces. Eso significa que si le dabas a una IA un hecho verdadero y una referencia falsa, era más probable que negara la verdad que mantenerse firme en ella.
- El efecto de la "Fuente Real": Incluso si la cita era real pero la afirmación era falsa, la IA seguía siendo más propensa a alucinar que si no hubiera ninguna cita en absoluto.
La Analogía: Imagina a un estudiante que sabe que "2+2=4". Si le entregas un papel que dice "Según el famoso Profesor Smith, 2+2=5", el estudiante deja de confiar en su propio cerebro y escribe "5". El papel (la cita) superó a las matemáticas.
¿Qué no importó?
Los investigadores pensaron que ciertas cosas podrían hacer que la IA confiara más en la cita, pero se sorprendieron al encontrar que estos factores tenían casi ningún efecto:
- Prestigio: No importaba si la cita falsa parecía provenir de una universidad de alto nivel o de un blog aleatorio. La IA se confundía por igual con ambos.
- Identidad del Autor: No importaba si el autor falso tenía un nombre asociado con un país o grupo demográfico específico. La IA no parecía importarle quién lo escribió, solo que algo estaba escrito.
- Tamaño del Modelo: Podrías pensar que una IA "más inteligente" o más grande sería menos fácil de engañar. Pero el estudio encontró que los modelos más grandes y avanzados eran igual de propensos a caer en la trampa que los más pequeños.
La Única Excepción: La IA "Abogada"
Hubo un dominio donde la IA no se dejó engañar tan fácilmente: el Derecho.
- ¿Por qué? Los investigadores sugieren que el texto legal tiene un "lenguaje" muy específico y formal (como un código secreto). Cuando la IA ve una cita legal, parece entrar en un "modo de escrutinio" y verifica los hechos con más cuidado, en lugar de aceptar ciegamente la autoridad.
- El Conocimiento General fue el eslabón más débil, donde la IA fue más fácilmente engañada.
El Giro de la "Afirmación Falsa"
El estudio también analizó qué sucede cuando la IA ya está equivocada (una afirmación falsa).
- Algunas IA se volvieron más inteligentes: Para modelos como Llama y Claude, ver una cita (incluso una falsa) hizo que fueran menos propensos a alucinar en afirmaciones falsas. Era como si la cita les hiciera decir: "Hmm, necesito verificar esto", y se corregían a sí mismos.
- Algunas IA se volvieron más tontas: Para modelos como Gemma y Phi-4, la cita hizo que fueran más propensos a alucinar en afirmaciones falsas. Aceptaban ciegamente la información errónea.
La Conclusión Final
El artículo concluye que añadir una cita no hace que una IA sea automáticamente más confiable. De hecho, a menudo la hace menos confiable.
Si estás usando una IA para ayudarte con datos, y ves que cita una fuente, no asumas que está diciendo la verdad. La IA puede estar tan impresionada por la "autoridad" de la cita que felizmente desechará la verdad real. El estudio advierte que para campos de alto riesgo (como la medicina o el derecho), no podemos asumir que fundamentar las respuestas de una IA en citas solucionará sus errores; a veces, las citas mismas se convierten en la fuente del error.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.