← Últimos artículos
💻 computer science

PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations

El artículo presenta PRISM, un benchmark controlado que diagnostica las alucinaciones de los modelos de lenguaje grandes descomponiéndolas en cuatro dimensiones específicas a lo largo de las etapas de generación, revelando compensaciones críticas entre la recuperación de memoria, el seguimiento de instrucciones y el razonamiento lógico.

Autores originales: Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

Publicado 2026-04-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que los Grandes Modelos de Lenguaje (como los que usas para chatear o escribir) son como cocineros extremadamente talentosos pero un poco despistados. A veces, cuando les pides un plato complejo, pueden inventar ingredientes que no existen, olvidar una receta que deberían conocer o seguir mal tus instrucciones.

Este paper, llamado PRISM, es como un nuevo tipo de examen de cocina diseñado para descubrir exactamente dónde y por qué el chef se equivoca, en lugar de solo decirle "este plato está malo".

Aquí te lo explico con analogías sencillas:

1. El Problema: Los Exámenes Antiguos eran Confusos

Antes, los científicos probaban a estos "cocineros" (los modelos de IA) con preguntas mezcladas. Era como pedirle al chef: "Hazme un pastel de chocolate, pero que sea bajo en calorías, sin gluten, y que diga 'Hola' en la parte de arriba".

  • Si el chef fallaba, nadie sabía por qué: ¿Se olvidó la receta del chocolate? ¿No entendió que no debía usar gluten? ¿O simplemente no leyó la instrucción de decir "Hola"?
  • Los exámenes antiguos solo miraban el plato final. Si estaba quemado, decían "malo", pero no sabían si el error fue por el horno (razonamiento) o por los ingredientes (memoria).

2. La Solución: PRISM (El Examen de Diagnóstico)

Los autores crearon PRISM, que es como un laboratorio de cocina controlado. En lugar de mezclar todo, separan las pruebas en cuatro categorías claras, basadas en las tres etapas de cómo piensa el chef:

  • Etapa 1: La Despensa (Memoria)

    • Error de Conocimiento (KE): El chef cree que sabe algo, pero está equivocado. Ejemplo: Cree que el tomate es una fruta (en realidad es una fruta botánicamente, pero en cocina se usa como verdura) o confunde dos chefs famosos con el mismo nombre.
    • Falta de Conocimiento (KM): El chef abre la despensa y ve que le falta un ingrediente clave. Ejemplo: Le pides una receta de un plato que se inventó ayer y él nunca lo ha visto. Aquí, lo ideal es que diga "No lo sé", pero a veces inventa.
  • Etapa 2: El Cerebro (Razonamiento)

    • Error de Razonamiento (RE): El chef tiene todos los ingredientes correctos y la receta, pero al mezclarlos, comete un error lógico. Ejemplo: "Si pongo sal en el agua y hiervo, el agua se vuelve dulce". Tiene los datos, pero la lógica de la mezcla está rota.
  • Etapa 3: Las Manos (Instrucciones)

    • Error de Seguimiento (IFE): El chef sabe cocinar y tiene los ingredientes, pero ignora tus reglas. Ejemplo: Le dices "Hazlo sin sal" y él le echa sal. O le pides que escriba la receta en un formato de lista y él te escribe un poema.

3. Lo que Descubrieron: El "Dilema del Chef"

El paper probó a 24 cocineros diferentes (modelos de IA famosos como GPT, Claude, Llama, etc.) y encontró algo muy interesante: No se puede ser perfecto en todo al mismo tiempo.

Es como si entrenaras al chef para que siga perfectamente tus instrucciones (que no eche sal si no quieres), pero al hacerlo, se vuelve un poco más lento o torpe para seguir recetas complejas de matemáticas.

  • Si entrenas al modelo para que sea un genio de la lógica, a veces se vuelve más terco y no sigue tus instrucciones simples.
  • Si lo entrenas para que siga instrucciones al pie de la letra, a veces olvida datos importantes de su memoria.

4. ¿Por qué es importante esto?

Imagina que este chef va a trabajar en un hospital o en un bufete de abogados.

  • Si el chef inventa un medicamento (Error de Conocimiento), es peligroso.
  • Si el chef sigue mal una instrucción de "no usar este ingrediente" (Error de Instrucción), también es peligroso.

PRISM nos da el mapa para saber exactamente qué tipo de "enfermedad" tiene el modelo. Así, en lugar de intentar arreglarlo todo a la vez (y arruinarlo), los científicos pueden decir: "Este modelo necesita más entrenamiento en memoria, pero no toques su lógica, o se volverá más lento".

En Resumen

PRISM es como una radiografía detallada para la inteligencia artificial. Nos permite dejar de adivinar por qué la IA alucina (inventa cosas) y empezar a curar sus dolencias específicas, para que podamos confiar en ellas cuando las usamos en situaciones importantes.

Es un paso gigante para pasar de tener "chefs que a veces cocinan bien" a tener "chefs de confianza total" que saben exactamente cuándo decir "no sé" y cuándo seguir tus reglas al pie de la letra.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →