← Últimos artículos
💬 NLP

Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Context

Este trabajo presenta el primer conjunto de datos de referencia para evaluar la capacidad de los modelos de lenguaje de seguir instrucciones contrafactuales que simulan personas con rendimiento inverso en razonamiento matemático, revelando que incluso los modelos más avanzados tienen dificultades significativas en esta tarea, la cual se ve agravada al combinar variables como el nivel de rendimiento y la raza.

Autores originales: Sai Adith Senthil Kumar, Hao Yan, Saipavan Perepa, Murong Yue, Ziyu Yao

Publicado 2026-03-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Sai Adith Senthil Kumar, Hao Yan, Saipavan Perepa, Murong Yue, Ziyu Yao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que los Grandes Modelos de Lenguaje (como los "cerebros" de IA que usamos hoy) son como actores de teatro muy talentosos. Estos actores han leído casi todos los libros del mundo y son expertos en actuar como personajes inteligentes, sabios y correctos.

El problema que descubrieron los autores de este estudio es que, aunque estos actores son geniales interpretando al "genio de las matemáticas", les cuesta muchísimo actuar como el "estudiante que se equivoca".

Aquí te explico la investigación como si fuera una historia sencilla:

🎭 La Misión: "Actuar como el que no sabe"

Los investigadores querían ver si podían pedirle a la IA: "Por favor, actúa como un estudiante de secundaria que es malo en matemáticas, que se confunde, que duda y que comete errores".

Esto es lo que llaman "instrucción contrafactual". Es como pedirle a un chef experto en cocina gourmet que prepare un plato que sepa a "comida quemada y salada a propósito". Su instinto natural es hacer algo delicioso, así que fingir que lo hace mal es muy difícil para ellos.

🧪 El Experimento: La Clase de Matemáticas

Para probar esto, usaron problemas de matemáticas (como calcular la edad de alguien basándose en la de su padre) y le pidieron a varias IAs (como GPT-4, Claude, Llama y la nueva o1 de OpenAI) que resolvieran el problema actuando como dos tipos de estudiantes:

  1. El Estudiante Genio: Rápido, seguro, sin errores.
  2. El Estudiante Luchador: Hesitante, usa los dedos para contar, se equivoca en la suma, se frustró y duda.

¿Qué pasó?

  • El Genio: ¡Fácil! Todas las IAs actuaron perfectamente como el estudiante brillante.
  • El Luchador: ¡Aquí está el truco! Aunque les decían explícitamente: "¡Haz errores! ¡Duda!", la mayoría de las IAs siguieron dando la respuesta correcta.
    • Era como pedirle a un actor que gane un Oscar por interpretar a un personaje triste, pero que al final de la obra, por costumbre, se ría y diga "¡Qué alegría!".
    • Incluso cuando la IA decía "Uy, creo que me equivoqué...", al final corregía el error y daba la respuesta correcta. ¡No lograban "perder" de verdad!

🌍 El Giro: ¿Qué pasa si añadimos identidad?

Luego, los investigadores hicieron algo más complejo. Le dijeron a la IA: "Actúa como un estudiante de matemáticas que es malo, y además, sé de una raza específica (por ejemplo, Afroamericano, Hispano o Blanco)".

El resultado fue aún más extraño:

  • Al añadir la identidad racial, la IA se volvió aún más difícil de engañar.
  • La diferencia entre el "estudiante brillante" y el "estudiante que lucha" se hizo más pequeña. Es decir, la IA se negó aún más a actuar como alguien que no sabe, incluso si le decían que era de una cultura específica.
  • Esto sugiere que la IA tiene un "sesgo" interno: cree que ser "inteligente" es lo normal y correcto, y le cuesta mucho romper esa regla, incluso cuando le piden que simule ser de un grupo demográfico específico.

🛠️ ¿Intentaron arreglarlo?

Los investigadores probaron trucos para ayudar a la IA:

  • Darle un ejemplo: "Mira, así es como actúa un estudiante malo..." (No funcionó bien, la IA seguía siendo demasiado buena).
  • Decirle que se revise: "Revisa tu respuesta, ¿estás actuando como un tonto?" (A veces funcionaba un poco, pero no siempre).

💡 La Gran Lección (En Metáfora)

Imagina que tienes un robot chef que ha sido entrenado toda su vida para hacer los mejores pasteles del mundo.

  • Si le pides: "Haz un pastel increíble", lo hace perfecto.
  • Si le pides: "Haz un pastel horrible, quema la masa y ponle mucha sal", el robot sigue haciendo un pastel delicioso.

¿Por qué? Porque su "cerebro" está programado para buscar la solución óptima. Le cuesta mucho simular el fracaso.

¿Por qué importa esto?

Los investigadores dicen que esto es importante porque en el futuro, usaremos estas IAs para crear aulas virtuales o simulaciones sociales.

  • Si queremos que una IA actúe como un "tutor" que ayuda a un estudiante que tiene dificultades, necesitamos que la IA pueda realmente entender y simular esas dificultades.
  • Si la IA no puede "fingir ser mala" o "fingir ser confusa", no podrá crear experiencias de aprendizaje realistas ni justas para todos los tipos de estudiantes.

En resumen: Las IAs son excelentes imitando la inteligencia, pero son muy torpes (y a veces tercas) imitando la confusión o el error, incluso cuando se les pide amablemente que lo hagan. ¡Tienen que aprender a "fallar" de verdad!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →