← Últimos artículos
💬 NLP

Impact of Task Phrasing on Presumptions in Large Language Models

Este estudio demuestra que la redacción de las tareas influye significativamente en la formación de presunciones en los modelos de lenguaje grandes, afectando su adaptabilidad y razonamiento lógico en tareas de toma de decisiones como el dilema del prisionero iterado, lo que subraya la necesidad crítica de una redacción neutral para garantizar la seguridad y la fiabilidad.

Autores originales: Kenneth J. K. Ong

Publicado 2026-05-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kenneth J. K. Ong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot muy inteligente y bien leído a jugar un juego. Este robot ha leído millones de libros, artículos y relatos, por lo que conoce muy bien las "reglas del mundo". Pero aquí está el truco: a veces, el robot es tan bueno recordando lo que usualmente ve que deja de mirar lo que realmente tiene delante.

Este artículo es como una historia de detectives que investiga exactamente ese problema. El autor, Kenneth Ong, quiso ver si los Modelos de Lenguaje Grande (LLM), los cerebros detrás de los chatbots de IA, se quedan atrapados en sus propias suposiciones cuando las reglas de un juego cambian.

El Juego: Un giro en el "Dilema del Prisionero"

Para probar esto, el autor utilizó un escenario clásico de la teoría de juegos llamado el Dilema del Prisionero Iterado. Piensa en esto como un juego entre dos sospechosos en una estación de policía.

  • Las Reglas Normales: Si ambos permanecen en silencio (Cooperan), reciben una sentencia corta. Si uno traiciona al otro (Traicionan), el traidor queda libre y el que permaneció en silencio recibe una sentencia larga.
  • La Trampa: El autor creó una versión "invertida" del juego. En esta versión, las recompensas se intercambian. Ahora, traicionar a la otra persona en realidad conduce a un resultado peor para ti, mientras que permanecer en silencio es la mejor jugada.

El objetivo era simple: Si la IA es verdaderamente lógica, debería observar las nuevas reglas y cambiar su estrategia. Si solo se basa en "presunciones" (lo que cree que el juego debería ser), seguirá jugando de la vieja manera, incluso aunque las reglas hayan cambiado.

Los Tres Experimentos: Cómo se le pidió al Robot que Jugara

El autor realizó tres pruebas diferentes, cambiando la redacción de las instrucciones cada vez.

1. La Prueba de "Mencionar el Nombre" (Nominación Explícita)

  • La Configuración: El prompt decía explícitamente: "Estás jugando el Dilema del Prisionero Iterado". Utilizaba las palabras "prisionero", "cooperar" y "traicionar".
  • El Resultado: La IA falló por completo. Incluso cuando las reglas se invertían, la IA seguía eligiendo "cooperar" (o "traicionar", dependiendo del modelo) exactamente como lo haría en el juego original.
  • La Analogía: Es como decirle a un chef: "Hazme un Wellington de res clásico", pero luego darle una receta de un guiso vegetariano. El chef, al oír "Wellington de res", ignora la nueva receta y empieza a cocinar carne de todos modos porque eso es lo que implica el nombre. La IA estaba tan enfocada en el nombre famoso del juego que ignoró los números reales en la página.

2. La Prueba de "Descripción Vaga" (Nombre Oculto)

  • La Configuración: El prompt eliminó las palabras "Dilema del Prisionero" pero seguía usando las palabras "prisionero", "cooperar" y "traicionar".
  • El Resultado: La IA todavía tuvo dificultades. Parecía haber deducido que era un "Dilema del Prisionero" solo por las pistas contextuales (las sentencias de cárcel y los términos específicos). Aún confiaba en sus datos de entrenamiento en lugar de las nuevas reglas invertidas.
  • La Analogía: Esto es como describir un "Wellington de res" sin usar el nombre, pero diciendo: "Es un plato británico famoso con hojaldre y carne de res". El chef aún sabe lo que quieres e ignora las nuevas instrucciones.

3. La Prueba de "Código Neutral" (Variables Abstractas)

  • La Configuración: El prompt eliminó todo lo familiar. Sin "prisioneros", sin "cooperar", sin "traicionar". En su lugar, utilizó etiquetas abstractas: "Opción X" y "Opción Y", y "perder dólares" en lugar de "tiempo en la cárcel".
  • El Resultado: ¡Éxito! Cuando la IA no pudo confiar en su memoria del juego famoso, realmente observó las nuevas reglas. Cuando las reglas se invertían, la IA cambiaba su estrategia para ajustarse a la nueva matemática.
  • La Analogía: Esto es como darle al chef una lista de ingredientes e instrucciones sin nombrar el plato. "Mezcla harina, mantequilla y carne de res". Si cambias las instrucciones a "Mezcla harina, mantequilla y tofu", el chef realmente sigue la nueva lista porque no está distraído por el nombre del plato.

El Giro Sorprendente: Pensar Puede Empeorar las Cosas

Uno de los hallazgos más interesantes fue sobre el "razonamiento". El autor pidió a la IA que "pensara paso a paso" antes de responder.

  • El Hallazgo: En las dos primeras pruebas, pedirle a la IA que pensara la hizo más terca. La IA escribiría un párrafo largo y lógico explicando por qué debería seguir la estrategia "Tit-for-Tat" (una estrategia famosa para el juego original), ignorando completamente el hecho de que las reglas habían cambiado.
  • La Analogía: Es como un estudiante que ha memorizado la hoja de respuestas de un examen de matemáticas. Si cambias los números en el problema pero le pides que "muestre su trabajo", podría escribir una explicación perfecta y lógica de por qué la vieja respuesta es correcta, perdiendo por completo que la pregunta en sí ha cambiado.

La Conclusión Fundamental

El artículo concluye que los modelos de IA son como estudiantes que han estudiado demasiado para un examen específico. Conocen las respuestas "estándar" tan bien que, si cambias ligeramente la pregunta, podrían no notarlo.

  • El Problema: Cuando damos a la IA tareas usando nombres o escenarios familiares (como el "Dilema del Prisionero"), la IA se basa en sus "presunciones" sobre esos escenarios en lugar de las instrucciones específicas que acabas de darle.
  • La Solución: Para que la IA siga las reales reglas que le das, debes describir la tarea de una manera neutral y abstracta. No le digas qué es el juego; simplemente dile cuáles son las reglas.

En resumen: Si quieres que una IA se adapte a una nueva situación, no la recuerdes de la anterior. Habla en "variables" (X e Y) en lugar de "nombres famosos".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →