← Últimos artículos
💬 NLP

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

Este artículo demuestra que el empleo de aprendizaje por refuerzo con recompensas basadas en resultados para ajustar modelos de lenguaje de gran tamaño preentrenados permite que estos sirvan como modelos cognitivos de doble propósito que logran simultáneamente una fuerte precisión predictiva y generan explicaciones en lenguaje natural interpretables para las decisiones riesgosas humanas.

Autores originales: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

Publicado 2026-02-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Enseñar a la IA a "Pensar en Voz Alta"

Imagina que tienes un estudiante superinteligente (un Modelo de Lenguaje Grande, o LLM) que es increíblemente bueno adivinando qué harás después. Si le muestras un problema matemático difícil, normalmente puede darte la respuesta correcta. Pero, si le preguntas cómo llegó a esa respuesta, podría simplemente decir: "Simplemente lo sabía", o darte una explicación vaga que no tiene mucho sentido.

En el mundo de la psicología, los científicos quieren modelos que no solo adivinen la respuesta (predecir el comportamiento humano), sino que también expliquen por qué las personas toman esas decisiones (revelar el mecanismo cognitivo).

Este artículo se pregunta: ¿Podemos enseñar a una IA no solo a predecir las decisiones humanas, sino también a "pensar en voz alta" de una manera que realmente explique la psicología humana?

El Experimento: El Juego de la "Elección Arriesgada"

Para probar esto, los investigadores utilizaron un juego clásico de psicología llamado "elección arriesgada". Imagina que se te ofrecen dos opciones:

  • Opción A: Obtienes $27 de forma segura.
  • Opción B: Tienes un 90% de probabilidad de obtener $25, pero un 10% de probabilidad de obtener $92.

La mayoría de las personas tienen que elegir entre una apuesta segura y una apuesta arriesgada. Los investigadores utilizaron un conjunto masivo de datos de miles de humanos reales tomando estas decisiones. Querían entrenar a una IA para que mirara las opciones y dijera: "El 70% de las personas elegirá la Opción A, y el 30% elegirá la Opción B".

Los Tres Métodos de Entrenamiento

Los investigadores probaron tres formas diferentes de enseñar esta tarea a la IA, como tres estilos de entrenamiento distintos:

  1. El "Memorizador" (Entrenamiento Estándar): Le mostraron a la IA miles de ejemplos de preguntas y las respuestas correctas. La IA aprendió a copiar el patrón. Se volvió buena adivinando los porcentajes, pero no aprendió realmente el porqué. Era como un estudiante que memorizó la clave de respuestas pero no podía explicar las matemáticas.
  2. El "Memorizador Enmascarado" (Estilo Centauro): Esta es una versión sofisticada del primer método donde se obliga a la IA a concentrarse solo en los números de la respuesta, ignorando el resto del texto. También fue buena adivinando, pero seguía sin generar una buena explicación.
  3. El "Entrenador con Marcador" (Aprendizaje por Refuerzo - RL): Este es el protagonista de la historia. Aquí, se le permitió a la IA escribir una "Cadena de Pensamiento" (un proceso de razonamiento paso a paso) antes de dar su respuesta final.
    • El Giro: La IA no solo recibía puntos por acertar. Recibía puntos basados en qué tan cerca estaba su predicción final de lo que los humanos reales realmente hicieron.
    • El Resultado: Para ganar los puntos, la IA se dio cuenta de que necesitaba "pensar" como un psicólogo. Empezó a escribir cosas como: "La gente es adversa al riesgo" o "Calculan el valor esperado". Al intentar ganar el juego (coincidir con los datos humanos), accidentalmente aprendió a verbalizar las reglas psicológicas que siguen los humanos.

Los Resultados: La IA se Convierte en Psicóloga

Los investigadores descubrieron que el método del "Entrenador con Marcador" (RL) cambió las reglas del juego por dos razones:

  1. Predijo Bien: Fue tan buena adivinando lo que los humanos elegirían como los otros métodos.
  2. Explicó Bien: Las partes de "pensar en voz alta" (la Cadena de Pensamiento) eran en realidad explicaciones psicológicas de alta calidad.
    • La Analogía: Imagina que los otros métodos son como una aplicación del clima que dice: "Va a llover". El método de RL es como un meteorólogo que dice: "Va a llover porque un frente frío está colisionando con aire cálido, creando baja presión".
    • La IA comenzó a usar conceptos psicológicos reales como la Aversión al Riesgo (la gente odia perder), el Valor Esperado (hacer las cuentas de las probabilidades) y el Efecto de Certeza (la gente ama una victoria garantizada).

El Requisito de "Inteligencia"

Sin embargo, hubo un inconveniente. Los investigadores probaron este mismo método de "Entrenador" en un modelo de IA más pequeño y débil.

  • La Analogía: Imagina intentar enseñarle una estrategia compleja a un niño pequeño frente a un estudiante universitario. El niño (el modelo pequeño) no pudo entender las matemáticas ni la estrategia, incluso con el entrenador. Solo se confundió y dio respuestas malas.
  • El Hallazgo: El método del "Entrenador" solo funcionó porque la IA base ya era lo suficientemente inteligente como para entender los conceptos. Si la IA no es lo suficientemente inteligente para entender el "Valor Esperado" desde el principio, no puedes entrenarla para que lo explique.

La Prueba de "Cambio de Forma"

Para demostrar que la IA no estaba simplemente recitando frases memorizadas, los investigadores cambiaron las reglas del juego. En lugar de usar datos humanos reales, alimentaron a la IA con datos generados por un robot que solo se preocupaba por las matemáticas (Valor Esperado).

  • El Resultado: La IA cambió instantáneamente su "pensamiento". Dejó de hablar sobre los miedos humanos y la aversión al riesgo y empezó a hablar puramente de matemáticas y lógica.
  • La Conclusión: Esto demostró que la IA no estaba solo copiando un guion; realmente estaba adaptando su razonamiento para coincidir con los datos con los que estaba siendo entrenada. Realmente estaba "aprendiendo" las reglas del juego específico que estaba jugando.

Resumen

Este artículo muestra que si entrenas a una IA inteligente para predecir el comportamiento humano utilizando un sistema de recompensas (como la puntuación de un videojuego), esta comenzará naturalmente a "pensar en voz alta" utilizando las mismas reglas psicológicas que usan los humanos. Esto convierte a la IA de un simple adivinador en un modelo que puede explicar por qué tomamos las decisiones que tomamos. Sin embargo, esto solo funciona si la IA ya es lo suficientemente inteligente como para entender esos conceptos en primer lugar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →