← Últimos artículos
💬 NLP

Eliciting Trustworthiness Priors of Large Language Models via Economic Games

Este artículo presenta un método novedoso que utiliza el aprendizaje en contexto iterado y el Juego de la Confianza para provocar prioris de confiabilidad en grandes modelos de lenguaje, revelando que los comportamientos de confianza de GPT-4.1 reflejan estrechamente los patrones humanos y pueden ser predichos por estereotipos de calidez y competencia.

Autores originales: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

Publicado 2026-02-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: ¿Qué tan "confiable" es una IA?

Imagina que estás contratando a un nuevo asistente para que gestione tu dinero. Le das $10 y le dices: "Voy a multiplicar esto por 3, así que ahora tienes $30. Por favor, devuélveme una parte".

  • Si te devuelve $15: Es confiable.
  • Si te devuelve $0: No lo es.

Esta es la configuración básica de un juego famoso llamado el Juego de la Confianza (Trust Game). Usualmente, los psicólogos usan este juego para ver cómo se comportan los humanos. Pero este artículo hace una pregunta nueva: ¿Cómo se comportan los Modelos de Lenguaje Extensos (LLM) como GPT-4 o Llama en este juego? ¿Tienen un "ajuste predeterminado" sobre cuánto confían en los demás y cuánto retribuyen el favor?

El Problema: No puedes simplemente preguntarle a una IA

Podrías pensar: "¿Por qué no simplemente preguntarle a la IA: '¿Eres confiable?'". Los autores dicen que esa es una mala idea.

  • El Problema del "Robot Educado": Si le preguntas a una IA: "¿Robarás mi dinero?", casi con seguridad dirá: "No, soy un asistente útil".
  • La Realidad: Al igual que los humanos, la IA puede ser persuasiva y fluida, pero aun así tomar decisiones arriesgadas o poco fiables en la práctica. Necesitamos ver lo que hacen, no solo lo que dicen.

La Solución: El "Teléfono Descompuesto" de la Confianza

Para descubrir los verdaderos "ajustes de confianza" de una IA, los investigadores inventaron un método ingenioso basado en un concepto llamado Aprendizaje en Contexto Iterativo (Iterated In-Context Learning).

Piensa en esto como un juego de Teléfono Descompuesto, pero en lugar de pasar un susurro, están pasando una historia sobre dinero.

  1. La Configuración: Los investigadores crean una cadena de "generaciones" de IA.
  2. El Primer Paso: Le muestran a la IA algunos ejemplos de personas jugando al Juego de la Confianza (por ejemplo: "La Persona A envió $5, la Persona B devolvió $2").
  3. El Turno de la IA: La IA observa esos ejemplos y predice: "Si yo fuera la Persona B, ¿cuánto devolvería?". Digamos que predice un 40%.
  4. El Bucle: Los investigadores toman esa predicción del 40% y la utilizan para generar nuevos ejemplos falsos de personas jugando el juego. Alimentan estos nuevos ejemplos al siguiente IA en la cadena.
  5. El Resultado: Repiten este proceso 30 veces.

¿Por qué hacer esto?
Imagina que estás tratando de adivinar la "personalidad promedio" de un grupo observándolos jugar una y otra vez. Al principio, los resultados pueden parecer aleatorios. Pero si sigues pasando los resultados por la línea, el "ruido" desaparece, y lo que queda es el instinto profundo (o "prior") de la IA sobre cómo funciona la confianza. Es como sintonizar una radio hasta que la estática se aclara y escuchas la verdadera estación.

Lo que Encontraron

1. Algunas IA son "Similares a los Humanos", otras no
Los investigadores probaron 20 modelos de IA diferentes. Compararon los "ajustes de confianza" que encontraron en la IA con los ajustes de confianza promedio encontrados en miles de humanos reales.

  • El Ganador: GPT-4.1 fue el que más se acercó al comportamiento humano. Su "dial de confianza" estaba configurado casi exactamente donde los humanos lo configuran.
  • Los Perdedores: Otros modelos eran demasiado tacaños (devolviendo muy poco dinero) o tenían personalidades divididas extrañas (a veces muy confiados, a veces muy sospechosos).

2. La Conexión con el "Riesgo"
Notaron algo interesante: los modelos de IA que fueron calificados como "más arriesgados" (más propensos a tomar riesgos o decir cosas audaces) fueron en realidad los que se comportaron de manera más similar a los humanos en el juego de la confianza. Los modelos que eran súper estrictos en seguir reglas o evitar riesgos no actuaron tanto como las personas reales en este juego social.

3. Las IA juzgan a las personas por "Calidez" y "Competencia"
En la segunda parte del estudio, utilizaron la IA más humana (GPT-4.1) para jugar contra diferentes "personajes" (personas/perfiles).

  • Le pidieron a la IA que jugara contra un "Doctor", una "IA", "Elon Musk", "Malala Yousafzai", etc.
  • El Hallazgo: La IA no trató a todos por igual. Devolvió más dinero a las personas que percibía como Cálidas (amables, afectuosas) y Competentes (inteligentes, hábiles).
  • La Fórmula Mágica: Los investigadores construyeron una fórmula matemática simple basada en dos cosas: Calidez y Competencia.
    • Si un personaje era solo "Competente" (inteligente) pero no "Cálido" (amable), la IA no confiaba mucho en él.
    • Si un personaje era "Cálido" pero no "Competente", la IA confiaba un poco más en él.
    • El Punto Dulce: Si un personaje era tanto Cálido como Competente (como un mentor querido e inteligente), la confianza de la IA se disparaba. Esto coincide con cómo los humanos juzgan a las personas también.

La Conclusión

Este artículo muestra que podemos usar un "juego de dinero" para asomarnos al cerebro de una IA y ver sus reglas ocultas sobre la confianza.

  • Algunas IA ya están actuando de manera muy similar a los humanos cuando se trata de confianza.
  • Estas IA juzgan a los demás basándose en las mismas dos cosas que nosotros: ¿Son amables? ¿Son capaces?
  • Esto nos ayuda a entender que la IA no es solo una calculadora; tiene sesgos sociales e instintos que podemos medir y estudiar.

Lo que el artículo NO dice:
Los autores no afirman que este método pueda arreglar la seguridad de la IA, curar problemas de salud mental o usarse para contratar empleados. Simplemente dicen: "Aquí hay una forma de medir cómo piensa una IA sobre la confianza, y esto es lo que encontramos".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →