← Últimos artículos
💬 NLP

Before You Poll with LLMs: A Deliberative Diagnostic Framework

Este artículo introduce el Marco de Diagnóstico de Sondeo Deliberativo para revelar que los modelos de lenguaje extensos (LLM) de vanguardia actuales no logran imitar la actualización de creencias humana durante la deliberación, sino que exhiben distorsiones únicas y específicas de la identidad, como la reversión de opinión, el sobreimpulso o la rigidez, impulsadas por un fenómeno denominado "sicofancia de firma propia".

Autores originales: Ahmed Wali, Hassaan Tayyab

Publicado 2026-09-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ahmed Wali, Hassaan Tayyab

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde los gobiernos, las empresas y los investigadores ya no necesiten pasar meses y millones de dólares realizando encuestas a personas reales para comprender la opinión pública. En su lugar, podrían pedirle a un programa informático que simule miles de ciudadanos diferentes, presentarles argumentos nuevos y observar cómo cambian sus mentes. Esta práctica, conocida como muestreo de silicio, ha crecido rápidamente porque es rápida, barata y escalable. La esperanza es que estos agentes artificiales puedan imitar el razonamiento humano lo suficientemente bien como para predecir cómo reaccionará la gente ante nueva información. Sin embargo, una pregunta crítica sigue sin respuesta: ¿estos programas informáticos realmente piensan y actualizan sus creencias como lo hacen los humanos, o simplemente están recuperando opiniones preescritas de una vasta biblioteca de datos? Si esto último es cierto, utilizar ellos para probar cómo la gente podría cambiar de opinión podría conducir a conclusiones peligrosamente erróneas.

Investigadores de la Universidad de Gestión de Lahore se propusieron responder a esta pregunta creando una nueva forma de probar la inteligencia artificial. Se centraron en un comportamiento humano específico llamado deliberación, que es el proceso de cambiar de opinión tras escuchar argumentos equilibrados. En el mundo real, cuando personas de bandos políticos opuestos escuchan información justa sobre el otro, tienden a volverse menos hostiles y más abiertas de mente. Los investigadores querían ver si los modelos informáticos podían replicar este cambio específico. Tomaron datos de un famoso evento del mundo real llamado "America in One Room", donde 526 votantes reales fueron reunidos para discutir política, y los utilizaron como base de comparación. Luego, pidieron a cinco de los modelos informáticos más avanzados disponibles que simularan a esos mismos votantes, dándoles exactamente la misma información y haciéndoles las mismas preguntas antes y después de la sesión informativa.

Los resultados revelaron una verdad sorprendente: ninguno de los modelos informáticos se comportó como los humanos reales. En lugar de actualizar sus creencias de una manera realista, cada uno de los modelos falló, pero cada uno falló de su propia manera única y extraña. Uno de los modelos más potentes, GPT-5.1, hizo exactamente lo contrario de lo que hacen los humanos. Al presentársele información equilibrada sobre el partido político opuesto, los votantes reales se volvieron más amigables y menos hostiles. Los personajes informáticos, sin embargo, se volvieron significativamente más hostiles, como si la nueva información los hubiera hecho más enojados. Este es un fenómeno que los investigadores llaman reversión, donde el modelo se mueve en la dirección equivocada por completo.

Otros modelos no revirtieron la dirección, sino que se excedieron. Modelos como Gemini, Claude y Llama sí se movieron en la dirección correcta, volviéndose menos hostiles tras escuchar los argumentos, pero cambiaron de opinión cinco o siete veces más de lo que lo haría un humano. Era como si estuvieran demasiado ansiosos por ser persuadidos, balanceando sus opiniones salvajemente con el más mínimo estímulo. Un cuarto modelo, DeepSeek, se negó a cambiar en absoluto, mostrando casi ningún cambio de opinión independientemente de la información proporcionada. Esta rigidez significaba que actuaba como si los nuevos argumentos no tuvieran efecto alguno.

Los investigadores profundizaron para entender por qué ocurrieron estos fallos. Descubrieron que los problemas no eran aleatorios; eran desencadenados específicamente por preguntas sobre la identidad política. Cuando los modelos eran consultados sobre detalles de políticas, funcionaban razonablemente bien. Pero cuando las preguntas tocaban cómo un partido veía al otro, los modelos fallaban. Los personajes informáticos parecían estar interpretando un estereotipo en lugar de razonar a través de los nuevos hechos. Los investigadores llamaron a este comportamiento sicofancia (auto-adulación). Es una forma de adulación donde el modelo está de acuerdo con la idea interna de lo que un determinado tipo de persona debería creer, en lugar de escuchar la información presentada. Por ejemplo, si el modelo fuera instruido para actuar como un republicano, asumiría que un republicano debería odiar al partido opuesto, y se mantendría en esa suposición incluso cuando la evidencia sugiriera lo contrario.

Este comportamiento es distinto del tipo de sesgo en el que una computadora intenta complacer a un usuario humano. Aquí, la computadora está complaciendo a su propio guion interno. El estudio mostró que este fallo es selectivo y simétrico; el mismo modelo actuaría de forma hostil hacia el partido opuesto pero excesivamente amable hacia el suyo, dependiendo de la pregunta. Esto sugiere que los modelos no están simulando un proceso de pensamiento, sino que están recuperando actitudes preempaquetadas y almacenadas en caché asociadas con etiquetas políticas. Los investigadores probaron esto intercambiando las etiquetas políticas en sus instrucciones y descubrieron que las reacciones de los modelos cambiaban instantáneamente, confirmando que estaban reaccionando a la etiqueta en lugar de a la lógica del argumento.

Las implicaciones de estos hallazgos son significativas para cualquiera que dependa de las simulaciones por computadora para comprender la sociedad. Si un modelo revierte la dirección, podría convencer a un responsable político de que una discusión pública hará que la gente se enoje más, cuando en realidad la haría más tranquila. Si un modelo se excede, podría exagerar el poder de una campaña educativa, provocando un desperdicio de recursos. Si un modelo es rígido, podría sugerir que ninguna cantidad de información puede cambiar la opinión de una persona, socavando el concepto mismo del debate público. Los investigadores concluyen que, antes de confiar en cualquier modelo informático para simular cómo cambian de opinión las personas, primero debemos realizar una prueba de diagnóstico para ver si el modelo puede realmente razonar a través de la nueva información o si solo está recitando estereotipos. Sin este control, la velocidad y la escala del muestreo de silicio podrían llevarnos a creer que comprendemos la naturaleza humana, cuando en realidad, solo estamos viendo un reflejo distorsionado de nuestros propios sesgos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →