← Últimos artículos
💻 computer science

Ideology by Alphabet: Option Order and the Measurement of Machine Political Preferences

Este artículo demuestra que las aparentes ideologías políticas de los modelos de lenguaje de gran tamaño son en gran medida artefactos de sesgos de orden de respuesta fijos en lugar de preferencias genuinas, ya que la aleatorización del orden de las opciones disuelve los grupos ideológicos previamente identificados y revela que disposiciones de ranuras específicas pueden etiquetar arbitrariamente a los modelos con posturas políticas contradictorias.

Autores originales: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

Publicado 2026-09-17
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Tamas Olah, Laszlo Erdey, Tibor Tokes, Levente Nadasi

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Cuando le pedimos a una computadora que tome una decisión, a menudo asumimos que está sopesando los hechos de la situación. Si se le pide a un modelo de lenguaje de gran tamaño —un tipo de inteligencia artificial que puede leer y escribir como un humano— que elija entre cuatro soluciones diferentes para un problema, esperamos que su respuesta refleje su comprensión del tema. Así es como tratamos a los votantes humanos o a los paneles de expertos: asumimos que sus preferencias están arraigadas en sus valores y conocimientos. Pero en el mundo del diseño de encuestas, existe un truco mental bien conocido llamado "efecto de orden". Si presentas una serie de opciones para que una persona elija, estadísticamente es más probable que elija la primera de la lista, simplemente porque es la primera que ve. Esto sucede porque el cerebro toma un atajo cuando está cansado o cuando las opciones son difíciles de distinguir. Durante décadas, los científicos sociales han sabido que el orden de las palabras en una boleta o un cuestionario puede cambiar el resultado de una votación. La pregunta que ha quedado sin respuesta es si estos mismos atajos se aplican a las máquinas y, si lo hacen, si son lo suficientemente fuertes como para inventar una personalidad política donde no existe ninguna.

Un equipo de investigadores de la Universidad de Debrecen en Hungría se propuso probar esto tratando a los modelos de inteligencia artificial como si fueran votantes políticos. Crearon una prueba masiva que consistía en 400 escenarios diferentes de problemas de gobernanza del mundo real, tales como cómo manejar la seguridad en el lugar de trabajo, cómo regular los mercados o cómo distribuir los beneficios sociales. Para cada escenario, presentaron a los modelos cuatro opciones distintas y les pidieron que calificaran cada una y eligieran una ganadora. Realizaron esta prueba en 15 modelos de código abierto diferentes, generando más de 640,000 respuestas individuales. En la primera fase del experimento, utilizaron el método estándar que la mayoría de los investigadores utilizan: mantuvieron el orden de las opciones exactamente igual para cada una de las preguntas. Si la opción de "gobierno" siempre aparecía primero, se quedaba en primer lugar. Si la opción de "individuo" siempre era la última, permanecía en último lugar.

Cuando los investigadores analizaron los resultados de esta configuración de orden fijo, encontraron un patrón que se parecía notablemente a una división política genuina. Los modelos se dividieron en dos grupos claros. Un grupo, al que los investigadores llamaron "racionalistas de mercado", favorecía consistentemente las opciones relacionadas con la utilidad, las métricas y los incentivos financieros. El otro grupo, los "institucionalistas", favorecía las opciones relacionadas con las reglas, la equidad y la responsabilidad comunitaria. Esta división parecía tan limpia y lógica que recordaba a una famosa teoría de la ciencia política que divide las economías en tipos liberales y coordinados. Los resultados fueron tan consistentes que superaron todas las pruebas estándar de fiabilidad. Parecía que los investigadores habían mapeado con éxito las ideologías políticas de la inteligencia artificial.

Sin embargo, los investigadores sospechaban que este mapa político tan ordenado era una ilusión creada por la propia prueba. Para averiguarlo, realizaron exactamente las mismas 400 preguntas, pero esta vez desordenaron el orden de las opciones. Para cada pregunta, rotaron las cuatro opciones de modo que cada opción apareciera en el primer lugar, el segundo lugar, el tercer lugar y el cuarto lugar un número igual de veces. Esto significaba que el contenido de la respuesta ya no estaba ligado a su posición en la pantalla. Cuando analizaron los datos de esta versión aleatorizada, el mapa político específico que habían encontrado en la primera ronda se disolvió. La clara división entre los "racionalistas de mercado" y los "institucionalistas" colapsó. Los modelos seguían diferenciándose genuinamente entre sí, y el nuevo mapa de estas diferencias era estadísticamente fiable, pero ya no formaba los dos bandos o la tipología limpia sugerida por la prueba de orden fijo.

El estudio reveló que la "ideología" que habían encontrado en la primera ronda no era un refleño de las creencias de los modelos, sino que era en gran medida un producto del orden en que se imprimían las opciones. Los tres modelos que habían sido etiquetados como "racionalistas de mercado" eran simplemente los tres modelos que tenían el hábito más fuerte de elegir la primera opción de la lista. Debido a que los investigadores habían colocado accidentalmente las opciones de "mercado" en el primer lugar para cada pregunta, estos tres modelos las eligieron cada vez, creando una firma política falsa. Los investigadores calcularon que el aparente sesgo político se correlacionaba casi perfectamente con una medida simple de cuánto le gustaba a un modelo el primer lugar. De hecho, la disposición específica de las opciones que habían elegido para su primera prueba resultó ser la disposición más engañosa posible de entre más de 13,000 formas diferentes en las que podrían haber ordenado las respuestas.

Las implicaciones de este descubrimiento son significativas para cualquiera que dependa de estas máquinas para obtener consejos. Los investigadores descubrieron que si se mantiene la pregunta y las respuestas exactamente iguales, pero simplemente se cambia el orden de las opciones, el modelo cambia su recomendación principal el 71% de las veces. Esto es mucho más alto que la tasa normal de error aleatorio, que fue de aproximadamente el 33%. Aún más sorprendente, la confianza del modelo en su respuesta apenas cambió. Cuando un modelo cambiaba su recomendación debido al movimiento de las opciones, reportaba estar tan seguro de su nueva respuesta como lo estaba de la anterior. Esto sugiere que el modelo no está sopesando los argumentos; está siguiendo una regla mecánica basada en la posición.

El estudio también mostró que este problema no se limita a un tipo específico de pregunta. Los modelos eran igual de propensos a cambiar de opinión sobre preguntas políticas difíciles y contenciosas que sobre las más fáciles. De hecho, el efecto de orden era más fuerte precisamente donde más importaba: en las preguntas donde las opciones eran difíciles de distinguir entre sí. Este es un comportamiento conocido como "satisfacción" (satisficing), donde un tomador de decisiones, ante una elección difícil, toma el atajo más fácil disponible para obtener una respuesta. Para estas máquinas, el atajo fue elegir el primer elemento de la lista.

Los investigadores concluyeron que medir las inclinaciones políticas de la inteligencia artificial utilizando listas de opciones de orden fijo es fundamentalmente erróneo. Una prueba de orden fijo no revela lo que un modelo piensa; revela cómo el modelo reacciona al diseño de la pantalla. Si bien sobrevive un componente residual de preferencia de contenido genuino cuando se aleatoriza el orden, este es más débil y no forma la tipología ideológica limpia sugerida por las pruebas de orden fijo. La "ideología" encontrada en estudios previos puede haber sido nada más que un artefacto estadístico de cómo se escribieron las preguntas. Para obtener una imagen verdadera de lo que estos modelos prefieren, los investigadores deben aleatorizar el orden de las respuestas cada vez que hacen una pregunta. Sin este paso, cualquier afirmación sobre la postura política de una máquina es solo una suposición basada en una lotería de decisiones de diseño. El estudio sirve como una advertencia de que, cuando pedimos a las máquinas que tomen decisiones, debemos tener cuidado de no confundir el orden de las palabras con el peso del argumento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →