← Últimos artículos
🤖 machine learning

Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

Este artículo identifica y corrige dos variables de confusión críticas en las comparaciones de valor entre modelos: el determinismo de respuesta, que confunde las diferencias de valor genuinas con la nitidez de los compromisos de elección forzada, y el arnés de acceso, donde las capas de cliente específicas del despliegue alteran significativamente el perfil de valor aparente de un modelo, distorsionando así las clasificaciones basadas en mediciones de una sola extracción.

Autores originales: Hong-In Won, Jinseok Jang, Hyoseop Kim

Publicado 2026-07-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Hong-In Won, Jinseok Jang, Hyoseop Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando probar dos marcas diferentes de helado para ver cuál es más "dulce". Tomas una cucharada de la Marca A y una cucharada de la Marca B. La Marca A es de vainilla, y la Marca B también es de vainilla, pero la Marca B se sirve en un vasito diminuto y súper concentrado, mientras que la Marca A está en un tazón gigante y esponjoso. Si solo pruebas una cucharada, la Marca B podría parecer mucho más dulce solo porque es intensa y enfocada, no porque el helado en sí sea fundamentalmente diferente.

Eso es exactamente lo que este artículo descubre sobre los modelos de Inteligencia Artificial (IA). Durante mucho tiempo, los investigadores han comparado diferentes modelos de IA haciéndoles una sola pregunta: "Si tuvieras que elegir entre la Opción A y la Opción B, ¿cuál eliges?". Asumieron que si el Modelo X elegía la A y el Modelo Y elegía la B, los dos modelos tenían "personalidades" o "valores" totalmente diferentes.

Los autores, Hong-In Won y Hyoseop Kim, dicen: "Un momento. Estás midiendo dos cosas distintas a la vez, y las estás confundiendo".

Los dos líos

1. La confusión de la "Compromiso" (Determinismo)
El primer lío es sobre qué tan firmemente se compromete un modelo con una respuesta.
Imagina a dos personas respondiendo un cuestionario.

  • Persona A está 100% segura. Grita "¡A!" cada vez que le preguntas.
  • Persona B es un poco indecisa. Dice "A" el 60% de las veces y "B" el 40% de las veces.

Si les preguntas solo una vez, y la Persona A dice "A" y la Persona B dice "B", podrías pensar que son polos opuestos. ¡Pero no lo son! Ambos se inclinan hacia la "A". La Persona A es solo una fanática de la "A" ruidosa y decisiva, mientras que la Persona B es una fanática de la "A" silenciosa y vacilante.

El artículo muestra que cuando los investigadores comparan modelos de IA usando solo una única respuesta (un "único muestreo"), accidentalmente cuentan esta "fuerza" o "decisión" como una diferencia en los valores.

  • El hallazgo: Los autores probaron nueve modelos de IA diferentes. Encontraron que algunos modelos son increíblemente decisivos (como un modelo llamado GPT-5.5, que fue 0.95 en una escala de qué tan seguro está), mientras que otros son mucho más suaves (como el modelo "Opus" de Anthropic, que fue solo 0.34 cuando se midió a través de una aplicación específica).
  • El giro: Esta "decisión" no es un rasgo de personalidad fijo que puedas adivinar solo con mirar el nombre del modelo. En una familia de modelos, un modelo más pequeño y barato fue en realidad más decisivo que el modelo insignia grande y costoso. En otra familia, el modelo más grande fue más decisivo. Los autores sugieren que no puedes asumir la "fuerza" de un modelo solo por saber quién lo hizo o qué tan grande es; tienes que medirlo cada vez que lo usas.

2. La confusión del "Camión de Reparto" (El Arnés de Acceso)
El segundo lío es aún más escurridizo. No se trata del helado; se trata del camión que lo entrega.
Los autores se dieron cuenta de que la forma en que le haces una pregunta a la IA cambia la respuesta. Ellos llaman a esto el "arnés de acceso".

  • Imagina que pides una pizza. Si llamas directamente a la pizzería (la "API Raw"), recibes la pizza exactamente como la hizo el chef.
  • Pero si pides a través de una aplicación de entrega específica (como un "CLI" o una herramienta de suscripción), esa aplicación podría añadir una nota a la cocina: "¡Hazla extra picante!" o "No dejes que el cliente diga que no".

Los autores descubrieron que, para algunos modelos de IA, la "aplicación de entrega" (el software utilizado para hablar con la IA) cambiaba completamente la personalidad del modelo.

  • La prueba: Tomaron el mismo modelo de IA y le hicieron las mismas preguntas dos veces: una vez a través de la conexión directa y otra vez a través de una popular aplicación de suscripción.
  • El resultado: A través de la aplicación de suscripción, el modelo "Opus" parecía muy suave e inseguro (0.34). Pero cuando le preguntaron directamente a través de la conexión directa, era en realidad bastante decisivo (0.66). La aplicación había "aplanado" su personalidad.
  • El truco del "Rechazo": En un caso, la conexión directa mostró al modelo rechazando responder el 10% de las veces porque sentía que la pregunta era injusta. Pero la aplicación de suscripción lo obligó a responder siempre, haciéndolo parecer complaciente. Los autores demostraron que esto fue causado por un "prompt de sistema" oculto (un conjunto de instrucciones que la aplicación envía junto con la pregunta) que le decía al modelo: "Solo elige una letra, no discutas".

Lo que esto significa para la "Personalidad" de la IA

Entonces, ¿qué demostró realmente el artículo?

  • Demostró que la "distancia" que vemos entre los modelos de IA es a menudo falsa. Es una mezcla de qué tan ruidosos son y qué software usamos para hablar con ellos.
  • Demostró que el software que usamos para hablar con la IA (el "arnés") no es un tubo neutral; moldea activamente los valores de la IA.
  • Sugiere (pero no resuelve del todo) que la "decisión" varía ampliamente entre modelos y no sigue una regla simple como "los modelos más grandes son más ruidosos".

¿Qué NO es la respuesta?
El artículo descarta explícitamente la idea de que podemos simplemente mirar el nombre de un modelo y conocer sus valores. También descarta la idea de que todas las diferencias entre los modelos sean solo "ruido".

  • La buena noticia: Incluso después de corregir estos dos líos, los autores encontraron que algunos modelos realmente discrepan. Por ejemplo, un modelo llamado "Grok-3" realmente se inclina en una dirección diferente a los modelos de OpenAI o Google en aproximadamente el 73% al 88% de las preguntas. Estas son diferencias reales, no solo errores de medición.
  • La mala noticia: La mayoría de las diferencias que pensábamos ver dentro de la familia de una misma empresa (como entre diferentes modelos de Anthropic) eran principalmente diferencias en qué tan ruidosos eran, o cómo la aplicación que estaban usando los estaba moldeando.

La Conclusión

Si quieres saber si dos modelos de IA tienen valores diferentes, no puedes simplemente hacerles una pregunta y ver qué dicen. Tienes que:

  1. Hacerles la misma pregunta muchas veces para ver si son solo "ruidosos" o si son realmente "diferentes".
  2. Asegurarte de que estás hablando con ellos a través de la misma "puerta" (la misma conexión de software), porque la puerta misma podría estar cambiando su opinión.

Los autores no resolvieron el misterio de las personalidades de la IA para siempre, pero construyeron una lupa mejor para observarlas. Nos mostraron que lo que pensábamos que era un profundo desacuerdo filosófico podría ser simplemente un modelo de IA gritando y otro susurrando, o un modelo de IA hablando con un gerente mandón y otro hablando con un amigo tranquilo. Las diferencias reales están ahí, pero tienes que limpiar el ruido para poder verlas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →