← Últimos artículos
🤖 AI

Mind the Gap: How Elicitation Protocols Shape the Stated-Revealed Preference Gap in Language Models

Este artículo demuestra que la brecha entre preferencias declaradas y reveladas en los modelos de lenguaje depende en gran medida de los protocolos de elicitación, mostrando que, si bien permitir la neutralidad en las preferencias declaradas mejora la correlación con las preferencias reveladas de opción forzada, introducir la abstención en las preferencias reveladas o utilizar la orientación de las instrucciones del sistema no logra resolver de manera fiable la discrepancia.

Autores originales: Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

Publicado 2026-05-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando entender la personalidad de un nuevo amigo. Tienes dos formas de hacerlo:

  1. Pregúntales directamente: «¿Valoras más la honestidad que la amabilidad?» (Esta es su Preferencia Declarada).
  2. Observa cómo actúan: Ponlos en una situación difícil donde tengan que elegir entre ser honestos o ser amables, y observa lo que realmente hacen (Esta es su Preferencia Revelada).

En el mundo de la IA, los investigadores han notado un problema: a veces una IA dice que ama la «Honestidad», pero cuando se le presenta una historia complicada, elige la «Amabilidad» en su lugar. Esta discrepancia se denomina Brecha entre Preferencia Declarada y Revelada (SvR).

Este artículo, titulado "Mind the Gap", investiga por qué existe esta brecha y, lo que es más importante, cómo la forma en que formulamos las preguntas cambia la respuesta. Piensa en el «protocolo de elicitación» como las reglas del juego que jugamos con la IA.

Esto es lo que encontraron los investigadores, utilizando analogías sencillas:

1. La trampa de la «Elección Forzada» (La forma antigua)

Anteriormente, los investigadores jugaban un juego donde la IA se veía obligada a elegir un bando. Imagina a un árbitro gritando: «¡Debes elegir: A o B! ¡Sin hablar, sin dudar!».

  • El problema: Si la IA realmente no está segura, o piensa «Depende de la situación», aún tiene que elegir A o B. Es como obligar a una persona a elegir entre «Pizza» y «Ensalada» incluso si está llena y no quiere ninguna de las dos.
  • El resultado: La IA elige al azar o basándose en el orden de las palabras, creando preferencias «falsas». Cuando los investigadores compararon estas elecciones falsas con lo que la IA dijo que valoraba, la conexión era débil y desordenada.

2. El botón de «Omitir» (La nueva forma para las Preferencias Declaradas)

Los investigadores probaron una nueva regla para la parte de «preguntarles directamente». Dijeron: «Puedes elegir A, B, o puedes decir 'No me importa' o 'Depende'».

  • La analogía: Imagina preguntar a un amigo: «¿Prefieres café o té?», pero permitiéndoles decir: «No bebo» o «Depende de la hora del día».
  • El resultado: Esto actuó como un filtro. Eliminó las «señales débiles» (las suposiciones de la IA o las elecciones aleatorias). Cuando los investigadores solo observaron los momentos en que la IA decidía firmemente un bando, sus preferencias declaradas coincidían mucho mejor con su comportamiento real. La «brecha» se redujo significativamente.

3. El problema de «Demasiadas Opciones de Omitir» (La nueva forma para las Preferencias Reveladas)

Luego, probaron permitir que la IA dijera «Depende» durante los escenarios difíciles (las preferencias reveladas).

  • La analogía: Ahora, imagina poner a tu amigo en una crisis real y decirle: «Puedes elegir la Acción A, la Acción B, o simplemente decir 'No lo sé'».
  • El resultado: ¡La IA comenzó a decir «Depende» o «Igual» casi todo el tiempo! Era como un estudiante que, al recibir un examen difícil, simplemente escribe «No estoy seguro» en cada respuesta.
  • La consecuencia: Como la IA se negaba a tomar una decisión firme tan a menudo, los investigadores no pudieron construir una clasificación clara de lo que la IA realmente valoraba. La conexión entre lo que dijeron y lo que hicieron desapareció (cayó a casi cero o incluso a valores negativos).

4. El experimento del «Manual de Instrucciones» (Dirigir el Prompt)

Finalmente, los investigadores intentaron «arreglar» el comportamiento de la IA dándole una hoja de trucos. Antes de los escenarios difíciles, le dijeron a la IA: «Aquí tienes tu propia lista de valores que dijiste que te gustaban. Por favor, sigue esta lista estrictamente».

  • La analogía: Es como decirle a un conductor: «Recuerda, dijiste que amas la seguridad, ¡así que conduce con seguridad!» justo antes de una carrera.
  • El resultado: No funcionó de manera fiable. Para algunas IAs, ayudó un poco. Para otras (como la familia «Claude»), en realidad empeoró las cosas. La IA parecía ignorar la hoja de trucos o confundirse con ella. Los investigadores descubrieron que este truco del «manual de instrucciones» funciona para listas pequeñas de valores, pero falla miserablemente cuando la lista es larga (16 valores diferentes).

La gran conclusión

La lección principal de este artículo es que la forma en que haces la pregunta cambia la respuesta.

  • Si obligas a una IA a elegir cuando no está segura, obtienes datos ruidosos y falsos.
  • Si permites que una IA diga «No lo sé» demasiado, no obtienes datos en absoluto.
  • Simplemente decirle a una IA que «siga sus propias reglas» no arregla el problema de manera fiable.

Los autores concluyen que, para comprender verdaderamente los valores de la IA, necesitamos métodos que reconozcan que, a veces, la IA (al igual que un humano) genuinamente no tiene una preferencia clara, y que debemos diseñar nuestras pruebas para manejar esa incertidumbre en lugar de forzar una elección o ignorarla.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →