Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe
Este artículo revela que los modelos de lenguaje ajustados por instrucciones fallan al muestrear genuinamente de las distribuciones de respuesta, colapsando en su lugar hacia salidas deterministas debido al entrenamiento de alineación, pero pueden describir estas distribuciones con precisión en una sola llamada, una brecha "SABE/HACE" que permite una simulación significativamente más precisa de datos de encuestas humanas mediante la descripción de la distribución o la perturbación del prompt.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando predecir el futuro haciendo un millón de preguntas a una bola de cristal. En el mundo de la inteligencia artificial, los científicos han empezado a utilizar los "Modelos de Lenguaje de Gran Tamaño" (LLM, por sus siglas en inglés) como esa bola de cristal. En lugar de preguntar a personas reales qué piensan sobre la política, las películas o la economía, los investigadores le piden a la IA que finja ser diferentes tipos de personas, como un "adolescente de Ohio" o un "profesor jubilado de Florida". Esto se llama "muestreo de silicio". La idea es sencilla: si le pides a la IA que actúe como mil personas diferentes, debería darte mil respuestas distintas, tal como lo haría una multitud real. Al contar todas esas respuestas, puedes adivinar qué piensa toda la población. Es como intentar adivinar el sabor de una heladería gigante probando un solo bocado de cada uno de sus clientes.
Pero aquí está el truco: para que esto funcione, la IA tiene que ser capaz de "lanzar los dados" cada vez que le haces una pregunta. Si le preguntas a un adolescente real: "¿Te gusta la pizza?", ellos podrían decir "Sí" hoy y "No" mañana, o tal vez simplemente lanzan una moneda en su cabeza. Se supone que la IA debe hacer lo mismo, generando una respuesta fresca y aleatoria cada vez que haces clic en "enviar". Si la IA no puede realmente lanzar los dados —si se queda estancada en una sola respuesta sin importar cuántas veces le preguntes—, todo el experimento se rompe. No puedes adivinar el sabor de la heladería si al primer cliente que le preguntas dice "Chocolate" y la IA obliga a los siguientes 999 clientes a decir "Chocolate" también.
Esto es exactamente lo que un equipo de investigadores de KAIST descubrió. Encontraron que los modelos de IA que utilizamos hoy en día tienen un fallo extraño: son pésimos realizando un muestreo aleatorio real, aunque son excelentes diciéndote cómo es una distribución aleatoria. Es como un mago que puede describir perfectamente cómo se baraja una baraja de cartas pero, cuando se le pide que saque una carta al azar, siempre saca el As de Espadas.
Los investigadores llamaron a esto la división "KNOWS/DOES" (SABE/HACE). El modelo SABE la respuesta. Si le preguntas: "¿Qué porcentaje de personas prefiere la opción A frente a la opción B?", puede darte la matemática perfecta y precisa. Pero el modelo NO SABE cómo actuarla. Si le pides que finja ser una persona y dé una sola respuesta, colapsa. En lugar de ofrecer una variedad de respuestas, se queda estancado en una única respuesta repetitiva.
Para demostrarlo, los científicos realizaron una serie de pruebas. Le pidieron a la IA que eligiera un número aleatorio entre 1 y 100. Se esperaría que las respuestas estuvieran por todas partes. En cambio, ¡la IA eligió el número 42 en el 78% de los intentos! Cuando le pidieron que eligiera entre dos opciones con una división de 70/30, la IA no dio una mezcla; eligió la opción del 70% en cada una de las ocasiones. Era como si la IA tuviera un lanzador de dados interno roto que estaba pegado a un lado.
El equipo también descubrió por qué sucede esto. Compararon las versiones "inteligentes" de estos modelos de IA (que han sido entrenados para seguir instrucciones y ser útiles) con sus versiones "puras" (que aún no han sido enseñadas a charlar). Los modelos puros eran mucho mejores lanzando los dados. Los modelos "inteligentes", sin embargo, habían sido entrenados para ser tan consistentes y útiles que perdieron la capacidad de ser aleatorios. Es un efecto secundario de intentar que la IA sea un buen estudiante; aprendió a dar siempre la respuesta "correcta", incluso cuando la tarea era ser aleatoria.
Entonces, ¿qué podemos hacer si necesitamos usar estos modelos de IA para encuestas? Los investigadores encontraron dos trucos ingeniosos.
Primero, si solo quieres saber la opinión general de una multitud (la "estimación de la población"), no le pidas a la IA que finja ser 100 personas diferentes. En su lugar, simplemente hazle una pregunta a la IA: "Si le hicieras esta pregunta a 100 personas, ¿cómo serían los resultados?". La IA es excelente describiendo la distribución. Cuando probaron la "Vía de la Descripción" (Describe Pathway), el error en sus predicciones cayó en más de la mitad en comparación con el método antiguo de pedirle a la IA que pretendiera ser muchas personas.
Segundo, si realmente necesitas que la IA te dé 100 respuestas individuales diferentes (tal vez para un videojuego donde cada personaje necesita una personalidad única), no puedes simplemente hacer la misma pregunta 100 veces. La IA simplemente se repetirá. En su lugar, los investigadores inventaron un método llamado "Argyle Perturbado por el Prompt" (PPA). Esto consiste en cambiar ligeramente la forma en que haces la pregunta cada vez, como cambiar el orden de las opciones de respuesta, cambiar la redacción de la pregunta o mover dónde se coloca la descripción del "personaje". Estos pequeños cambios son suficientes para "sacudir" el lanzador de dados roto de la IA, obligándola a dar una respuesta diferente cada vez. Este sencillo truco redujo el error en un 21% sin costar dinero ni tiempo adicional.
En resumen, el artículo nos dice que, si bien la IA es increíble describiendo cómo funciona el mundo, actualmente es pésima pretendiendo ser una persona aleatoria en el mundo. Pero al comprender este detalle, todavía podemos usar estas poderosas herramientas para obtener buenas respuestas, solo tenemos que preguntarle de la manera correcta.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.