Why is prompting hard? Understanding prompts on binary sequence predictors
Este artículo investiga los desafíos de la ingeniería de prompts enmarcándolos como la búsqueda de secuencias de condicionamiento óptimas en predictores de secuencias, revelando mediante experimentos controlados y análisis de modelos de vanguardia que los prompts óptimos suelen ser poco intuitivos, difíciles de identificar incluso con una búsqueda exhaustiva y frecuentemente subóptimos al utilizar métodos estándar basados en demostraciones.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un loro superinteligente y altamente entrenado. Este loro ha leído millones de libros, visto incontables películas y escuchado cada programa de radio jamás creado. Sabe predecir la siguiente palabra en una oración mejor que nadie. Este es tu modelo de IA.
Ahora, quieres que este loro realice un truco específico: contar un chiste, escribir un poema triste o resolver un problema matemático. Lo haces dándole un prompt (una instrucción de unas pocas palabras o un ejemplo para ponerlo en marcha).
Este artículo plantea una pregunta simple pero profunda: ¿Por qué es tan difícil encontrar las palabras perfectas para darle al loro? A veces, las instrucciones que funcionan mejor parecen completamente extrañas, sin sentido o incluso "incorrectas" para un humano. ¿Por qué un prompt que parece sinsentido funciona mejor que una instrucción clara y lógica?
Los autores decidieron dejar de adivinar y empezar a probar. Construyeron un mundo pequeño y controlado para entender qué sucede realmente dentro del cerebro del loro.
El Experimento: El Loro de la Moneda
En lugar de usar una IA real y compleja, crearon un "loro" simple que solo entiende Cara y Cruz (como el lanzamiento de una moneda).
- El Entrenamiento: Enseñaron a este loro mostrándole miles de lanzamientos de moneda. Pero aquí está el truco: no solo le mostraron monedas justas. Le mostraron monedas con sesgos diferentes. Algunas caían en Cara el 20% de las veces, otras el 90%, y algunas eran una mezcla de ambas. El loro aprendió a adivinar el siguiente lanzamiento basándose en el patrón que vio durante su entrenamiento.
- La Tarea: Ahora, querían que el loro actuara como una moneda específica que cae en Cara el 70% de las veces. Preguntaron: "¿Cuál es la mejor secuencia de Caras y Cruces para mostrar al loro para que empiece a adivinar el 70% de Caras?"
La Gran Sorpresa: Los Prompts "Incorrectos" Funcionan Mejor
Podrías pensar que la mejor manera de enseñarle al loro a adivinar el 70% de Caras es mostrarle una larga lista con un 70% de Caras y un 30% de Cruces. Eso parece lógico, ¿verdad?
El artículo descubrió que esto a menudo es incorrecto.
En muchos casos, el prompt óptimo (el que realmente funciona mejor) era una secuencia que no se parecía en nada a la tarea.
- La Analogía: Imagina que quieres enseñarle a un estudiante acostumbrado a estudiar en una biblioteca silenciosa a estudiar en una cafetería ruidosa. Podrías pensar que mostrarle una grabación de una cafetería ruidosa es la mejor manera de prepararlo. Pero el artículo descubrió que, a veces, la mejor manera de prepararlo es mostrarle una secuencia de silencio que engaña sutilmente a su cerebro para que espere ruido.
- La Realidad: El prompt "mejor" depende enteramente de cómo fue entrenado el loro (su distribución de preentrenamiento). Si el loro fue entrenado con una mezcla específica de sesgos de moneda, las "palabras mágicas" para hacer que se comporte de cierta manera podrían ser una secuencia de todas Caras, o una mezcla extraña de 10 Caras y 2 Cruces. Para un humano que mira solo la tarea, esto parece un error. Pero para el loro, es la llave perfecta que desbloquea el comportamiento correcto.
¿Por qué es tan difícil averiguar esto?
El artículo destaca tres razones principales por las que encontrar estas "palabras mágicas" es una pesadilla:
1. El Problema de la "Receta Oculta"
El comportamiento del loro está moldeado por una "receta" secreta (la distribución de preentrenamiento) que usualmente no conocemos.
- Analogía: Imagina que estás intentando sintonizar una radio a una estación específica. No sabes cómo suena la estación y no sabes cómo está construida la radio. Solo giras la perilla. A veces, girarla al lugar "obvio" te da estática. Tienes que girarla a un lugar extraño y aleatorio para obtener sonido claro. Sin conocer el cableado interno de la radio, no puedes explicar por qué funciona ese lugar extraño.
2. El Problema del "Paisaje Plano"
Los autores visualizaron la búsqueda del mejor prompt como caminar por un paisaje montañoso.
- Analogía: Estás buscando el pico más alto (el mejor prompt). En un mundo perfecto, hay un pico de montaña afilado y es fácil de encontrar. Pero en los experimentos de este artículo, el "paisaje" a menudo es una meseta plana. Hay cientos de prompts diferentes que son casi igualmente buenos.
- La Consecuencia: Si intentas encontrar el mejor prompt usando una pequeña cantidad de datos (como un pequeño lote de prueba), podrías elegir accidentalmente un prompt "suficientemente bueno" que en realidad es diferente del verdadero mejor. Si ejecutas la prueba nuevamente con un lote ligeramente diferente, podrías elegir un prompt "suficientemente bueno" diferente. Esto hace que los resultados sean poco fiables y difíciles de interpretar.
3. La Trampa de la "Demo del Experto"
Una forma popular de enseñar a la IA es mostrarle ejemplos de un experto realizando la tarea (por ejemplo, "Así es como juega un gran maestro de ajedrez").
- El Hallazgo: El artículo mostró que mostrar ejemplos de expertos a menudo es menos efectivo que usar un prompt extraño y optimizado.
- Analogía: Imagina que quieres que un robot juegue al ajedrez perfectamente. Podrías mostrarle 100 partidas jugadas por un Gran Maestro. O podrías darle un código extraño y corto que fuerce a su cerebro al "modo Gran Maestro". El artículo descubrió que el código extraño a menudo funciona mejor que las 100 partidas. Los ejemplos de expertos son demasiado "típicos" y no tienen en cuenta los sesgos de entrenamiento específicos del robot.
¿Qué pasa con la IA real (como los chatbots)?
Los autores probaron estas ideas en modelos de lenguaje grandes reales (como GPT-2 y Gemma) utilizando reseñas de películas.
- Encontraron los mismos patrones: los mejores prompts para generar una reseña "positiva" no siempre eran palabras que sonaran positivas. A veces, eran palabras cortas, extrañas o incluso que sonaban negativas que de alguna manera desencadenaban la respuesta correcta.
- También descubrieron que para encontrar el mejor prompt de manera fiable, necesitas una enorme cantidad de datos (miles de ejemplos), no solo los pequeños lotes (alrededor de 200) que la gente suele usar. Con lotes pequeños, solo estás adivinando.
La Conclusión
El artículo concluye que el prompting es difícil porque estamos intentando dirigir una máquina sin conocer su historia completa.
- El prompt "Mejor" es Relativo: No existe un prompt "mejor" universal. El mejor prompt depende de los sesgos específicos y ocultos de los datos de entrenamiento de la IA.
- La Intuición Falla: Lo que parece lógico para un humano (mostrarle a la IA lo que quieres) a menudo falla porque no tiene en cuenta la "matemática" interna de la IA.
- La Fiabilidad es Baja: A menos que busques exhaustivamente y utilices conjuntos de datos masivos, los prompts que encuentres podrían ser adivinanzas afortunadas que no funcionan de manera consistente.
En resumen, el artículo sugiere que la "magia" del prompting no se trata solo de escribir buenas instrucciones; se trata de hackear los sesgos estadísticos ocultos de la IA de maneras que a menudo nos parecen completamente contraintuitivas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.