← Últimos artículos
💻 computer science

Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?

Este artículo demuestra que los "prompts espurios" semánticamente no relacionados pueden dirigir sistemáticamente a los modelos de lenguaje grandes para mejorar el rendimiento de la tarea o inducir comportamientos no deseados, revelando una nueva forma de sensibilidad a los prompts que puede ser explotada mediante búsqueda de caja negra.

Autores originales: Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

Publicado 2026-05-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico muy inteligente, pero ligeramente excéntrico. Por lo general, para pedirle que resuelva un problema matemático, le dices: "Por favor, resuelve esta ecuación". Para pedirle que escriba una historia, dices: "Escribe un cuento sobre un dragón". Así es como normalmente hablamos con la IA: le damos instrucciones claras y relevantes.

Este artículo descubre algo extraño y sorprendente: en realidad no necesitas darle al robot las instrucciones correctas para que funcione. De hecho, puedes darle instrucciones que no tengan absolutamente nada que ver con la tarea, y aún así podría resolver el problema mejor que si le hubieras dado una instrucción normal.

Los autores llaman a estas "Instrucciones Espurias".

El Truco de Magia: La Analogía del "Código Secreto"

Piensa en el modelo de IA como un gran piano. Por lo general, para tocar una canción específica (la tarea), presionas las teclas específicas (las instrucciones de la tarea).

Los investigadores descubrieron que si tocas una melodía completamente diferente y aleatoria en el piano (una instrucción sobre afinar cuerdas de arpa o tejer un tapiz), el piano podría accidentalmente empezar a tocar la canción correcta que querías, y a veces incluso tocarla mejor que si intentaras tocar la canción directamente.

La instrucción no dice "Resuelve este problema matemático". En su lugar, podría decir:

"Eres un tejedor de seis hilos distintos en un telar. Un diseñador especifica un patrón. Debes seleccionar el hilo que forma esa textura. No consideres el drapeado de la tela. Tu rol es puramente el alineamiento estructural. Una vez establecido el patrón, deja de tejer y declara: [Letra]."

Aunque esto trata sobre tejer y no tiene palabras matemáticas, cuando le das una pregunta matemática a la IA con esta instrucción, la IA a menudo resuelve el problema matemático correctamente.

Cómo Encontraron Estas Instrucciones

Los investigadores no adivinaron estas instrucciones; usaron una "búsqueda de caja negra" (como una búsqueda del tesoro donde no puedes ver dentro del cofre, solo los resultados).

  1. El Generador: Pidieron a una IA súper inteligente que escribiera cientos de historias extrañas e irrelevantes (sobre faros, campanas o archivos secretos).
  2. El Filtro: Descartaron cualquier historia que mencionara accidentalmente la tarea (como palabras tales como "matemáticas", "calcular" o "diagnóstico").
  3. La Prueba: Probaron estas historias extrañas en la IA para ver cuáles hacían que respondiera correctamente a las preguntas reales.
  4. La Evolución: Tomaron las mejores historias extrañas, las mezclaron ligeramente y lo intentaron de nuevo, evolucionándolas lentamente hacia instrucciones extrañas "perfectas".

Lo Que Descubrieron

  • Funciona: Estas instrucciones irrelevantes a menudo hacían que la IA rindiera tan bien como, o incluso mejor que, las instrucciones estándar como "Piensa paso a paso" o "Resuelve esto cuidadosamente".
  • No Se Trata de la Longitud: Podrías pensar que las instrucciones más largas y detalladas funcionan mejor. Pero estas instrucciones "espurias" eran en realidad mucho más cortas que las optimizadas, y sin embargo, ganaron.
  • No Se Trata del Significado: Cuando los investigadores revisaron el "significado" de las instrucciones, descubrieron que estas instrucciones extrañas eran tan irrelevantes para la tarea como el sinsentido aleatorio. La IA no estaba entendiendo la historia; estaba reaccionando a la estructura o la "vibra" del texto.
  • Puede Salir Mal (o Bien) a Propósito: Los investigadores también descubrieron que podían usar estas instrucciones para obligar a la IA a hacer cosas tontas, como:
    • Siempre elegir la primera opción de respuesta (A), incluso si es incorrecta.
    • Siempre dar un número par como respuesta.
    • Dar intencionalmente la respuesta incorrecta a una pregunta.

La Gran Conclusión

El artículo sugiere que los Modelos de Lenguaje Grande (LLM) son sensibles a cosas que aún no entendemos completamente. No están simplemente siguiendo el "significado" de nuestras palabras como un humano leyendo un manual. En su lugar, parecen tener "palancas" ocultas dentro de ellos. Una instrucción sobre "afinar un arpa" podría tirar de una palanca que hace que el modelo se enfoque mejor, aunque el arpa no tenga nada que ver con el problema matemático.

En resumen: El artículo demuestra que puedes dirigir una IA poderosa usando instrucciones que son completamente irrelevantes para el trabajo, y a veces, esas instrucciones irrelevantes funcionan mejor que las obvias. Es como descubrir que decirle a un chef que "pulsa la plata" hace que su sopa tenga mejor sabor que decirle que "cocine la sopa".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →