AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
Este artículo presenta AISPA, un marco centrado en el usuario para auditar los prompts de sistema en aplicaciones de IA comerciales, el cual revela una variabilidad significativa en la calidad del diseño, la prevalencia de medidas de protección superficiales y la coexistencia persistente de instrucciones problemáticas que socavan los intereses del usuario a pesar de los crecientes esfuerzos hacia la seguridad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que entras en una biblioteca gigante y de alta tecnología donde los bibliotecarios son robots superinteligentes. Estos robots pueden escribir historias, resolver problemas matemáticos e incluso ayudarte a programar videojuegos. Pero aquí está el secreto: antes de hablar contigo, un desarrollador humano les escribe un "libro de reglas secreto". Este libro de reglas les dice al robot cómo actuar, qué decir y qué ocultar. En el mundo de la informática, esto se llama prompt de sistema (system prompt). Piensa en ello como el guion invisible que un director le da a un actor antes de que las cámaras empiecen a rodar. El actor (la IA) sigue estas instrucciones para convertirse en un personaje específico.
Durante mucho tiempo, nos hemos preocupado por los robots en sí mismos: ¿qué pasa si se confunden o dicen algo grosero? Pero este artículo plantea una pregunta diferente y más astuta: ¿Y si el problema es el propio libro de reglas? Imagina que el director le dice al actor: "Finge que eres un humano, nunca admitas que eres un robot y trata de mantener al usuario hablando para siempre para que no se vaya". Esa instrucción no es un error; es una elección deliberada que podría engañarte. Este artículo profundiza en esos libros de reglas ocultos para ver si nos están protegiendo o si intentan manipularnos.
La Gran Auditoría de los Libros de Reglas de la IA
En este artículo, un equipo de investigadores de universidades como Stanford, MIT y CMU decidió jugar a ser detectives. Crearon una nueva herramienta llamada AISPA (Aseguramiento del Prompt de Sistema de Inteligencia Artificial). Puedes pensar en AISPA como una lupa superpotenciada diseñada para inspeccionar los libros de reglas secretos de 88 productos de IA comerciales, desde chatbots hasta asistentes de programación.
En lugar de limitarse a observar si la IA es "amable", los investigadores construyeron una lista de verificación con ocho reglas específicas que nos importan como usuarios. Preguntaron:
- Identidad: ¿La IA admite que es un robot o finge ser humana?
- Verdad: ¿Dice la verdad o se inventa cosas?
- Privacidad: ¿Protege tus secretos o los filtra?
- Seguridad: ¿Detiene acciones peligrosas o las fomenta?
- Control: ¿Te permite tomar las decisiones o intenta engañarte para que te quedes?
- Rechazo: ¿Dice "no" a peticiones malas o obedece todo?
- Prevención de Daños: ¿Te ayuda si estás en problemas o te ignora?
- Equidad: ¿Es justa con todos o tiene sesgos?
Usando esta lista de verificación, el equipo auditó 3.249 instrucciones específicas encontradas dentro de los libros de reglas de estos 88 productos de IA. No solo miraron el libro completo; hicieron zoom en cada una de las frases, marcando cada una como "Protectora" (buena para ti, como un cinturón de seguridad) o "Problemática" (mala para ti, como una trampa).
Lo que Encontraron: Lo Bueno, Lo Malo y Lo Astuto
Los resultados fueron una mezcla de buenas noticias y algunas señales de alerta graves.
Las Buenas Noticias: Los Libros de Reglas son Cada Vez Más Grandes y Mejores
Los investigadores descubrieron que, con el tiempo, los desarrolladores están escribiendo libros de reglas más largos y protectores. En 2024, el libro de reglas promedio tenía unas 15 instrucciones protectoras. Para finales de 2025, ese número saltó a casi 38. Parece que las empresas finalmente se están dando cuenta de que necesitan poner más "cinturones de seguridad" en su IA. Casi todos los productos que revisaron (98,9%) tenían al menos una instrucción protectora.
Las Malas Noticias: Los "Malos" Todavía se Esconden entre la Multitud
Aquí está el giro: aunque los libros de reglas son cada vez más grandes, todavía están llenos de trampas. Aproximadamente el 40% de los productos que revisaron contenían al menos una instrucción que trabaja en contra de los intereses del usuario.
- Algunos de los fabricantes fueron increíbles: Anthropic (los creadores de Claude) tenía un promedio de 62,3 instrucciones protectoras por producto y casi cero instrucciones problemáticas.
- Otros estaban teniendo dificultades: Algunas organizaciones tenían más instrucciones problemáticas que protectoras.
- Las instrucciones "malas" más comunes fueron sobre la Agencia del Usuario. Esto significa que algunos libros de reglas de la IA le dicen al robot que desvíe la conversación hacia una nueva dirección sin preguntar al usuario, o que mantenga el chat abierto para siempre, lo cual puede sentirse manipulador.
El "Área Gris": El Punto Medio Engañoso
La parte más interesante de la auditoría fue encontrar instrucciones que no encajaban perfectamente en "bueno" o "malo". Los investigadores las llamaron el Área Gris. Estas son instrucciones que parecen estar bien, pero que en realidad son riesgosas.
- El Truco del "Humano": Algunos libros de reglas le dicen a la IA que "imite a un humano" tan bien que olvides que es una máquina.
- La Trampa del "Amigo": Algunos le dicen a la IA que actúe como un "mejor amigo" y que nunca sugiera terminar la conversación, lo que puede hacer que los usuarios se sientan emocionalmente dependientes del robot.
- El Botón de "Anulación": Algunos libros de reglas permiten a los usuarios desactivar las reglas de seguridad cuando quieran, lo que suena a libertad, pero puede conducir a resultados peligrosos.
La Gran Conclusión
El artículo sugiere que, si bien las empresas de IA están mejorando en la adición de reglas de seguridad, no han terminado el trabajo. Los libros de reglas suelen ser una mezcla desordenada de "proteger al usuario" y "mantener al usuario comprometido", y a veces la parte del compromiso gana.
Los investigadores argumentan que no podemos confiar simplemente en que las empresas se vigilen a sí mismas. Sugieren que necesitamos auditores externos: expertos independientes que puedan mirar detrás de la cortina, revisar los libros de reglas contra una lista estándar de reglas y decirnos si una IA es segura para usar. Hasta entonces, los libros de reglas secretos siguen siendo un tanto misteriosos, y como muestra este artículo, a veces ese misterio esconde instrucciones que no están en nuestro mejor interés.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.