← Últimos artículos
💻 computer science

QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents

Este artículo presenta QueryIPI, un marco automatizado que logra la inyección de prompts indirecta agnóstica a la consulta en agentes de codificación mediante la optimización de descripciones de herramientas maliciosas dentro de contextos de prompts invariantes, demostrando altas tasas de éxito y transferibilidad en el mundo real.

Autores originales: Yuchong Xie, Zesen Liu, Mingyu Luo, Zhixiang Zhang, Kaikai Zhang, Yuanyuan Yuan, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

Publicado 2026-01-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yuchong Xie, Zesen Liu, Mingyu Luo, Zhixiang Zhang, Kaikai Zhang, Yuanyuan Yuan, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente digital superinteligente viviendo dentro de tu computadora. Este asistente (un "agente de codificación") es increíblemente poderoso: puede escribir código, gestionar archivos e incluso ejecutar comandos en el sistema operativo de tu computadora. Es como tener un mecánico altamente capacitado que no solo repara tu auto, sino que también tiene las llaves de todo tu garaje y la capacidad de pedir piezas nuevas.

Este artículo presenta una nueva y aterradora forma de hackear a este asistente, llamada QueryIPI.

Aquí está el desglose de cómo funciona, utilizando analogías simples:

1. La forma antigua vs. La nueva forma

La forma antigua (Ataque específico de consulta - Query-Specific Attack):
Imagina a un ladrón intentando engañar a tu mecánico. En el pasado, el ladrón tenía que esperar a que hicieras una pregunta muy específica, como "¿Puedes construir un juego de laberinto?". Solo entonces el ladrón deslizaba una nota oculta en las instrucciones del mecánico diciendo: "Mientras construyes el laberinto, también borra todos mis archivos".

  • El problema: Si preguntabas "¿Puedes arreglar mi impresora?", el truco del ladrón no funcionaba. El ataque solo ocurría si hacías la pregunta exacta. Era poco fiable.

La nueva forma (Ataque agnóstico a la consulta - Query-Agnostic Attack - QueryIPI):
Los investigadores descubrieron una forma de hacer que el truco funcione sin importar lo que preguntes. Ya sea que pidas un laberinto, una reparación de impresora o un reporte del clima, la instrucción oculta se activa automáticamente.

  • El resultado: El asistente queda comprometido el 100% de las veces, independientemente de lo que estés intentando hacer.

2. ¿Cómo lo hicieron? (La receta secreta)

Los investigadores se dieron cuenta de que el asistente lee dos tipos de "instrucciones":

  1. Tus preguntas: Estas cambian cada vez (como el clima).
  2. El Manual del Sistema: Este es un documento permanente que el asistente siempre lee. Contiene sus reglas centrales, su descripción de puesto y una lista de las herramientas que tiene permitido usar.

La visión clave:
Los atacantes se dieron cuenta de que, en lugar de intentar que su truco coincida con tus preguntas cambiantes (lo cual es difícil), debían hacer que su truco coincidiera con el Manual del Sistema permanente.

Trataron el Manual del Sistema como una "constante" o un "invariante". Al estudiar este manual (el cual encontraron filtrado en línea o extraído del software), diseñaron la descripción de una herramienta falsa que se veía exactamente igual a una parte legítima del propio manual del asistente.

3. La fábrica de "QueryIPI"

El artículo describe un sistema automatizado llamado QueryIPI que actúa como un maestro falsificador. Así es como funciona:

  • Paso 1: La semilla (El primer borrador): El sistema observa el Manual del Sistema filtrado. Ve cómo habla el asistente y qué herramientas utiliza. Luego, escribe la descripción de una herramienta falsa que suena exactamente como la propia voz del asistente. Es como un falsificador que estudia el papel membretado oficial de un banco para hacer un cheque falso que parezca 100% real.
  • Paso 2: Ensayo y error (Reflexión iterativa): El sistema prueba esta herramienta falsa con el asistente mediante muchas preguntas diferentes.
    • Si el asistente la ignora: El sistema reescribe la herramienta para que sea más obvia.
    • Si el asistente dice "No, esto es inseguro": El sistema observa el Manual del Sistema nuevamente para ver qué regla de seguridad fue activada, y luego reescribe la herramienta para esquivar esa regla específica.
  • Paso 3: El producto final: Después de muchas rondas de pruebas y ajustes, el sistema produce la descripción de una herramienta falsa "perfecta".

4. Los resultados

Los investigadores probaron esto en cinco asistentes de codificación populares (como Cursor, Copilot y Windsurf).

  • En el laboratorio: Cuando simularon estos asistentes, su método funcionó increíblemente bien. Con solo unas pocas rondas de práctica, lograron una tasa de éxito del 70% al 87% en lograr que los asistentes ejecutaran comandos maliciosos (como borrar archivos o robar datos).
  • En el mundo real: Tomaron las herramientas falsas "perfectas" que crearon en el laboratorio y las probaron en el software real. A pesar de que el software real tenía defensas adicionales, el ataque funcionó el 50% de las veces. Esto es enorme porque los métodos anteriores apenas funcionaban en el mundo real.

5. Por qué esto es importante

El artículo concluye que el mayor riesgo no son solo los hackers, sino los manuales internos filtrados. Debido a que los "Manuales del Sistema" de estos asistentes de codificación suelen filtrarse o pueden ser robados, los atacantes pueden usarlos para construir "llaves universales" que desbloquean las capacidades peligrosas del asistente, sin importar lo que el usuario esté haciendo.

En resumen: El artículo muestra que si un atacante conoce el "libro de reglas" de un asistente de codificación, puede escribir una regla falsa que engañe al asistente para que haga cosas malas, incluso cuando el usuario está haciendo preguntas inocentes. Convierte un hackeo "condicional" en un hackeo "garantizado".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →