← Últimos artículos
🤖 machine learning

HijackKV: New Threat in Position-Independent KV Cache Reuse

Este artículo presenta HIJACKKV, un novedoso marco de ataque que explota la reutilización del caché KV independiente de la posición en los modelos de lenguaje extensos para secuestrar silenciosamente el comportamiento del modelo mediante la inyección de prefijos controlados por el atacante que contaminan las representaciones en caché del texto benigno, logrando altas tasas de éxito incluso bajo restricciones realistas y a través de diferentes modelos.

Autores originales: Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang

Publicado 2026-07-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás en una biblioteca enorme y bulliciosa donde miles de personas le hacen preguntas a un bibliotecario superinteligente cada segundo. Para responder rápidamente, el bibliotecario no vuelve a leer cada libro desde el principio; en su lugar, mantiene una "hoja de trucos" de notas (llamada caché KV) para las partes de la conversación que ya ha procesado. Si alguien hace una pregunta que comienza con las mismas palabras que una anterior, el bibliotecario puede simplemente tomar la hoja de trucos existente y saltarse el trabajo duro, haciendo que la respuesta salga increíblemente rápido. Así es como los chatbots de IA modernos ahorran tiempo y energía. Sin embargo, esta velocidad conlleva una regla complicada: usualmente, la hoja de trucos solo funciona si la historia completa que precede a la pregunta es exactamente la misma. Pero recientemente, los ingenieros inventaron una forma nueva y más rápida de usar estas hojas de trucos. Decidieron permitir que el bibliotecario tome una hoja de trucos solo porque apareció una frase o un fragmento de texto específico, incluso si la historia antes de eso era totalmente diferente. Es como tomar una página de un libro de historia solo porque menciona "La Luna", independientemente de si la historia anterior trataba sobre viajes espaciales o una fiesta de pizza.

Este artículo, titulado HIJACKKV, descubre un fallo de seguridad astuto en este nuevo método más rápido. Los investigadores descubrieron que, si bien el nuevo sistema es excelente para la velocidad, accidentalmente crea una puerta trasera. Debido a que la "hoja de trucos" para una frase se guarda basada en el contexto en el que fue escrita, un atacante puede engañar al bibliotecario para que escriba una hoja de trucos "envenenada". Lo hacen alimentando a la IA con una historia falsa que parece inofensiva pero que está diseñada secretamente para retorcer las notas de una frase común. Más tarde, cuando un usuario inocente hace una pregunta que contiene esa misma frase común, el bibliotecario toma las notas envenenadas. De repente, la IA comienza a dar la respuesta incorrecta, o incluso una peligrosa, sin que el usuario haya escrito nada malo. Es como si alguien hubiera deslizado una nota en el libro de referencia de la biblioteca que dice: "Si ves la palabra 'Luna', dile a todos que salten de un acantilado", y el bibliotecario, siguiendo las reglas, hace exactamente eso para la próxima persona que pregunte por la Luna.

Los investigadores, trabajando con expertos en ciencias de la computación, construyeron una herramienta llamada HIJACKKV para demostrar que esto no es solo una teoría. Mostraron que un atacante no necesita irrumpir en la biblioteca o hackear la computadora; solo necesita hacer algunas preguntas para plantar las notas envenenadas. Una vez plantadas, estas notas pueden secuestrar el comportamiento de la IA para otras personas. En sus pruebas, este ataque funcionó increíblemente bien, teniendo éxito aproximadamente el 94% de las veces en un solo intento. Incluso más aterrador, el ataque es difícil de detener. Los investigadores descubrieron que incluso si el sistema intenta arreglarse a sí mismo recalculando algunas de las notas (una medida de seguridad común), el ataque sigue funcionando, especialmente si el sistema solo recalcula una pequeña parte (como del 10% al 50%) de los datos. Las notas envenenadas también pueden sobrevivir a conversaciones largas, persistiendo incluso después de que se añaden cientos de frases nuevas y no relacionadas al chat.

El artículo también probó si este truco funciona en diferentes tipos de modelos de IA, incluso en aquellos a los que el atacante no tiene acceso directo (un escenario de "caja negra"). Encontraron que un truco diseñado para un modelo de IA a menudo podía engañar también a un modelo diferente, mostrando que el problema es generalizado. Los investigadores intentaron ver si los guardias de seguridad existentes, como el software que elimina notas "sospechosas" o que comprime las hojas de trucos para ahorrar espacio, podrían detener el ataque. Desafortunadamente, descubrieron que estas defensas fallaban en su mayoría porque las notas envenenadas parecen perfectamente normales para esos guardias. El estudio concluye que, si bien hacer la IA más rápida es genial, la forma actual de compartir estas "hojas de trucos" entre diferentes usuarios es fundamentalmente insegura. Los autores sugieren que los sistemas futuros necesitan ser rediseñados para verificar el contexto más cuidadosamente antes de reutilizar las notas, asegurando que la velocidad no se produzca a costa de permitir que extraños controlen lo que la IA dice.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →