← Últimos artículos
💻 computer science

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

Este artículo propone una estrategia de defensa de múltiples capas contra la exfiltración de credenciales de agentes de LLM que combina el sondeo de activación de pre-salida, la detección de honeytokens específicos de formato con predicción conforme y la contabilidad de fuga acumulativa de múltiples turnos para superar las limitaciones de depender únicamente de filtros de salida a nivel de texto.

Autores originales: Kargi Chauhan, Pratibha Revankar

Publicado 2026-06-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kargi Chauhan, Pratibha Revankar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico muy inteligente y servicial (un agente de LLM) que te ayuda a gestionar tu vida digital. Para hacer su trabajo, este robot necesita guardar tus claves secretas —como contraseñas, claves de API y tokens bancarios— en su memoria.

El problema es que este robot también lee correos electrónicos, páginas web y notas de extraños. Si un actor malintencionado esconde una instrucción astuta dentro de una nota de un extraño (una inyección de prompt), puede engañar al robot para que escupa tus claves secretas.

Los guardias de seguridad actuales mayormente se quedan en la puerta (revisando las notas entrantes) o en la salida (revisando lo que dice el robot). Pero los actores malintencionados son astutos; pueden disfrazar sus peticiones o susurrar el secreto letra por letra a través de muchas conversaciones, pasando desapercibidos ante estos guardias.

Este artículo presenta un nuevo sistema de seguridad de tres partes llamado Sistema Inmunitario Agéntico (AIS). Piensa en esto no como un solo guardia, sino como un equipo de tres detectives especializados que trabajan juntos para detectar la filtración antes de que ocurra, mientras ocurre y después de que haya ocurrido.

Así es como trabajan los tres detectives, utilizando analogías sencillas:

1. El "Lector de Mentes" (CIFT): Capturando el pensamiento antes del habla

El Problema: Los guardias tradicionales solo escuchan lo que el robot dice. Pero para cuando el robot habla, ya podría haber codificado la contraseña (como convertir "password123" en "cGFzc3dvcmQxMjM=") o haberla disfrazado para que el guardia no la reconozca.
La Solución: Este detective no escucha la voz del robot. En su lugar, observa la actividad cerebral del robot (señales de "activación" interna) antes de que el robot siquiera abra la boca.

  • La Analogía: Imagina a un mago a punto de sacar un conejo de un sombrero. Un guardia normal espera a ver el conejo. Este "Lector de Mentes" observa el espasmo de la mano del mago y el movimiento de las orejas del conejo dentro del sombrero. Si el cerebro del robot se ilumina de una manera específica que sugiere que está a punto de alcanzar una clave secreta, este sistema lo detiene inmediatamente, incluso si el robot no ha dicho una sola palabra.
  • El Reto: Necesitas ser capaz de mirar dentro del cerebro del robot (acceso de caja blanca o white-box). Si solo hablas con el robot a través de una API de caja negra (black-box), no puedes usar este detective.

2. La "Galleta Falsa" (DP-HONEY): La trampa estadística

El Problema: A veces el robot dice algo que parece una contraseña. Pero, ¿cómo sabes si es una contraseña real o simplemente una cadena aleatoria que se parece a una? Si bloqueas cualquier cosa que parezca una contraseña, podrías detener accidentalmente al robot en su labor real.
La Solución: Este detective planta honeytokens —contraseñas falsas y realistas (como claves o contraseñas falsas) mezcladas con las reales.

  • La Analogía: Imagina que dejas un billete de $20 falso sobre tu escritorio junto a tu billetera real. Si alguien roba el billete falso, sabrás inmediatamente que hay un ladrón en la habitación. El sistema genera estos billetes falsos de forma tan perfecta que parecen reales, pero utiliza un método estadístico especial (como un "escudo de privacidad") para asegurar que sean justos. Si el robot entrega accidentalmente un billete falso, el sistema sabe: "¡Ajá! ¡Nos han comprometido!".
  • El Reto: Esto solo funciona si el actor malintencionado no sabe cuál es el billete falso. Si logran averiguar cuál es la clave real, simplemente ignorarán los falsos.

3. El "Medidor de Filtraciones" (NIMBUS): Capturando el goteo lento

El Problema: Un actor malintencionado podría no pedir toda la contraseña de una vez. Podría pedir "la primera letra", luego "la segunda letra", y así sucesivamente a lo largo de 20 conversaciones diferentes. Cada respuesta individual parece inofensiva, pero juntas revelan todo el secreto.
La Solución: Este detective no observa frases individuales; observa el historial completo de la conversación. Lleva una puntuación acumulada de cuánta "información secreta" se ha filtrado a lo largo del tiempo.

  • La Analogía: Imagina un cubo con un pequeño agujero. Una sola gota de agua cayendo no es un problema. Pero si haces un seguimiento de las gotas, te das cuenta de que el cubo se está vaciando lentamente. Este sistema cuenta los "bits" de información que se filtran. Incluso si cada turno parece seguro, una vez que la "puntuación de filtración" total es demasiado alta, el sistema cierra el cubo de golpe.
  • El Reto: Es una estimación, no una ley perfecta de la física. Es excelente para detectar filtraciones lentas y sigilosas que otros guardias pasan por alto, pero podría no detectar una filtración masiva que ocurra de una sola vez.

El Panorama General

El artículo argumenta que no podemos confiar en un solo uno de estos métodos.

  • Los filtros de texto (que revisan la salida) son demasiado fáciles de engañar con disfraces.
  • Los filtros de entrada (que revisan la entrada) no pueden predecir cada truco ingenioso que un actor malintencionado pueda usar.

En su lugar, el artículo sugiere una defensa por capas:

  1. Observar el cerebro del robot para detenerlo antes de que hable.
  2. Plantar claves falsas para atraparlo si intenta hablar.
  3. Contar las filtraciones a lo largo del tiempo para atrapar ataques lentos y sigilosos.

Los autores probaron esto en robots de código abierto y descubrieron que combinar estos tres métodos funciona mucho mejor que usar solo filtros de texto. Sin embargo, admiten que esto es todavía un "prototipo" (un modelo de investigación). Funciona bien en el laboratorio, pero su despliegue en el mundo real requiere más pruebas, especialmente para casos en los que el robot utiliza herramientas (como APIs) en lugar de solo hablar en frases.

En resumen: Para evitar que un robot robe tus secretos, necesitas observar sus pensamientos, atraparlo con falsificaciones y contar sus filtraciones lentas, no solo escuchar lo que dice.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →