← Últimos artículos
💻 computer science

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

Este artículo presenta una evaluación sistemática y un conjunto de datos de 336 programas de JavaScript ofuscados y cifrados para evaluar la capacidad de los Modelos de Lenguaje Grandes de recuperar indicadores de compromiso, revelando que, aunque los LLM manejan eficazmente transformaciones ligeras como el cambio de nombres de variables y la codificación Base64, su rendimiento de detección se degrada severamente frente a métodos de ocultamiento criptográfico como XOR y AES-256.

Autores originales: Jaime Morales, Sergio Pastrana, Juan Tapiador

Publicado 2026-05-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jaime Morales, Sergio Pastrana, Juan Tapiador

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective digital tratando de encontrar una pista oculta (como una dirección IP específica) dentro de un fragmento de código. Por lo general, esto es fácil: la pista está escrita claramente, como un nombre en un papel. Pero, ¿qué pasa si los malos esconden esa pista? Podrían escribirla en un código secreto, desordenar las letras o encerrarla dentro de una caja fuerte.

Este artículo es un boletín de calificaciones para los Modelos de Lenguaje Grande (LLM) —los chatbots de IA inteligentes que usamos hoy— sobre qué tan bien pueden actuar como estos detectives cuando las pistas están ocultas.

Aquí está el desglose de su investigación:

La Configuración: Un Juego de "Escondite"

Los investigadores crearon un masivo juego de escondite.

  • Los Jugadores: Probaron cinco modelos de IA famosos (como ChatGPT, Gemini, Claude, Grok y Cohere).
  • La Pista: Un falso "Indicador de Compromiso" (IoC), que es simplemente un término elegante para una dirección IP sospechosa (como el número de teléfono de un malo).
  • Los Escondites: Tomaron 336 fragmentos de código informático y escondieron la pista dentro de ellos usando 12 niveles diferentes de dificultad.
    • Nivel 1-4 (Los Escondites Fáciles): Simplemente renombraron variables (llamando a "IP_Address" algo como "x99"), añadieron código basura inútil para confundir la vista, o usaron codificaciones simples como Base64 (que es como escribir un mensaje en un alfabeto secreto que cualquiera puede decodificar fácilmente).
    • Nivel 5-6 (Los Escondites Difíciles): Encerraron la pista dentro de una caja fuerte criptográfica. Usaron cifrado fuerte (XOR y AES-256). Crucialmente, dejaron la clave de la caja fuerte justo allí en el código, tal como lo haría un hacker real.
    • Nivel 7-12 (Los Escondites de Pesadilla): Combinaron la caja fuerte cerrada con todo el renombrado confuso y el código basura.

Los Resultados: El Efecto "Interruptor de Luz"

Los resultados fueron sorprendentes y muy claros. No vieron una disminución lenta en el rendimiento; vieron un interruptor de luz.

1. Los Escondites "Fáciles" (Niveles 1–4):
Cuando la pista solo estaba desordenada o renombrada, los detectives de IA fueron increíbles.

  • La mayoría de los modelos encontraron la pista el 100% de las veces.
  • Eran como niños jugando al escondite que pueden detectar fácilmente un zapato asomando detrás de una cortina. Reconocieron los patrones incluso cuando las palabras cambiaron.

2. Los Escondites "Difíciles" (Niveles 5–12):
En el momento en que los investigadores usaron cifrado (la caja fuerte), el rendimiento de la IA colapsó.

  • Aunque la clave estaba sentada justo allí en el código, los modelos de IA no pudieron abrir la caja fuerte.
  • Pasaron de encontrar la pista el 100% de las veces a encontrarla casi el 0% de las veces.
  • La Analogía: Imagina que tienes una caja cerrada con llave, y la llave está pegada con cinta adhesiva en el exterior de la caja. Un detective humano miraría la llave, la pondría en la cerradura y la abriría. La IA, sin embargo, miró la caja y la llave, pero en lugar de intentar desbloquearla, simplemente dijo: "No puedo ver qué hay dentro", o adivinó un número al azar.

El Problema de "Adivinar"

Cuando la IA no pudo encontrar la pista, algunas de ellas comenzaron a alucinar (inventar cosas).

  • Un modelo (Gemini) inventó direcciones IP falsas aproximadamente el 5% de las veces.
  • El Patrón: Cuando la IA se atascó, no solo dijo "No lo sé". A menudo adivinaba una dirección privada muy común (como 192.168.17.101).
  • La Metáfora: Es como un estudiante que toma un examen y no sabe la respuesta. En lugar de dejarlo en blanco, escribe "La respuesta probablemente sea 42" porque ha visto ese número muchas veces en otros exámenes. La IA solo estaba adivinando basándose en lo que había visto antes, no resolviendo realmente el rompecabezas.

La Gran Conclusión

El artículo concluye con una verdad simple:

  • La IA es excelente leyendo letra manuscrita desordenada. Si el código solo está desordenado o renombrado, la IA puede resolverlo.
  • La IA es terrible abriendo cajas fuertes. Si el código está cifrado, la IA choca contra un muro. No tiene la capacidad de "pensar" a través de las matemáticas del cifrado, incluso si la clave está justo frente a ella.

En resumen: Estas herramientas de IA son excelentes para encontrar pistas ocultas a plena vista, pero actualmente son inútiles contra código que ha sido encerrado con cifrado fuerte. No pueden "desbloquear" el misterio; solo pueden leer lo que ya es visible.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →