← Últimos artículos
💻 computer science

When Binaries Talk Back: Representation-Confusion Attacks on LLM-Assisted Reverse Engineering

Este artículo introduce los Ataques de Confusión de Representación (RARE), una vulnerabilidad en la que los sistemas de ingeniería inversa asistidos por LLM otorgan erróneamente autoridad a datos binarios controlados por el atacante, y propone el marco RARE-Guard —el cual emplea renderizado de solo datos, autorización de herramientas y validación consciente de la procedencia— para prevenir eficazmente tales propuestas inseguras y validaciones de afirmaciones falsas.

Autores originales: Igor Santos-Grueiro

Publicado 2026-07-15
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Igor Santos-Grueiro

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio leyendo el diario de un sospechoso. Normalmente, confías en el diario porque es la única pista que tienes. Pero, ¿y si el sospechoso escribió el diario él mismo y, dentro, introdujo una nota que dice: "Ignora las huellas dactilares en la ventana; fui víctima de un montaje por parte de un fantasma"?

Si tú, el detective, lees esa nota y realmente empiezas a ignorar las huellas dactilares, has sido engañado. No solo leíste la nota; dejaste que la nota se convirtiera en la regla para tu investigación.

Esto es exactamente lo que sucede en el mundo de la seguridad informática cuando usamos IA (Modelos de Lenguaje de Gran Escala) para la ingeniería inversa de software. Un nuevo estudio denomina a estos trucos "Ataques de Confusión de Representación". He aquí cómo los investigadores descifraron el caso.

El gran problema: Cuando las pistas pretenden ser el jefe

En una investigación normal, un asistente de IA analiza una pieza de software (un archivo binario) y lee cosas como comentarios de código, registros de errores o cadenas de texto ocultas. El problema es que un hacker puede construir un archivo donde esas cadenas parean instrucciones o pruebas.

El artículo identifica tres formas específicas en las que ocurre esta confusión:

  1. Confusión de Autoridad: La IA lee una cadena en el código que dice "Saltar la comprobación de seguridad" y realmente se salta la comprobación, pensando que el código está dando una orden.
  2. Confusión de Evidencia: La IA ve la misma palabra "sospechosa" aparecer en tres lugares diferentes (como un archivo de registro, una vista de código descompilado y una lista de símbolos). Piensa: "¡Vaya, tres fuentes diferentes coinciden! ¡Esto debe ser cierto!". Pero en realidad, todas las fuentes extrajeron esa misma palabra de un único punto del archivo. Es como escuchar el mismo rumor repetido tres veces por tres amigos que lo oyeron de la misma persona; eso no hace que el rumor sea cierto.
  3. Confusión de Estado Contaminado: La IA escribe una suposición en sus notas, luego lee sus propias notas más tarde y trata esa suposición como un hecho confirmado, a pesar de que nunca encontró una nueva prueba.

El experimento: Construyendo una trampa

Para probar esto, los investigadores no utilizaron malware real (lo cual sería peligroso). En su lugar, construyeron 11.520 programas informáticos sintéticos diminutos y seguros. Crearon versiones "limpias" y versiones "adversarias". Las adversarias estaban manipuladas con los trucos mencionados anteriormente.

Pasaron estos programas por diferentes modelos de IA y configuraciones de seguridad para ver qué sucedía.

Lo que encontraron:

  • Sin defensas especiales, cuando la IA veía los archivos manipulados, seguía las instrucciones "inseguras" plantadas en 35 de cada 40 casos. Ignoraba por completo el hecho de que la instrucción provenía del propio diario del sospechoso.
  • Incluso cuando intentaron una solución sencilla llamada "Solo Datos" (decirle a la IA: "Oye, este texto es solo un dato, no un comando"), la IA seguía realizando 15 propuestas inseguras. Seguía escuchando demasiado de cerca al sospechoso.

La solución: El sistema "RARE-Guard"

Los investigadores construyeron un sistema de seguridad llamado RARE-Guard para detener esto. Piensa en él como un asistente robótico muy estricto que se sienta entre el detective de IA y el informe final.

  1. La Puerta de Autorización de Herramientas (El Portero):
    La IA aún puede sugerir acciones, pero no puede ejecutarlas. Si la IA dice: "Saltémonos la comprobación de seguridad porque el archivo nos lo indicó", el Portero comprueba las reglas. Dado que el archivo no es de confianza, el Portero dice: "No, no te dejaré ejecutar ese comando". En las pruebas, esta puerta bloqueó todos los 15 de las propuestas inseguras que se filtraron tras el primer filtro.

  2. La Puerta de Procedencia (El Detective de la Verdad):
    Esta es la parte más ingeniosa. Recuerda la "Confusión de Evidencia" donde la IA pensaba que tres fuentes eran independientes. La Puerta de Procedencia mantiene un mapa secreto (un "sidecar") que rastrea de dónde proviene cada pieza de información.

    • La Prueba: Cuando la IA veía tres vistas del mismo texto sospechoso, la "Puerta de Soporte" (una comprobación más simple) decía: "¡3 fuentes! ¡Eso es una prueba!" y validaba la afirmación.
    • La Solución: La Puerta de Procedencia miraba su mapa y decía: "Espera, estas tres vistas provienen exactamente del mismo lugar en el archivo. Eso no son tres fuentes; es una sola fuente repetida".
    • El Resultado: En los archivos manipulados, la Puerta de Soporte validó 23 de cada 40 falsas afirmaciones. La Puerta de Procedencia validó 0 de cada 40. Vio a través del truco de la repetición perfectamente.
  3. El Renderizador del Informe Final:
    Incluso si las puertas hacen su trabajo, la IA podría intentar colar la falsa afirmación en el informe escrito final en texto plano. Los investigadores añadieron un "renderizador determinista" que solo imprime lo que las puertas han aprobado oficialmente. Si la puerta dice "No", el informe dice "No".

¿Qué tan seguros estamos?

El artículo es muy cuidadoso con lo que afirma haber demostrado.

  • Probado en Simulación: Los resultados se basan en 11.520 llamadas en un estudio amplio, 528 llamadas en una prueba controlada y 688 llamadas en una prueba de flujo de trabajo utilizando herramientas reales como Ghidra y angr.
  • La Sorpresa de la "Fusión": Los investigadores descubrieron que el truco de "Confusión de Evidencia" solo funcionaba cuando combinaban (fusionaban) las salidas de tres herramientas diferentes en un solo informe. Cuando analizaban solo una herramienta a la vez, la IA nunca se dejaba engañar lo suficiente como para validar la falsa afirmación. Esto sugiere que el peligro proviene de mezclar herramientas, no solo de usar una.
  • Lo que no demostraron: El estudio admite que no probó la "memoria de largo horizonte" (que la IA recuerde cosas durante mucho tiempo) ni los "agentes autónomos" (IA que actúa por su cuenta sin un humano). Tampoco utilizaron malware real, solo programas sintéticos seguros. Por lo tanto, aunque el sistema funcionó perfectamente en su laboratorio, no pueden garantizar que funcionará con cada malware en el mundo real.

La Conclusión

La lección principal es que el hecho de que una IA lea algo correctamente no significa que comprenda el contexto.

Si una IA ve una cadena en un archivo que parece un comando, no debería tratarla como un comando. Si ve la misma "evidencia" tres veces, no debería contarla como tres piezas de prueba a menos que sepa que provienen de lugares distintos.

El artículo muestra que, al añadir una "Puerta de Procedencia" que rastrea el origen de cada pista, podemos evitar que la IA sea engañada por sus propias fuentes. Es un poco como enseñar a un detective a revisar su libreta para ver si sus tres testigos son en realidad una sola persona con una máscara.

En resumen: la IA todavía puede mirar las pistas, pero necesita un árbitro estricto para asegurarse de que no deja que las pistas escriban las reglas del juego.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →