← Últimos artículos
💻 computer science

Vulnerability Detection with Interprocedural Context in Multiple Languages: Assessing Effectiveness and Cost of Modern LLMs

Este estudio evalúa la efectividad, el costo y la calidad de las explicaciones de cuatro modelos de lenguaje modernos en la detección de vulnerabilidades interprocedimentales en C, C++ y Python, demostrando que incorporar contexto de llamadas mejora significativamente la precisión y ofrece soluciones rentables para herramientas de análisis de seguridad asistidas por IA.

Autores originales: Kevin Lira, Baldoino Fonseca, Davy Baía, Márcio Ribeiro, Wesley K. G. Assunção

Publicado 2026-04-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kevin Lira, Baldoino Fonseca, Davy Baía, Márcio Ribeiro, Wesley K. G. Assunção

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que este artículo es como una prueba de conducir para cuatro coches de última generación (los modelos de Inteligencia Artificial), pero en lugar de conducir por una carretera normal, tienen que encontrar agujeros en el asfalto (vulnerabilidades de seguridad) en tres tipos de vehículos diferentes: camiones pesados (C), furgonetas (C++) y coches deportivos ligeros (Python).

Aquí tienes la explicación sencilla, usando analogías cotidianas:

🕵️‍♂️ El Problema: Mirar solo una pieza del rompecabezas

Antes de este estudio, los expertos en seguridad solían pedirle a la IA que mirara solo una habitación de una casa para ver si había un ladrón. Pero, ¿y si el ladrón no está en la habitación, sino que entra desde el pasillo o sale por la ventana de la cocina?

Muchas vulnerabilidades de seguridad no ocurren dentro de una sola función de código (una sola habitación), sino que dependen de cómo una función habla con otra (el pasillo y la cocina). El estudio quería saber: ¿Es mejor pedirle a la IA que mire solo la habitación, o que también mire quién entra y quién sale de ella?

🧪 La Prueba: Los 4 "Detectives" y sus 3 Lentes

Los investigadores tomaron 509 casos reales de fallos de seguridad y les dieron a cuatro modelos de IA famosos (Claude Haiku 4.5, GPT-4.1 Mini, GPT-5 Mini y Gemini 3 Flash) tres formas de mirar el código:

  1. Lente Aislado: Solo la función problemática.
  2. Lente de "Vecinos": La función + las funciones a las que llama (callees).
  3. Lente de "Jefes": La función + las funciones que la llaman (callers).

Además, midieron cuánto les costó a los investigadores usar estos detectives (en dinero) y qué tan bien explicaban sus hallazgos.

🏆 Los Resultados Sorprendentes

1. "Más información" no siempre es mejor (El ruido del tráfico)

La idea común era que "si le das más contexto a la IA, será más inteligente". Falso.

  • La analogía: Imagina que intentas escuchar una conversación importante en una fiesta. Si te pones unos auriculares que aíslan el ruido (solo la función), escuchas bien. Pero si te pones unos auriculares que te dejan escuchar toda la fiesta (el contexto interprocedural), a veces el ruido de fondo te confunde y pierdes la conversación.
  • Lo que pasó: Para los modelos de "OpenAI" (GPT), darle más contexto (ver a los vecinos o a los jefes) los confundió. Su precisión bajó drásticamente (hasta un 25% menos). En cambio, los modelos de "Anthropic" (Claude) y "Google" (Gemini) fueron como detectives con oídos de lince: no les importó el ruido extra, mantuvieron su enfoque y su precisión se mantuvo estable.

2. El equilibrio entre Precio y Calidad (La cuenta del restaurante)

Usar IA cuesta dinero (se paga por cada palabra que la IA lee y escribe).

  • La analogía: Añadir contexto es como pedir una ensalada gigante en lugar de una pequeña. Te llena más (más palabras), pero ¿te da más sabor (mejor detección)?
  • El hallazgo: Añadir contexto duplicó el costo (más palabras = más dinero) pero no mejoró la detección. Al contrario, a menudo la empeoró.
  • El ganador económico: Gemini 3 Flash fue el mejor "cocinero" en relación precio-calidad. Detectó casi todo lo que tenía que detectar en el lenguaje C gastando muy poco dinero (aprox. 50 centavos por configuración).

3. La explicación (El "Por qué" importa)

No basta con decir "Aquí hay un error". Un buen detective debe explicar por qué es un error y cómo arreglarlo.

  • El ganador de la explicación: Claude Haiku 4.5 fue el mejor redactor. En el 93.6% de los casos, no solo encontró el fallo, sino que escribió una explicación perfecta, clara y útil.
  • Los perdedores: Los modelos de GPT a veces encontraban el error pero escribían explicaciones confusas o, peor aún, decían que había un error cuando no lo había (alucinaciones).

🌍 ¿Importa el idioma? (C, C++ y Python)

Sí, el "idioma" del código importa.

  • C y C++ (Los camiones pesados): Son lenguajes donde el manejo de la memoria es manual (como conducir un camión sin frenos automáticos). Aquí, el contexto extra confundió mucho a los modelos GPT.
  • Python (El coche deportivo): Es más seguro por sí mismo. Aquí, los resultados fueron más estables, pero la tendencia de "menos contexto es mejor" se mantuvo.

💡 La Lección Principal para el Futuro

Si quieres construir una herramienta de seguridad con IA:

  1. No asumas que "más es mejor": A veces, dar demasiada información a la IA la confunde.
  2. Elige tu detective según tu presupuesto:
    • Si quieres la mejor explicación para entender el problema: Usa Claude Haiku 4.5.
    • Si quieres el mejor equilibrio entre precio y detección rápida: Usa Gemini 3 Flash.
    • Si usas modelos baratos (GPT Mini), ten cuidado: podrían confundirse si les das demasiada información de fondo.

En resumen: A veces, para encontrar un fallo de seguridad, es mejor mirar la pieza clave con lupa y silencio, que intentar escuchar todo el ruido de la fábrica al mismo tiempo. Y, por supuesto, elige al detective que mejor se ajuste a tu bolsillo y a tu necesidad de explicaciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →