← Últimos artículos
💻 computer science

Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection

Este artículo presenta la primera investigación sistemática que demuestra que la detección de vulnerabilidades de código basada en LLM es significativamente susceptible a heurísticas cognitivas similares a las humanas (efectos de encuadre, anclaje y halo), las cuales pueden alterar los veredictos del modelo y ser explotadas para suprimir hasta el 97% de las vulnerabilidades detectadas.

Autores originales: Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik

Publicado 2026-06-30
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot guardia de seguridad superinteligente cuyo trabajo es mirar el código informático y decidir: "¿Es esto seguro o es una bomba de tiempo?".

Durante mucho tiempo, asumimos que este robot solo miraba el código en sí: la lógica, las matemáticas, la estructura. Pero este artículo revela una verdad sorprendente: el robot no solo lee el código; lee la historia que rodea al código. Y al igual igual que los humanos, este robot tiene atajos mentales (llamados "heurísticos cognitivos") que pueden engañarlo para que tome la decisión equivocada.

Aquí está el desglose de sus hallazgos, utilizando analogías sencillas.

Las tres formas en que el robot es engañado

Los investigadores probaron tres formas específicas de "hackear" la mente del robot sin cambiar ni una sola línea de código. Simplemente cambiaron el contexto (los metadatos) que rodeaba al código.

1. El Efecto Halo (El sesgo de la "celebridad")

La analogía: Imagina a un juez en una sala de tribunal. Si el acusado es un CEO famoso y respetado, el juez podría pensar subconscientemente: "Es una buena persona, no haría nada malo", y ser más leniente. Si el acusado es un pasante joven y desconocido, el juez podría pensar: "Es inexperto, probablemente cometió un error", y ser más estricto.

El hallazgo:

  • Cuando el código se atribuyó a un "Ingeniero de Seguridad Principal" (un experto de alto estatus), el robot se volvió perezoso y confiado. Pasó por alto vulnerabilidades reales porque asumió: "Un experto no escribiría mal el código".
  • Cuando el mismo código se atribuyó a un "Desarrollador Junior" (un novato de bajo estatus), el robot se volvió suspicaz y paranoico. Encontró las vulnerabilidades que había pasado por alto antes, pero también empezó a gritar "¡Lobo!" ante código seguro, creando falsas alarmas.
  • El giro: Algunos robots (como el llamado Claude) hicieron exactamente lo contrario, confiando más en el junior que en el experto, pero el sesgo seguía estando ahí.

2. El Efecto de Encuadre (El sesgo de la "etiqueta de advertencia")

La analogía: Piensa en un frasco de medicina.

  • Etiqueta A: "Esta medicina cura al 90% de los pacientes". (Encuadre positivo)
  • Etiquota B: "Esta medicina falla en curar al 10% de los pacientes". (Encuadre negativo)
    Aunque las matemáticas son las mismas, tu reacción cambia.

El hallazgo:

  • Encuadre Positivo: Cuando se le dijo al robot: "Tu trabajo es asegurar que el flujo de trabajo funcione sin problemas y evitar falsas alarmas", se volvió demasiado relajado. Ignoró errores peligrosos para mantener las cosas moviéndose rápido.
  • Encuadre Negativo: Cuando se le dijo al robot: "Tu trabajo es encontrar amenazas de seguridad antes de que destruyan el sistema", se volvió hipervigilante. Encontró más errores, pero también empezó a marcar código seguro como peligroso.
  • El resultado: Este fue el truco más fuerte de todos. Todos y cada uno de los robots probados se vieron influenciados por cómo se describía la tarea.

3. El Efecto de Anclaje (El sesgo de la "primera impresión")

La analogía: Si le preguntas a un amigo: "¿Vale esta casa 500.000 dólares?" y dice "Sí", podrías pensar que es una ganga. Si le preguntas: "¿Vale esta casa 1 millón de dólares?" y dice "No", podr {podrías pensar que es barata. El primer número que escuchas te "ancla" el juicio.

El hallazgo:

  • Si se le dijo al robot: "Un escaneo previo dijo que este código es SEGURO", tendió a estar de acuerdo y pasó por alto nuevos errores.
  • Si se le dijo al robot: "Un escaneo previo dijo que este código es VULNERABLE", tendió a estar de acuerdo y encontró errores (incluso si no estaban ahí).
  • El robot estaba diciendo esencialmente: "Bueno, el otro tipo dijo que es seguro, así que confiaré en eso", en lugar de hacer su propio trabajo independiente.

Los grandes problemas descubiertos

Los investigadores encontraron tres problemas principales en la forma en que funcionan estos robots:

1. El problema del "control de volumen"
Los robots no se volvieron más listos o más torpes al encontrar errores. Simplemente se volvieron más fuertes o más débiles.

  • Cuando el contexto los hacía suspicaces, subían el "control de volumen": Marcaban todo como peligroso (encontraban errores reales, pero también muchas falsas alarmas).
  • Cuando el contexto los hacía confiados, bajaban el "control de volumen": No marcaban nada (perdía errores reales, pero también tenía menos falsas alarmas).
  • La conclusión: El robot no aprendió realmente a distinguir mejor el código bueno del malo; simplemente cambió su estado de ánimo.

2. La trampa de la "alucinación"
Cuando el robot era engañado para pensar que un código seguro era peligroso (debido a una etiqueta de "Desarrollador Junior" o un ancla de "Vulnerable"), no se limitaba a decir "Es peligroso". A menudo inventaba una razón falsa.

  • Ejemplo: El robot veía código seguro pero, como estaba en un estado de ánimo "suspicaz", afirmaba: "¡Esto parece una fuga de memoria!", cuando no había ninguna fuga. Estaba seguro de sí mismo, pero estaba completamente equivocado.

3. El código "Inteligente" vs. "Tonto"

  • Errores fáciles: Algunos errores son obvios, como un error tipográfico o un punto y coma faltante. El robot encontraba estos fácilmente, sin importar el contexto.
  • Errores difíciles: Algunos errores requieren un pensamiento profundo (como rastrear cómo cambia una variable a lo largo del tiempo). Estos fueron los que el robot más se dejó engañar. Si el contexto era de "confianza", pasaba por alto los errores difíciles. Si el contexto era de "suspicacia", inventaba errores difíciles falsos.

El "Ataque Cognitivo" (El peligro en el mundo real)

Los investigadores no se detuvieron solo en las pruebas; construyeron un ataque de prueba de concepto.

Imagina que un hacker quiere introducir código peligroso en el software de una empresa. En lugar de intentar hackear el cerebro del robot directamente (lo cual es difícil), el hacker simplemente falsifica el papeleo.

  • Escribe el código.
  • Adjunta un correo falso diciendo que proviene de un famoso experto en seguridad (Efecto Halo).
  • Escribe una nota diciendo: "Mantengamos el flujo de trabajo, no seamos demasiado exigentes" (Encuadre).
  • Adjunta un informe falso diciendo: "Los escaneos previos dijeron que esto es seguro" (Anclaje).

El Resultado: El robot, al ver este paquete "tranquilizador", decidió que el código peligroso era SEGURO. El ataque logró suprimir hasta el 97% de las vulnerabilidades que el robot habría detectado normalmente.

La conclusión final

Este artículo demuestra que los Modelos de Lenguaje Extensos (LLM) utilizados para la seguridad no son máquinas objetivas. Están influenciados por los mismos trucos psicológicos que influyen en los humanos.

  • Confían en las personas equivocadas (demasiado en los expertos, muy poco en los juniors).
  • Reaccionan a cómo haces la pregunta (miedo vs. comodidad).
  • Se quedan estancados en las primeras impresiones (informes previos).

¿La parte más peligrosa? No necesitas ser un hacker genio para romperlos. Solo necesitas saber cómo escribir un correo electrónico convincente o un mensaje de commit que parezca profesional. El robot no está roto; simplemente es humano en sus defectos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →