AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation
Esta encuesta investiga la crisis de confianza en la evaluación de vulnerabilidades impulsada por IA causada por el "AI slop" y las alucinaciones, argumentando que cerrar la brecha entre la generación probabilística de los LLM y el razonamiento deductivo experto requiere pasar de la detección pasiva a la verificación neuro-simbólica activa e introducir métricas de evaluación matemáticamente verificables como CVE-Bench y Slop-Score.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: El "AI Slop" y las Alucinaciones en la Evaluación de Vulnerabilidades
1. Declaración del Problema
La integración de los Modelos de Lenguaje de Gran Escala (LLM) en la evaluación de vulnerabilidades de ciberseguridad ha introducido una "crisis de confiabilidad" impulsada por la proliferación del "AI slop" (desechos de IA). A diferencia de los falsos positivos tradicionales derivados de las pruebas estáticas de seguridad de aplicaciones (SAST) basadas en reglas conservadoras, el AI slop consiste en artefactos de seguridad (informes, pruebas de concepto, parches) que exhiben una alta fluidez lingüística y plausibilidad estructural, pero carecen de validez semántica o fundamentación ejecutable.
Estos artefactos incluyen:
- Vulnerabilidades alucinadas: CVEs (Common Vulnerabilities and Exposures) fabricados, APIs inexistentes y rutas de ejecución inconexas.
- Síntesis de parches incorrectos: Correcciones que abordan síntomas superficiales ignorando las causas raíz, o parches que introducen nuevas regresiones.
- Repetición semántica: La transformación de conocimiento existente o correcciones "silenciosas" (no divulgadas) en informes que parecen novedosos y autoritativos.
Este fenómeno crea una carga cognitiva en los canales de triaje humano que emula un ataque de denegación de servicio (DoS). El problema central es una brecha de razonamiento fundamental: los expertos en seguridad humanos dependen de un razonamiento deductivo causal y de múltiples pasos fundamentado en las restricciones del sistema, mientras que los LLM autorregresivos operan mediante la generación probabilística de tokens basada en correlaciones estadísticas. Cuando la información excede el horizonte de razonamiento de un LLM, este recurre a continuaciones estadísticamente plausibles en lugar de hechos verificados.
2. Metodología
El documento emplea una revisión sistemática de la literatura y un análisis conceptual para examinar la evidencia empírica y formalizar el problema.
- Búsqueda de Literatura: Los autores consultaron IEEE Xplore, ACM Digital Library y arXiv utilizando palabras clave relacionadas con LLM y seguridad. Dos revisores independientes filtraron los resultados, reteniendo estudios con evidencia empírica de modos de falla de los LLM en contextos de seguridad.
- Construcción de la Taxonomía: Las fallas se categorizaron en tres ramas principales basadas en la naturaleza de la falla de razonamiento.
- Análisis de Brechas: El documento contrasta los modelos cognitivos humanos (deductivos, preservadores de invariantes) con las limitaciones arquitectónicas de los LLM (probabilísticos, limitados por la ventana de contexto).
- Propuesta de Métricas: Los autores operacionalizan la brecha de razonamiento a través de un proxy medible, la Puntuación de Cobertura Deductiva (DCS), y proponen nuevos instrumentos de evaluación (CVE-Bench, Slop-Score).
- Revisión Arquitectónica: Se revisan y critican las estrategias de mitigación existentes (detección pasiva, marcas de agua), seguidas de una propuesta para arquitecturas de verificación neuro-simbólica activa.
3. Contribuciones Clave
A. Formalización y Taxonomía del AI Slop
El documento define el AI slop en ciberseguridad y establece una taxonomía que comprende tres modos de falla distintos:
- Vulnerabilidades Alucinadas: El modelo inventa fallos (por ejemplo, CVEs fabricados, APIs inexistentes) para satisfacer las expectativas del prompt. Esto incluye la alucinación de sicofancia (encontrar errores en código seguro) y la confusión por sesgo de token (el juicio cambia basado en cambios sintácticos superficiales).
- Síntesis de Parches Incorrectos: Los modelos generan parches que compilan y pasan pruebas superficiales, pero no resuelven el problema subyacente o introducen nuevas regresiones de seguridad (por ejemplo, cambiar un CWE por otro).
- Repetición Semántica: Los modelos reconfiguran información existente (incluyendo correcciones silenciosas de commits de código abierto) en informes "novedosos". Esto explota la falta de verdad de base pública para las correcciones no divulgadas, haciendo que las afirmaciones reconfiguradas sean indetectables mediante validación de búsqueda.
B. Análisis de la Brecha de Razonamiento
El documento identifica la causa raíz como la divergencia entre el razonamiento deductivo humano y la generación probabilística de los LLM:
- Expertos Humanos: Construyen modelos mentales, rastrean el flujo de datos a través de fronteras procedimentales y verifican restricciones. Tratan los hallazgos con escepticismo hasta que se prueban.
- LLMs: Estiman las probabilidades de los tokens basándose en distribuciones de entrenamiento. Unen patrones familiares (llamadas a la API, nombres de variables) sin verificar un solo camino de ejecución.
- Limitaciones de las Mitigaciones Actuales: Los autores argumentan que el Chain-of-Thought (CoT) y los agentes que usan herramientas estrechan, pero no cierran esta brecha. El CoT a menudo resulta en cadenas de razonamiento más largas pero igualmente incorrectas, y el uso de herramientas suele llevar a la "confabulación de uso de herramientas", donde los agentes malinterpretan las salidas de las herramientas.
C. Crítica de la Detección Pasiva y el Marcado de Agua (Watermarking)
El documento sostiene que las estrategias de mitigación actuales dirigidas a la proveniencia (determinar si un texto fue escrito por una máquina) están desalineadas con la necesidad de corrección.
- Detección Estadística: Falla porque los informes de seguridad son inherentemente formularios (baja diversidad léxica), lo que causa altos falsos positivos para informes escritos por humanos.
- Marcado de Agua (Watermarking): Es incompatible con la lógica de seguridad; forzar la selección de tokens con marca de agua en dominios de código restringidos a menudo rompe la lógica o crea payloads inválidos.
D. Soluciones Propuestas e Instrumentos de Evaluación
- Verificación Neuro-Simbólica: Los autores abogan por una arquitectura donde los LLM actúen como generadores de hipótesis, y sus salidas sean sometidas a una verificación determinista (Análisis Estático, Fuzzing Dinámico, Ejecución Simbólica) antes de llegar a los analistas humanos.
- Puntuación de Cobertura Deductiva (DCS): Una métrica que cuantifica el grado en que una afirmación de vulnerabilidad está fundamentada en evidencia explícita y verificable (por ejemplo, referencias de código específicas, trazas de ejecución) frente a la interpolación estadística.
- CVE-Bench: Un benchmark diseñado para probar la capacidad de los sistemas de triaje para separar informes fundamentados de rutas de explotación fantasmales y fluidas, utilizando una verdad de base validada por ejecución.
- Slop-Score: Una métrica continua que cuantifica la brecha entre la fluidez lingüística y la sustancia verificable, penalizando los artefactos que son fluidos pero carecen de densidad de evidencia o satisfacción de restricciones.
4. Resultados y Hallazgos
- Evidencia Empírica: La encuesta destaca que aproximadamente el 20% de los informes en algunos programas de bug bounty (por ejemplo, HackerOne a mediados de 2025) fueron identificados como AI slop de baja calidad, lo que llevó a la interrupción de ciertos programas (por ejemplo, el programa de recompensas de cURL en 2026) debido a la incapacidad de distinguir informes válidos del ruido generado por IA.
- Déficit de Fundamentación: Una revisión de trabajos representativos (Tabla 1) revela que ningún estudio proporciona validación a nivel de ejecución de las salidas de los LLM. La fundamentación más fuerte encontrada es la comprobación de compilación o el análisis estático, que operan muy por debajo de los requisitos de un razonamiento de seguridad riguroso.
- Falla de los Puentes Parciales: Aunque herramientas como ReAct y la Generación Aumentada por Recuperación (RAG) reducen las alucinaciones fácticas (por ejemplo, inventar CVEs inexistentes), no logran abordar las alucinaciones lógicas (extraer inferencias causalmente incorrectas a partir de hechos precisos).
5. Significado y Reivindicaciones
El documento se posiciona como una encuesta, análisis conceptual y hoja de ruta. Su principal significancia radica en desplazar el paradigma de evaluación de la fluidez lingüística hacia la verificabilidad matemática.
- Falla Estructural: Los autores afirman que el AI slop no es simplemente un problema de rendimiento, sino una falla estructural donde la generación probabilística sustituye a la verificación causal.
- Confiabilidad: La confianza en el triaje impulsado por IA no se puede lograr únicamente mediante mejores prompts o el seguimiento de la proveniencia. Requiere una verificación neuro-simbólica activa que mapee cada componente del proceso a sistemas previos con límites documentados (por ejemplo, los límites de explosión de rutas de la ejecución simbólica).
- Dirección Futura: El documento concluye que la IA confiable en ciberseguridad surgirá de sistemas que traten la generación como el punto de partida de un proceso de verificación, asegurando que el juicio humano se ejerza solo sobre afirmaciones que hayan sobrevivido a las pruebas deterministas. Las métricas propuestas (DCS, Slop-Score) y los benchmarks (CVE-Bench) están destinados a proporcionar la infraestructura necesaria para eliminar esta falla estructural del sistema.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.