Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)
Este artículo presenta una revisión sistemática de trece corpus de prompts de código malicioso utilizados para evaluar la negativa de los LLM de codificación, identificando lagunas metodológicas críticas en las líneas base de anotación humana, la comparabilidad entre corpus y la estandarización de taxonomías, al tiempo que propone un marco unificado para la construcción futura de conjuntos de datos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde intentamos enseñar a robots gigantes y superinteligentes (llamados Modelos de Lenguaje Grande o LLM) cómo ser buenos ciudadanos. Específicamente, queremos saber: Si alguien le pide a estos robots que escriban un virus informático o un estafa, ¿dirán "No"?
Para probar esto, los investigadores han estado creando "exámenes" (conjuntos de datos de prompts) para engañar a los robots. Este artículo es una revisión masiva de las calificaciones de 13 exámenes diferentes creados entre 2023 y 2025. Los autores, Richard Young y Gregory Moody, examinaron todos estos exámenes para ver cómo se construyeron, qué tan justos eran y qué evaluaban realmente.
Aquí está el desglose de sus hallazgos, usando analogías simples:
1. El Problema: Todos Están Usando una Regla Diferente
Imagina intentar comparar la estatura de 13 personas diferentes. Pero aquí está la trampa:
- La Persona A se mide con una regla en pulgadas.
- La Persona B se mide con una cinta métrica en centímetros.
- La Persona C se mide contando cuántos pasos da para llegar a una pared.
- La Persona D la mide una persona completamente diferente.
El artículo argumenta que esto es exactamente lo que está sucediendo con estas pruebas de seguridad de IA. Cada uno de los 13 exámenes (como AdvBench, CyberSecEval, RedCode, etc.) se construyó de manera diferente:
- Preguntas Diferentes: Algunos piden código directamente; otros piden código a través de una historia compleja; algunos piden a la IA que actúe como un hacker; otros piden que actúe como un asistente útil que podría cometer un error.
- Calificadores Diferentes: Algunos exámenes son calificados por los autores solos. Algunos son calificados por otros bots de IA. Algunos son calificados ejecutando el código en un entorno aislado (sandbox) para ver si explota.
- Reglas Diferentes: Algunos exámenes tienen reglas estrictas sobre qué cuenta como un "virus". Otros son vagos.
El Resultado: No puedes simplemente tomar la "tasa de rechazo" (con qué frecuencia la IA dijo "No") de un examen y compararla con otro. Es como comparar el tiempo de un velocista con el de un nadador y declarar que uno es "más rápido" sin tener en cuenta los diferentes deportes.
2. Las Tres Piezas Clave que Faltan
Los autores descubrieron que ninguno de los 13 exámenes incluía tres características de seguridad críticas que esperarías en un estudio científico serio:
- Sin "Jueces Humanos" para Calibrar a la IA: La mayoría de los exámenes utilizan otros bots de IA para calificar las respuestas. Pero el artículo señala que no sabemos si estos calificadores de IA son realmente correctos. Es como tener un robot calificando un examen de matemáticas sin que un profesor humano verifique nunca si la clave de calificación del robot es correcta. Ninguno de los 13 artículos tenía una puntuación de "kappa de Fleiss" (una forma estadística de demostrar que diferentes jueces humanos estarían de acuerdo en la misma respuesta).
- Sin "Puertas Cerradas" (Acceso Restringido): Estos exámenes contienen instrucciones sobre cómo crear software peligroso (malware). Sin embargo, todos los 13 están completamente abiertos al público. Cualquiera puede descargarlos, incluso si tienen malas intenciones. Es como publicar un libro de cocina para hacer bombas y dejarlo en un banco de parque para que cualquiera lo recoja.
- Sin "Política de Retiro" (Eliminación): Si alguien encuentra un prompt peligroso en estos exámenes que no debería estar allí, o si la IA aprende de él y comienza a crear virus reales, no hay una forma oficial de contactar a los autores para retirarlo. Ninguno de los artículos listaba una "política de retirada" ni una persona específica responsable de eliminar el contenido dañino.
3. Los "Asientos Vacíos" en el Aula
Los autores crearon un mapa (una taxonomía) para mostrar qué tipos de "preguntas trampa" existen. Descubrieron que los investigadores están todos sentados en los mismos pocos asientos, dejando muchos otros vacíos:
- Asientos Abarrotados: La mayoría de los exámenes piden código en una sola oración directa (por ejemplo, "Escribe un virus").
- Asientos Vacíos: Muy pocos exámenes prueban escenarios complejos, como:
- Pedirle a la IA a lo largo de una conversación larga (multi-turno) que construya lentamente un virus.
- Pedirle a la IA que actúe como un agente autónomo que controla una computadora.
- Pedir código que ataque hardware (como refrigeradores inteligentes o chips de automóviles) en lugar de solo software.
Como los "asientos" están desiguales, los datos están sesgados. Sabemos mucho sobre cómo la IA maneja solicitudes simples, pero sabemos muy poco sobre cómo maneja ataques complejos y de múltiples pasos.
4. Las Recomendaciones: Cómo Arreglar el Aula
El artículo sugiere que si queremos construir mejores "exámenes" en el futuro, necesitamos seguir una nueva lista de verificación:
- Pre-registrar las Reglas: Antes de construir el examen, escribe exactamente qué estás probando para no cambiar las reglas a mitad de camino.
- Usar un Panel de Jueces Humanos: No uses solo una IA para calificar. Usa un grupo diverso de humanos (o una mezcla de humanos y diferentes IAs) para ponerse de acuerdo sobre qué cuenta como un "rechazo".
- Reportar la Puntuación de Acuerdo: Publica una estadística que muestre que los jueces realmente estuvieron de acuerdo entre sí.
- Usar un Diccionario Estándar: Acuerda una sola lista de "cosas malas" (tipos de malware) para que todos estén contando las mismas categorías.
- Cerrar la Puerta: Si el examen contiene instrucciones peligrosas, haz que sea difícil de obtener (requiere una solicitud de investigador) para que los actores maliciosos no puedan descargarlo fácilmente.
- Nombrar a un Guardián: Ten una persona específica responsable de retirar el examen si causa daño.
Resumen
Este artículo es una "revisión sistemática", lo que significa que no realizó nuevos experimentos. En su lugar, actuó como un bibliotecario que entró en una habitación con 13 libros diferentes de "Pruebas de Seguridad", los abrió todos y se dio cuenta: "Todos estamos midiendo cosas diferentes con reglas rotas, y estamos dejando las partes peligrosas de estos libros al aire libre para que cualquiera las encuentre."
Los autores piden a la comunidad que deje de construir estas pruebas de forma aislada y comience a acordar una forma estándar, segura y justa de medir si la IA se niega realmente a hacer cosas malas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.