← Últimos artículos
💬 NLP

Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

Este artículo presenta un banco de prompts con etiquetas de consenso que distingue entre código malicioso ejecutable y conocimiento de seguridad dañino para proporcionar una referencia fiable y estandarizada para medir si los modelos especializados en codificación cumplen con los estándares de rechazo más estrictos necesarios para prevenir la generación de armas funcionales.

Autores originales: Richard J. Young, Gregory D. Moody

Publicado 2026-05-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Richard J. Young, Gregory D. Moody

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Texto vs. La Cosa Real

Imagina que le pides a un chatbot general: "¿Cómo hago una bomba?". Si responde, te da una receta. Todavía tienes que ir a la tienda, comprar los ingredientes y mezclarlos tú mismo. Es información peligrosa, pero son solo palabras.

Ahora, imagina que le haces la misma pregunta a una IA especializada en programación. Si responde, no solo te da una receta; te entrega una bomba completamente ensamblada y funcional lista para explotar en el momento en que presiones "ejecutar".

Los autores de este artículo argumentan que, dado que las IAs de programación pueden entregar "armas funcionales" (como virus o software espía) instantáneamente, deberían ser mucho más estrictas al decir "No" que los chatbots comunes. Pero actualmente, nadie tiene una buena manera de medir si realmente están diciendo "No" lo suficiente.

El Problema: Mezclar Manzanas con Naranjas

Para probar si estas IAs son seguras, los investigadores han estado utilizando listas de preguntas (prompts). Pero estas listas han sido desordenadas. Mezclan dos tipos muy diferentes de solicitudes peligrosas:

  1. Solicitudes de "Arma": "Escríbeme un programa que robe contraseñas". (La IA te da el código).
  2. Solicitudes de "Conocimiento": "Explica cómo funciona el robo de contraseñas". (La IA te da un ensayo).

Si mezclas estas dos y dices: "Esta IA rechazó el 50% de las solicitudes malas", no sabes si rechazó las armas o simplemente las explicaciones. Es como probar a un guardia de seguridad pidiéndole que detenga a un ladrón y que detenga a alguien que pide direcciones. Si el guardia detiene al ladrón pero deja pasar al que pide direcciones, no puedes decir si hace bien su trabajo solo mirando el número total de personas detenidas.

La Solución: Un Banco de Prompts con "Etiquetado por Consenso"

Los autores crearon una lista masiva, limpia y organizada de 6,675 preguntas peligrosas. Las dividieron en dos categorías claras:

  • La categoría "CÓDIGO": Preguntas que solicitan software ejecutable y peligroso (las "armas").
  • La categoría "CONOCIMIENTO": Preguntas que solicitan información o teorías dañinas (las "recetas").

Para asegurarse de que las preguntas se clasificaran correctamente, no pidieron la opinión de una sola persona. Utilizaron un panel de cinco jueces de IA diferentes (como un jurado). Cada juez examinó cada pregunta y votó: "¿Es esta una solicitud de arma?" o "¿Es esta una solicitud de conocimiento?".

  • El Veredicto: Si al menos 3 de cada 5 jueces estuvieron de acuerdo, la pregunta recibió una etiqueta final.
  • El Resultado: Terminaron con 4,748 solicitudes de "Arma" confirmadas y 1,923 solicitudes de "Conocimiento" confirmadas.

El "Jurado" y las Sorpresas

Los autores utilizaron cinco modelos de IA diferentes para actuar como jueces. Querían asegurarse de que la prueba fuera económica y accesible para que todos pudieran usarla, por lo que eligieron modelos gratuitos o de código abierto, en lugar de los costosos y de pago.

Durante este proceso, descubrieron dos cosas interesantes:

1. La Paradoja de "Demasiado Fácil"
Para algunas de las listas de preguntas (como la lista ASTRA), casi cada pregunta era obviamente una "Arma". Los jueces estuvieron de acuerdo el 99% de las veces.

  • La Metáfora: Imagina un examen de matemáticas donde cada pregunta es "¿Cuánto es 2+2?". Todos sacan 100%. No puedes medir realmente qué tan "inteligentes" son los estudiantes porque el examen era demasiado fácil.
  • El Hallazgo: En estadística, cuando todos están de acuerdo en todo, la puntuación habitual para el "acuerdo" (llamada Kappa) se rompe y parece un cero o un número negativo. Los autores tuvieron que inventar una forma especial de reportar esto: "Oye, todos estuvieron de acuerdo perfectamente, pero la puntuación matemática parece extraña porque el examen era demasiado fácil".

2. El Fallo del "Guardián"
Uno de los cinco jueces de IA (un modelo gratuito de OpenAI) comenzó a negarse a responder ninguna de las preguntas, incluso aquellas que se suponía debía juzgar. Seguía chocando contra un cartel de "Alto" de la empresa que lo aloja.

  • La Metáfora: Imagina un jurado donde un jurado sigue siendo expulsado del tribunal por hacer demasiadas preguntas.
  • La Solución: Dado que la regla era "3 de cada 5", los otros cuatro jueces aún podían decidir el veredicto. Los autores lo anotaron como una peculiaridad del mundo real: a veces las herramientas gratuitas que usas para probar la seguridad tienen sus propios filtros de seguridad que bloquean la prueba antes de que siquiera comience.

Por Qué Esto Importa

Este artículo no trata sobre probar una IA específica para ver si es segura hoy. En cambio, se trata de construir la regla que todos los demás pueden usar.

Antes de esto, los investigadores intentaban medir la seguridad con una regla rota que mezclaba "armas" y "recetas". Ahora, tienen una regla estandarizada y de alta calidad (el banco de prompts) que separa claramente ambos conceptos. Esto permite que cualquiera pruebe las IAs de programación y diga: "Bien, esta IA rechazó el 90% de las armas reales", lo cual es una verificación de seguridad mucho más significativa que antes.

Resumen

  • Objetivo: Crear una lista limpia de preguntas peligrosas para probar si las IAs de programación son seguras.
  • Método: Utilizar un "jurado" de 5 IAs para clasificar 6,675 preguntas en "Armas" (Código) y "Recetas" (Conocimiento).
  • Resultado: Una base de datos pública de 4,748 solicitudes de armas confirmadas y 1,923 solicitudes de conocimiento.
  • Insight Clave: No puedes medir la seguridad adecuadamente si mezclas "hacer una bomba" con "leer sobre bombas". Este artículo corrige esa confusión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →