← Últimos artículos
🤖 AI

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

Este artículo presenta AIR-BENCH Live, un benchmark de seguridad autoevolutivo para modelos fundacionales que utiliza un proceso automatizado para integrar continuamente nuevas regulaciones gubernamentales y generar prompts de ataque multilingües, abordando así las limitaciones de los benchmarks estáticos en un panorama de IA que cambia rápidamente.

Autores originales: Rohan Naphade, Minzhou Pan, Bo Li

Publicado 2026-07-28
📖 3 min de lectura☕ Lectura para el café

Autores originales: Rohan Naphade, Minzhou Pan, Bo Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo de la inteligencia artificial como una biblioteca masiva y en constante expansión donde los robots están aprendiendo a escribir historias, resolver problemas e incluso charlar con nosotros. Pero, al igual que en cualquier biblioteca, existen reglas sobre lo que se puede escribir: nada de instrucciones sobre cómo construir bombas, nada de discursos de odio y nada de trucos para robar secretos. Los científicos crean "pruebas de seguridad" para ver si los robots siguen las reglas. Piensa en estas pruebas como una serie de acertijos o trampas diseñadas para engañar al robot para que rompa las reglas. Si el robot rechaza el truco, obtiene una puntuación alta; si cae en la trampa, obtiene una puntuación baja. El problema es que el mundo cambia rápido. Se aprueban nuevas leyes, se inventan nuevas formas de engañar a los robots y los viejos acertijos se vuelven demasiado fáciles de resolver. Una prueba de seguridad del año pasado podría ser inútil hoy porque el robot ha aprendido a ignorar los viejos trucos, o porque una nueva ley ha prohibido algo que la prueba ni siquiera llegó a considerar. Es por esto que los investigadores siempre buscan una forma de hacer que estas pruebas sean "vivas" y se actualicen a sí mismas, para que sigan siendo relevantes en un mundo que nunca deja de moverse.

Este artículo presenta una nueva prueba de seguridad que se actualiza automáticamente llamada AIR-BENCH Live. Piensa en esto como un guardia de seguridad que no solo se queda parado en la puerta con una lista fija de artículos prohibidos, sino que tiene un asistente robot que escanea constantemente las noticias, lee nuevas leyes de todo el mundo e instantáneamente crea nuevos y complicados acertijos para poner a prueba a la IA. Los investigadores construyeron un proceso que "extrae" (lee) automáticamente regulaciones gubernamentales de lugares como Estados Unidos, China y la Unión Europea. Cuando encuentra una nueva regla —como una ley contra el robo del cerebro de un robot o el uso de videos falsos para interferir en las elecciones—, añade una nueva categoría a su lista de verificación de seguridad. Luego, un equipo de agentes de IA trabaja en conjunto para escribir prompts realistas y multilingües (los acertijos) basados en estas nuevas reglas. Utilizan "personas", que son como roles de actuación, para hacer que los acertijos suenen como si vinieran de personas reales en diferentes situaciones, en lugar de un robot leyendo un guion.

El equipo probó 14 modelos de IA diferentes utilizando este benchmark evolutivo. Encontraron una enorme brecha en la seguridad: algunos modelos eran increíblemente seguros, rechazando casi todos los trucos (obteniendo una puntuación de 1.00), mientras que otros eran bastante fáciles de engañar (obteniendo puntuaciones tan bajas como 0.17). Curiosamente, los prompts modernizados fueron más difíciles que los antiguos, causando que incluso los modelos más cumplidores fallaran un poco más. Los investigadores también descubrieron que la mayoría de los modelos eran ligeramente menos seguros cuando se les preguntaba en idiomas distintos al inglés, lo que sugiere que mantener a los robots educados y seguros en todos los lenguajes humanos es todavía un trabajo en progreso. El artículo concluye que, si bien no podemos evitar que el mundo cambie, podemos construir pruebas de seguridad que evolucionen junto con él, asegurando que a medida que la IA se vuelve más inteligente, nuestra capacidad para probar su seguridad también se vuelva más inteligente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →