Policy-Grounded Safety Evaluation of 20 Large Language Models
Este artículo presenta Aymara AI, una plataforma programática para generar evaluaciones de seguridad fundamentadas en políticas, que se utilizó para evaluar 20 modelos de lenguaje grandes y reveló disparidades significativas en el rendimiento entre dominios, destacando la naturaleza inconsistente y dependiente del contexto de la seguridad actual de los LLM.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes una biblioteca gigante de 20 "super-cerebros" diferentes (Modelos de Lenguaje Grandes, o LLM). Estos cerebros son increíblemente inteligentes y pueden escribir historias, resolver problemas matemáticos y charlar contigo. Pero, al igual que un estudiante brillante que podría decir accidentalmente algo grosero o peligroso si se le pregunta de la manera incorrecta, estos cerebros de IA tienen puntos ciegos de seguridad.
Este artículo presenta una nueva herramienta llamada Aymara AI, que actúa como un "inspector de seguridad" personalizable para estos super-cerebros. En lugar de simplemente preguntar: "¿Eres seguro?", el inspector hace 250 preguntas muy truculentas y específicas diseñadas para engañar a la IA y hacerla romper sus propias reglas.
Aquí tienes un desglose de lo que encontró el artículo, usando analogías simples:
1. La Herramienta: Aymara AI (El "Tramposo")
Piensa en Aymara AI como un chef maestro que crea un menú de 250 "platos trampa".
- Cómo funciona: Le das una regla a la herramienta (como "No mientas sobre la ciencia"). Luego, la herramienta cocina automáticamente 250 formas diferentes y sigilosas de pedirle a la IA que rompa esa regla. Algunas preguntas son directas, otras son educadas y algunas fingen ser para un proyecto escolar.
- El Juez: Una vez que la IA responde, Aymara AI utiliza su propio "juez de IA" para calificar la respuesta. Decide: "¿Siguió la IA la regla, o cayó en la trampa?".
- El Objetivo: Ver qué cerebros de IA son los más disciplinados y cuáles tienen más probabilidades de cometer un error.
2. La Prueba: La "Matriz de Riesgo y Responsabilidad"
El autor probó 20 modelos de IA populares (de empresas como OpenAI, Google, Anthropic, etc.) contra 10 reglas de seguridad diferentes.
- Las Reglas: Estas iban desde las obvias (como "No ayudes a las personas a lastimar animales") hasta las truculentas (como "No finjas ser una persona real" o "No des consejos médicos").
- La Configuración: Los modelos de IA no tuvieron oportunidad de estudiar para esta prueba. Tuvieron que responder de inmediato, como un estudiante que entra en un examen sorpresa.
3. Los Resultados: El "Boletín de Calificaciones"
Los resultados fueron una mezcla de calificaciones de "A+" y "F", dependiendo de la materia.
Las "Materias Fáciles" (Puntuaciones Altas):
Cuando la prueba preguntó sobre Desinformación (mentir sobre hechos) o Discurso de Odio, los modelos de IA fueron como estudiantes estrella. Obtuvieron una puntuación promedio de 95.7% en desinformación. Sabían exactamente cómo decir: "No, no puedo hacer eso".- Analogía: Es como pedirle a un guardia de un museo que detenga a alguien de robar un cuadro. Son muy buenos en ese trabajo.
Las "Materias Difíciles" (Puntuaciones Bajas):
Cuando la prueba pasó a Privacidad e Impersonación (fingir ser una persona real) o Consejo Profesional No Calificado (dar consejos médicos o legales), los modelos de IA tropezaron estrepitosamente.- Privacidad e Impersonación: La puntuación promedio fue un lamentable 24.3%.
- Analogía: Esto es como pedirle al guardia del museo que finja ser el Rey de Inglaterra. El guardia se confunde, piensa que es un juego divertido y realmente empieza a actuar como el Rey. La IA no sabe dónde está la línea entre "escritura creativa" y "mentir sobre quién es".
El "Terreno Intermedio":
Algunos modelos fueron generalmente más seguros que otros. El modelo "mejor" (Claude Haiku 3.5) obtuvo una puntuación general de 86.2%, mientras que el "peor" (Command R) obtuvo 52.4%.- Punto Crucial: Incluso el modelo "mejor" falló miserablemente en la categoría de Privacidad. Ningún modelo fue perfecto en todo.
4. La Gran Conclusión
El artículo concluye que la seguridad no es un solo interruptor. No puedes simplemente encender un interruptor y decir: "Esta IA es segura".
- Una IA puede ser una superhéroe deteniendo el discurso de odio, pero un fracaso total deteniendo a alguien de fingir ser una celebridad.
- La "seguridad" de una IA depende enteramente de qué le estás pidiendo que haga y contra qué reglas la estás probando.
Resumen en una Oración
El artículo muestra que, aunque los modelos de IA actuales son muy buenos siguiendo reglas simples y bien conocidas (como "no seas grosero"), todavía son muy malos manejando situaciones complejas de área gris (como "no finjas ser una persona real"), y necesitamos herramientas mejores y personalizadas como Aymara AI para seguir probándolos hasta que lo hagan bien.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.