Position: Adversarial ML for LLMs Is Not Making Any Progress
Este artículo de posición argumenta que la investigación en aprendizaje automático adversarial ha retrocedido en la era de los grandes modelos de lenguaje, ya que el campo ahora aborda problemas cada vez más mal definidos, difíciles y difíciles de evaluar, lo que plantea la preocupación de que otra década de trabajo pueda no producir ningún progreso significativo.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que el campo de la seguridad de la Inteligencia Artificial es un juego de "Cerrajero contra Ladrón".
Durante la última década, los cerrajeros (investigadores de seguridad) y los ladrones (adversarios) han estado jugando un juego muy específico y bien definido. Solían probar cerraduras simples en cajas pequeñas y robustas. Las reglas eran claras:
- El Objetivo: El ladrón intenta abrir la caja sin romper la cerradura.
- Las Reglas: El ladrón solo puede mover la cerradura una cantidad mínima y específica (como agitar una llave apenas un milímetro).
- La Puntuación: Si la caja se abre, el ladrón gana. Si permanece cerrada, el cerrajero gana.
Este juego era difícil, pero todos sabían exactamente cómo medir quién estaba ganando.
La Gran Reclamación del Artículo
Ahora, el juego ha cambiado. En lugar de pequeñas cajas, estamos intentando asegurar "asistentes inteligentes" masivos y de naturaleza abierta (Modelos de Lenguaje Extensos o LLM) que pueden hablar de cualquier cosa y hacer cualquier cosa. Los autores de este artículo argumentan que el juego se ha roto. Afirman que, en esta nueva era, el campo está girando sobre sus propios ejes sin avanzar realmente porque las reglas del juego son ahora un desastre.
Aquí explicamos por qué, mediante analogías sencillas:
1. Las Reglas del Juego han Desaparecido (Definiendo el Problema)
En el viejo juego, "ganar" era fácil de detectar: ¿Se abrió la caja?
En el nuevo juego, la "caja" es un chatbot. El objetivo no es solo abrirla; es lograr que el chatbot diga algo "malo".
- La Analogía: Imagina pedirle a un ladrón que "robe algo malo". ¿Qué es "malo"? ¿Es robar un chocolate? ¿Un coche? ¿Una receta secreta?
- El Problema: Debido a que lo "malle" es subjetivo, los investigadores no logran ponerse de acuerdo en qué cuenta como un ataque exitoso. Un investigador podría decir: "¡Hizo que el bot dijera una mala palabra, así que ganó!". Otro podría decir: "Pero la mala palabra fue inofensiva, así que perdió". Sin un marcador claro, no podemos saber si los cerrajeros están realmente mejorando en su trabajo.
2. El Ladrón tiene Herramientas Infinitas (Resolviendo el Problema)
En el viejo juego, al ladrón solo se le permitía mover la cerradura un poquito. Esto mantenía el juego justo y medible.
En el nuevo juego, el ladrón puede hacer cualquier cosa.
- La Analogía: El ladrón ahora puede usar un disfraz, sobornar al guardia, abrir la cerradura con un láser o simplemente convencer al guardia para que le abra la puerta.
- El Problema: Debido a que el ladrón tiene infinitas formas de atacar, los investigadores no pueden escribir un programa de computadora para encontrar el ataque del "peor escenario". De hecho, el artículo señala que los humanos son actualmente mejores rompiendo estos modelos que las computadoras. Los mejores "ladrones" son ahora personas usando la creatividad y la ingeniería social, no las matemáticas. Esto hace imposible construir una "cerradura perfecta" porque no puedes probar contra todos los trucos humanos posibles.
3. El Marcador está Roto (Evaluando los Resultados)
En el viejo juego, podías contar exactamente cuántas cajas se abrieron.
En el nuevo juego, usamos otros bots de IA para juzgar si un chatbot dijo algo "malo".
- La Analogía: Imagina pedirle a un robot que juzgue si una pintura es "fea". El robot podría simplemente decir: "Si no es un dibujo de un gato, es feo". O, el robot podría ser engañado por el ladrón para que diga: "No, eso es en realidad hermoso".
- El Problema: Las herramientas que usamos para medir el éxito son defectuosas. Son fácilmente engañadas, no entienden el matiz humano y a menudo dan falsas alarmas. Además, las "cerraduras" (los modelos de IA) suelen pertenecer a grandes empresas que las actualizan en secreto. Si una empresa cambia la cerradura de la noche a la mañana, los investigadores no pueden comparar sus resultados del mes pasado con los de este mes. Es como intentar comparar dos fotos de una casa, pero la casa cambia de color y de forma entre cada toma.
Los Casos de Estudio (La Evidencia)
El artículo analiza seis áreas específicas donde este "juego roto" está ocurriendo:
- Jailbreaks (Evasión de restricciones): Intentar engañar a un bot para que diga "no". Es difícil definir cómo se ve un "no" cuando el bot es muy hablador.
- Modelos no finetuneables (No ajustables): Intentar hacer que un bot sea tan inteligente que no pueda aprender nuevos trucos peligrosos. Pero si el ladrón puede reentrenar al bot, el juego cambia por completo.
- Envenenamiento (Poisoning): Intentar introducir datos malos en el entrenamiento del bot. Pero los datos de entrenamiento son tan enormes y desordenados (como una biblioteca con millones de libros) que no puedes distinguir qué libro causó el problema.
- Inyecciones de Prompt (Prompt Injections): Engañar a un bot para que ignore sus reglas. Dado que el bot puede hablar indefinidamente, el ladrón puede colar instrucciones maliciosas a lo largo de una conversación larga, haciendo que sea difícil detectarlas.
- Privacidad: Intentar ver si el bot "memorizó" los datos de una persona específica. Pero como el bot aprendió de todo internet, es imposible saber si aprendió de esa persona específica o simplemente de información similar en otros lugares.
- Desaprendizaje (Unlearning): Intentar hacer que el bot "olvide" un tema específico (como cómo construir una bomba). Pero no puedes simplemente borrar un dato del cerebro; podrías borrar accidentalmente la capacidad del bot para la biología entera.
La Conclusión
Los autores no dicen que debamos dejar de intentar asegurar la IA. Dicen que estamos intentando resolver un rompecabezas con piezas faltantes y sin la imagen en la caja.
Argumentan que, durante la próxima década, podríamos seguir publicando artículos que parecen progreso, pero debido a que las reglas son difusas y las pruebas no son fiables, en realidad no estamos logrando una mayor seguridad.
Su Consejo:
En lugar de intentar asegurar toda la caótica y abierta IA, los investigadores deberían elegir problemas "de juguete" pequeños, específicos y bien definidos (como el viejo juego de "mover la cerradura un milímetro"). Si ni siquiera podemos resolver esos problemas pequeños y claros con rigor, no tenemos esperanza de resolver los problemas masivos y desordenados del mundo real.
En resumen: Estamos intentando construir una fortaleza contra un enemigo que puede cambiar de forma, atacar desde cualquier ángulo y juzgar su propia victoria, usando una regla que no deja de encogerse. Hasta que no arreglemos las reglas y la regla, no estamos progresando realmente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.