← Últimos artículos
🤖 machine learning

Random Logit Scaling: Defending Deep Neural Networks Against Black-Box Score-Based Adversarial Example Attacks

Este artículo presenta Random Logit Scaling (RLS), una defensa de postprocesamiento plug-and-play que contrarresta eficazmente los ataques adversarios de caja negra basados en puntuaciones mediante el escalado aleatorio de los logits para confundir a los atacantes mientras preserva la precisión del modelo, y simultáneamente expone la vulnerabilidad de la defensa de vanguardia AAA ante ataques adaptativos.

Autores originales: Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh

Publicado 2026-07-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo de la inteligencia artificial como una biblioteca gigante y superinteligente donde las computadoras aprenden a reconocer cosas, como detectar un gato en una foto o identificar una canción. Durante mucho tiempo, estas computadoras fueron como estudiantes tímidos que solo respondían preguntas si les mostrabas el libro de texto (el código interno). Pero en el mundo real, a menudo simplemente les hacemos preguntas y obtenemos respuestas sin ver cómo piensan. Esto se llama una "caja negra".

El problema comienza cuando un hacker travieso intenta engañar a la computadora. No necesitan irrumpir en la biblioteca; solo necesitan susurrar un cambio diminuto, casi invisible, en una imagen—como añadir unas pocas motas de polvo a la foto de un panda. A nuestros ojos, sigue pareciendo un panda, pero la computadora de repente grita: "¡Eso es una tostadora!". Esto se llama un "ataque adversarial". Es un problema enorme porque si no podemos confiar en que estos sistemas inteligentes vean el mundo correctamente, no podemos usarlos para trabajos importantes como coches autónomos o diagnósticos médicos. Los hackers han encontrado formas ingeniosas de hacer esto incluso cuando no pueden ver el cerebro de la computadora, simplemente haciéndole preguntas una y otra vez y observando cómo cambia de opinión.

Ahora, entran los héroes de esta historia: un equipo de investigadores que decidió contraatacar con su propio truco. Llaman a su nueva defensa "Escalamiento de Logit Aleatorio" (RLS, por sus siglas en inglés). Piensa en el cerebro de la computadora como un chef que prueba una sopa y decide si está "muy salada" o "ligeramente salada". Normalmente, el chef da un número preciso, como "8 de 10". Pero el hacker utiliza ese número para averiguar exactamente cómo ajustar la receta para que la sopa sepa a algo más.

La idea de los investigadores es simple pero brillante: ¿qué pasaría si el chef miente? Cada vez que el hacker pregunta: "¿Qué tan salada está esto?", el chef decide aleatoriamente multiplicar la respuesta por un número secreto. A veces el chef dice "16 de 10" (haciendo que parezca súper salada) y otras veces "0.8 de 10" (haciendo que parezca apenas salada). El chef todavía sabe que la sopa está salada, por lo que sigue sirviendo el plato correcto (la respuesta correcta), pero los números que grita están completamente desordenados.

Aquí es donde ocurre la magia. El hacker, que está intentando resolver un rompecabezas matemático para engañar a la computadora, de repente encuentra que las pistas que recibe están por todas partes. Un segundo los números suben, al siguiente bajan, y el patrón es tan caótico que el hacker se confunde por completo. Es como intentar encontrar un tesoro escondido cuando el mapa cambia la ubicación de la X cada vez que miras. Los investigadores probaron esto contra algunos de los hackers más inteligentes y agresivos del mundo. Descubrieron que este simple truco hizo que la tasa de éxito de los hackers cayera drásticamente—a veces hasta un 80%—sin hacer que la computadora fuera más lenta o menos precisa en su trabajo real.

Sin embargo, el artículo también nos advierte que no todas las defensas son perfectas. Analizaron otra defensa popular llamada "AAA", que intenta remodelar los números de una manera específica y predecible para confundir a los hackers. Los investigadores demostraron que si un hacker conoce este truco, puede adaptarse y romperlo, algo así como un cerrajero que aprende el patrón específico de una nueva cerradura. Pero la defensa de Escalamiento de Logit Aleatorio es diferente porque utiliza pura aleatoriedad, lo que la hace mucho más difícil de predecir o romper.

En resumen, el artículo sugiere que al añadir una capa de ruido aleatorio a las puntuaciones de confianza de la computadora, podemos crear una "niebla de guerra" para los atacantes. La computadora se mantiene aguda y precisa, pero el hacker se queda tropezando en la oscuridad, incapaz de encontrar el camino para engañarla. Es un escudo ligero y fácil de usar que no requiere reconstruir toda la computadora, solo un simple ajuste en la forma en que comunica sus respuestas. Si bien esto cambia los números que la computadora grita (lo que podría importar para algunas tareas muy específicas), mantiene la decisión final correcta y hace que sea increíblemente difícil para los hackers causar problemas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →