← Últimos artículos
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

Este artículo presenta el método PRESTO, el cual mejora el alineamiento de seguridad profundo en los LLM de código abierto al igualar los rangos de tokens en la distribución objetivo para contrarrestar eficazmente el nuevo ataque de Prefilling Asistido por Rango (RAP), logrando una mejora de hasta 4.7 veces en seguridad en comparación con las defensas estándar de aumentación de datos.

Autores originales: Jason Vega, Gagandeep Singh

Publicado 2026-07-23
📖 3 min de lectura☕ Lectura para el café

Autores originales: Jason Vega, Gagandeep Singh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras pueden escribir historias, resolver problemas matemáticos y charlar tal como lo hacen los humanos. Estos se llaman Modelos de Lenguaje Extensos (LLM, por sus siglas en inglés), y son como asistentes digitales súper inteligentes. Pero debido a que son tan inteligentes, existe una preocupación: ¿qué pasa si alguien los engaña para que digan algo peligroso, como cómo construir una bomba o cómo lastimar a alguien? Para evitar esto, los científicos enseñan a estos modelos a decir "No, no puedo hacer eso" cuando se les pide cosas malas. Esto se llama "alineación de seguridad". Sin embargo, al igual que la cerradura de una puerta, estas reglas de seguridad a veces pueden ser forzadas. Una forma truculenta de hacer esto es lo que se llama un "ataque de prellenado" (prefilling attack). Imagina que estás escribiendo una historia con un amigo, pero en lugar de dejar que él comience la siguiente oración, tú escribes sigilosamente las primeras palabras tú mismo, como "Aquí está el plan para construir una bomba..." y luego le pides que termine la oración. Debido a que la computadora está diseñada para que tu historia continúe sin problemas, podría olvidar decir "No" y simplemente seguir escribiendo el plan peligroso.

Recientemente, los investigadores encontraron una forma de arreglar esto enseñando al modelo a decir "No" incluso después de que tú te cuelas con esas primeras palabras. Pero, como muestra este nuevo artículo, ese arreglo no fue lo suficientemente fuerte. Los autores descubrieron una nueva forma de engañar al modelo, llamada ataque de "Prellenado Asistido por Rango" (RAP, por sus siglas en inglés). En lugar de dejar que la computadora elija simplemente la palabra más probable para decir a continuación, un hacker puede mirar una lista de las 20 palabras sobre las que la computadora está pensando y elegir la que suene peligrosa, incluso si la computadora piensa que es muy poco probable que la diga. Es como un juego donde la computadora está tratando de elegir el camino más seguro, pero el hacker tiene permitido echar un vistazo a todos los caminos y elegir el aterrador, ignorando las advertencias de la computadora. El artículo encuentra que este nuevo truco funciona sorprendentemente bien, rompiendo la seguridad de modelos que se creían seguros.

Para detener esto, los autores proponen un nuevo método de entrenamiento llamado PRESTO. En lugar de solo intentar que la computadora diga "No" con alta confianza, PRESTO le enseña al modelo a ignorar por completo las palabras tramposas que escribiste al principio. Es como entrenar a un perro guardián para que ignore la voz de un ladrón que susurra instrucciones y solo escuche el comando del dueño. Al hacer esto, el modelo deja de permitir que las palabras peligrosas influyan en sus elecciones. Los investigadores probaron esto en tres modelos de IA populares y encontraron que PRESTO hizo que fuera mucho, mucho más difícil engañar a los modelos —hasta 4.7 veces más difícil— sin que los modelos empeoraran en sus tareas normales. Esto sugiere que, al cambiar la forma en que el modelo presta atención a lo que dices, podemos construir una IA que sea verdaderamente segura, incluso cuando alguien intenta ser más astuto que ella.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →