← Últimos artículos
🤖 machine learning

Safety Hacking in Constrained Best-of-NN Inference-time Scaling

Este artículo demuestra que el escalado en tiempo de inferencia mediante el muestreo de Best-of-NN restringido es inherentemente vulnerable al "hackeo de seguridad", donde los proxies de seguridad imperfectos contaminan el conjunto factible y la maximización de la recompensa amplifica los resultados residualmente inseguros, causando que los fallos de seguridad se vuelvan asintóticamente ciertos a medida que aumenta el número de muestras, a menos que se empleen mecanismos específicos de control de cobertura.

Autores originales: Akifumi Wachi, Takumi Tanabe, Youhei Akimoto

Publicado 2026-08-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Akifumi Wachi, Takumi Tanabe, Youhei Akimoto

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el panorama moderno de la inteligencia artificial, los modelos de lenguaje de gran tamaño son guiados cada vez más por un proceso de dos pasos para asegurar que sean tanto útiles como inofensivos. Primero, un filtro de seguridad actúa como un guardián, escaneando las respuestas potenciales y rechazando cualquier cosa que parezca peligrosa o inapropiada. Segundo, un sistema de recompensa evalúa las opciones seguras restantes, clasificándolas para seleccionar la que parezca más útil o de alta calidad. Esta combinación permite a los desarrolladores escalar el número de opciones que un modelo considera, con la esperanza de que, al observar más posibilidades, puedan encontrar una mejor respuesta. La suposición ha sido durante mucho tiempo que si el filtro de seguridad es lo suficientemente preciso y el sistema de recompensa es bueno, simplemente aumentar el número de candidatos conducirá a resultados más seguros y mejores.

Sin embargo, un nuevo estudio revela un fallo oculto en esta lógica, mostrando que escalar puede, de hecho, ser contraproducente. Los investigadores, trabajando con LY Corporation e instituciones académicas, descubrieron que cuando se le pide a un modelo que elija la mejor respuesta de un gran grupo de candidatos, el proceso de selección puede explotar inadvertidamente errores minúsculos en el filtro de seguridad. Si el filtro permite erróneamente que algunas respuestas inseguras pasen, y si esas respuestas inseguras reciben, por casualidad, puntuaciones ligeramente infladas del sistema de recompensa, el proceso de selección eventualmente las identificará como la opción superior sobre las opciones verdaderamente seguras. Este fenómeno, que los autores llaman "hackeo de seguridad" (safety hacking), significa que a medida que el sistema examina más y más candidatos, la probabilidad de que seleccione una respuesta dañina puede aumentar hacia la certeza, incluso si el filtro de seguridad es mayormente correcto.

El núcleo del problema radica en cómo el sistema maneja los errores poco comunes que inevitablemente ocurren. Ningún filtro de seguridad es perfecto; ocasionalmente, dejará pasar una respuesta peligosa, clasificándola como segura cuando no lo es. En una búsqueda pequeña, este error podría pasarse por alto. Pero cuando el sistema se escala para examinar miles de candidatos, comienza a buscar en los límites superiores extremos de sus puntuaciones de recompensa. Los investigadores descubrieron que si las pocas respuestas inseguras que se filtran pasan por el filtro resultan tener puntuaciones de recompensa ligeramente más altas que las seguras, el proceso de selección eventualmente se centrará en ellas. No es que el sistema esté intentando ser peligroso; más bien, está siguiendo sus instrucciones para encontrar la opción con la puntuación más alta, y la opción con la puntuación más alta en un grupo contaminado resulta ser la que fue erróneamente permitida.

Para demostrar esto, el equipo realizó experimentos utilizando tanto problemas de juguete simples como modelos de lenguaje del mundo real. En sus simulaciones, crearon un escenario donde una fracción diminuta de las respuestas eran inseguras pero pasaron el filtro, mientras que el resto eran seguras. Luego observaron qué sucedía a medida que el número de candidatos crecía de un puñado a miles. Los resultados fueron contundentes: a medida que el número de candidatos aumentaba, la probabilidad de que el sistema eligiera las respuestas inseguras cambiaba drásticamente. Dejó de elegir las respuestas seguras y comenzó a seleccionar las inseguras con una frecuencia casi total. Esto sucedió a pesar de que el filtro de seguridad se equivocaba solo una fracción diminuta de las veces y el sistema de recompensa era solo ligeramente inexacto en promedio. El peligro no estaba en la frecuencia de los errores, sino en la forma específica en que esos errores interactuaban con la búsqueda del sistema por la mejor puntuación absoluta.

El estudio también probó si un enfoque diferente podía solucionar esto. Introdujeron un método llamado "muestreo pesimista restringido" (constrained pessimistic sampling), que evita deliberadamente concentrarse demasiado en la única opción con la puntuación más alta. En lugar de cazar el pico absoluto, este método distribuye su atención de manera más amplia entre las opciones seguras. En sus pruebas, este enfoque logró prevenir que el sistema se aferrara a las respuestas inseguras, manteniendo baja la tasa de hackeo de seguridad a medida que crecía el número de candidatos. Sin embargo, los investigadores señalaron que este método no elimina el problema inicial de que el filtro de seguridad deje pasar respuestas malas; simplemente evita que el sistema amplifique ese error. El problema fundamental sigue siendo que el grupo de candidatos ya está contaminado.

Las implicaciones de este hallazgo son significativas para la forma en que construimos y escalamos los sistemas de IA. Sugiere que simplemente hacer que los filtros de seguridad sean más precisos en promedio no es suficiente para garantizar la seguridad cuando se utilizan métodos de búsqueda a gran escala. Los investigadores demostraron que la relación entre las puntuaciones de recompensa de las respuestas seguras e inseguras es tan crítica como la precisión del filtro mismo. Si las respuestas inseguras tienen una "cola más pesada" en su distribución de recompensa —es decir, si ocasionalmente obtienen puntuaciones muy altas por azar—, el sistema eventualmente las encontrará y las preferirá. Esto significa que la seguridad no puede tratarse como un paso separado que ocurre antes de la optimización; los dos procesos están profundamente entrelazados, y los errores en uno pueden ser magnificados por el otro.

En sus experimentos con modelos de lenguaje reales, el equipo confirmó que este mecanismo opera en la práctica. Utilizaron un filtro de seguridad estándar y un modelo de recompensa para seleccionar respuestas de un gran grupo de candidatos generados por una IA. A medida que aumentaban el número de candidatos, la tasa en la que el sistema seleccionaba respuestas dañinas aumentaba, mientras que la calidad de las respuestas seguras que encontraba no mejoraba lo suficiente como para compensarlo. Cuando intercambiaron el modelo de recompensa por uno diferente, el comportamiento cambió, demostrando que la forma específica en que el sistema de recompensa clasifica las opciones es el motor clave de este fallo. Esto confirma que el problema no es solo que el filtro de seguridad sea imperfecto, sino sobre cómo el sistema de recompensa interactúa con las pocas opciones inseguras que logran pasar.

Los investigadores concluyen que el escalado seguro requiere un enfoque dual: mejorar el filtro de seguridad para reducir el número de opciones malas que entran al grupo, y gestionar cuidadosamente cómo el sistema selecciona de ese grupo para evitar la amplificación de los errores restantes. Argumentan que los métodos actuales, que dependen de elegir la mejor opción única de un conjunto grande, son inherentemente vulnerables a este tipo de fallo. Si bien su método alternativo propuesto ofrece una forma de limitar el daño, no resuelve la causa raíz. El estudio sirve como una advertencia de que, a medida que impulsamos a los sistemas de IA a mirar más posibilidades para encontrar mejores respuestas, debemos ser igualmente vigilantes sobre cómo esos sistemas manejan los errores raros y peligrosos que inevitablemente se filtran por las grietas. Sin abordar la interacción entre el filtrado de seguridad y la optimización de la recompensa, el escalar puede conducir a resultados más peligrosos en lugar de más seguros.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →