← Últimos artículos
🤖 AI

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

Este artículo revela que los detectores de cumplimiento actuales sufren de "ceguera de reglas", al no depender genuinamente de las reglas regulatorias establecidas en lugar de características superficiales, y demuestra que incluso la propuesta de puntuación de cumplimiento interno (ICS) libre de entrenamiento carece de robustez frente a líneas base triviales y ataques adaptativos.

Autores originales: Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo digital moderno, los modelos de lenguaje extensos actan como potentes motores para generar texto, desde la redacción de correos electrónicos hasta la respuesta a preguntas complejas. Sin embargo, cuando estas herramientas se utilizan en campos regulados como las finanzas, la salud o el derecho, deben seguir reglas escritas estrictas. Un banco, por ejemplo, puede tener una política de que los datos personales deben eliminarse en un plazo de noventa días. Para asegurar que la IA siga esto, las empresas suelen desplegar "modelos de guardia": clasificadores especializados entrenados para escanear la salida de la IA y señalar cualquier violación. La esperanza es que el guardián lea la regla específica proporcionada y verifique si la respuesta de la IA coincide con ella. Si el guardián funciona correctamente, solo debería señalar una violación cuando la regla específica se rompa, no simplemente porque el tema parezca riesgoso.

Un equipo de investigadores de Lexsi Labs se propuso probar si estos monitores de cumplimiento realmente comprenden las reglas que deben hacer cumplir. Investigaron un fenómeno que llaman "ceguera de regla". Esto ocurre cuando un detector da el mismo veredicto independientemente de la regla que debería estar comprobando. Imagine a un guardia de seguridad en un museo que detiene a cada visitante que lleva una bolsa roja, no porque las bolsas rojas estén prohibidas, sino porque el guardia simplemente ha aprendido a asociar el color rojo con el peligro. Si el museo cambia la regla para prohibir las bolsas azules, un guardia ciego a las reglas seguiría deteniendo las bolsas rojas e ignoraría las azules, perdiendo completamente la nueva instrucción. Los investigadores querían saber si los guardias digitales que protegen nuestros datos sufrían el mismo problema.

El equipo comenzó probando una amplia variedad de modelos de guardia existentes y sondas de activación: herramientas que echan un vistazo al funcionamiento interno de la IA para adivinar sus intenciones. Utilizaron un método de pruebas contrafácticas, que consiste en cambiar la entrada de formas específicas para ver cómo reacciona el sistema. En sus experimentos, tomaron un escenario donde los datos se conservaban durante cuatrocientos días, lo cual viola claramente una regla de noventa días. Luego, intercambiaron esa regla de noventa días por una regla completamente diferente y no relacionada, o incluso eliminaron la regla por completo. Sorprendentemente, los modelos de guardia señalaron la violación con la misma frecuencia y con la misma confianza, incluso cuando la regla que la regía había desaparecido o cambiado. Los detectores estaban rastreando el escenario —el hecho de que los datos se conservaban demasiado tiempo— en lugar de la regla específica que lo convertía en una violación. Este fallo no se limitó a un tipo de modelo; apareció en clasificadores de seguridad fijos que ni siquiera ven la regla, e incluso en guardias sofisticados "condicionados por política" que están diseñados explícitamente para leer y seguir reglas personalizadas. Uno de estos guardias citaba correctamente la posición de la regla en el texto del noventa y uno al noventa y cinco por ciento de las veces, pero su veredicto final apenas cambió cuando la regla se intercambió por una permisiva que permitía el comportamiento.

Para entender qué estaban leyendo realmente estos sistemas, los investigadores construyeron un nuevo benchmark diseñado específicamente para este propósito. Crearon una prueba donde la respuesta dependía enteramente de la interacción entre una regla específica y un escenario específico, asegurando que ni el texto de la regla ni el texto del escenario por sí solos pudieran predecir el resultado. Por ejemplo, una regla podría decir que un banco puede simplificar las verificaciones para cuentas de menos de mil dólares, mientras que otra regla establece el límite en cinco mil. Si un escenario describe una cuenta con dos mil dólares, el veredicto depende enteramente de qué regla esté activa. Cuando ejecutaron sus pruebas en este benchmark no confundido, cada detector eficiente que probaron, incluyendo su propia herramienta nueva, no funcionó mejor que el azar. El único sistema que tuvo éxito fue un modelo de lenguaje extenso que se le permitió razonar paso a paso, desglosando el problema antes de dar una respuesta. Esto sugirió que los detectores rápidos y automatizados no estaban componiendo la regla con el escenario, sino que simplemente estaban reconociendo una señal amplia de "violación" basada en las características superficiales del texto.

Los investigadores introdujeron entonces una nueva herramienta, que no requiere entrenamiento, llamada Puntuación de Cumplimiento Interno (Internal Compliance Score). Este método lee directamente las señales de activación interna de la IA, requiriendo solo diez pares de ejemplos para calibrarse. Es increíblemente barato y rápido, ya que no requiere reentrenamiento ni pasos de procesamiento adicionales. Descubrieron que esta herramienta era excelente para clasificar respuestas candidatas, ayudando a elegir la respuesta más conforme de una lista de opciones. En las pruebas, mejoró la tasa de aprobación de las tareas de seguimiento de instrucciones en cinco puntos porcentuales. Sin embargo, la misma ceguera de regla que afectó a los otros guardias también afectó a esta nueva puntuación. Cuando la regla era eliminada o intercambiada, la puntuación permanecía sin cambios. La herramienta estaba midiendo efectivamente un sentido general de riesgo en lugar de una adherencia específica a la regla escrita. Además, los investigadores descubrieron que esta ventaja era frágil; un ataque inteligente y adaptativo podría engañar fácilmente al sistema añadiendo unas pocas palabras específicas al final de una respuesta, causando que la puntuación cayera a niveles aleatorios.

El estudio también reveló un problema más profundo con la forma en que se mide el cumplimiento actualmente. Los investigadores auditaron siete benchmarks públicos utilizados para probar estos sistemas y encontraron que cuatro de ellos eran "lexicalmente degenerados". Esto significa que las etiquetas sobre si una respuesta era conforme o no estaban integradas en el propio texto, a menudo a través de la forma en que se escribía el escenario o cómo se narraba el veredicto. Un programa informático simple que solo contara palabras, sin entender ninguna regla, podría resolver estos benchmarks con alta precisión. Esto implica que muchos de los reclamos anteriores sobre la capacidad de un modelo para seguir reglas eran, en realidad, solo reclamos sobre su capacidad para reconocer palabras o estructuras de oraciones específicas. Los investigadores concluyeron que, si bien estos detectores son útiles para clasificar y ordenar respuestas, no pueden ser confiables para tomar decisiones legales o de auditoría basadas en reglas específicas. Ofrecen la apariencia de una garantía específica de la regla, pero en realidad, son ciegos a las reglas que deben hacer cumplir. El artículo termina publicando las herramientas y protocolos utilizados para estas pruebas, permitiendo que otros verifiquen futuros sistemas para este mismo tipo de ceguera antes de que sean desplegados en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →