Resumen Técnico: Hacia Filtros de Seguridad Latentes Condicionados por Lenguaje General
Planteamiento del Problema
A medida que las políticas robóticas evolucionan de controladores específicos para tareas a modelos generalistas de Visión-Lenguaje-Acción (VLA) capaces de ejecutar diversas instrucciones en lenguaje natural, garantizar un despliegue seguro sigue siendo un desafío crítico. Los requisitos de seguridad varían significativamente entre usuarios, entornos y aplicaciones, incluso para tareas idénticas. Los filtros de seguridad existentes son mayoritariamente específicos de cada restricción; dependen de nociones fijas de seguridad (por ejemplo, la invariancia hacia adelante contra un conjunto de fallos predefinido) y requieren rediseño o reentrenamiento cada vez que cambian las especificaciones de seguridad. Además, las políticas VLA actuales suelen fallar al aprender implícitamente la seguridad a partir de los datos de entrenamiento o al seguir de manera fiable instrucciones de seguridad explícitas basadas en lenguaje. Este artículo investiga el filtrado de seguridad condicionado por lenguaje, con el objetivo de crear un único filtro de seguridad aprendido que pueda adaptarse a los requisitos de seguridad de despliegue expresados mediante lenguaje natural, apoyando así el despliegue seguro de políticas robóticas generalistas.
Metodología
Los autores proponen un marco que extiende el análisis de alcanzabilidad de Hamilton–Jacobi (HJ) para condicionarlo a restricciones especificadas por lenguaje. El enfoque central consiste en aprender un actor y un crítico de seguridad condicionados por la restricción que operan como un filtro en tiempo de ejecución para una política nominal.
1. Formulación
El sistema opera en cada paso de tiempo t con una observación ot, una instrucción de tarea τ y una restricción de seguridad en lenguaje natural c (por ejemplo, "evitar la caja de leche"). Una política nominal πnom propone una acción atnom. El filtro de seguridad evalúa esta acción utilizando un crítico HJ aprendido Qθ(zt,at), donde la representación del estado zt codifica tanto la observación visual como la restricción de lenguaje.
- Crítico: Estima el valor de seguridad descontado del peor caso de ejecutar atnom seguido de la política de seguridad óptima.
- Actor: Una política aprendida entrenada para maximizar la seguridad.
- Lógica de Filtrado: Si Qθ(zt,atnom)≥ϵ (donde ϵ es un margen de seguridad), se ejecuta la acción nominal. De lo contrario, el filtro interviene, muestreando acciones candidatas a partir del actor HJ y perturbaciones de la acción nominal, seleccionando la acción segura más cercana que satisfaga la restricción.
2. Representaciones y Codificación
El artículo evalúa dos representaciones de entrada para el actor/crítico HJ:
- Oráculo Privilegiado (Verdad de Campo): Utiliza el estado completo del sistema st (posiciones de objetos, estado del robot) y una codificación multi-hot de la restricción. Esto sirve como un límite superior para probar la eficacia de la formulación HJ sin errores de percepción.
- Visión-Lenguaje (VL): Utiliza observaciones RGB puras (vistas de tercera persona y montadas en la muñeca), propiocepción del robot y la restricción de lenguaje. Para codificar estos, los autores utilizan la arquitectura base VLA π0.5, que procesa observaciones multi-vista y lenguaje a través de un transformador compartido. La secuencia de tokens resultante se agrega mediante agrupación media (mean pooling) para formar la representación latente zt.
3. Funciones de Fallo
Un componente crítico es la función de fallo h(zt), que define el límite del conjunto inseguro.
- Restricciones Geométricas: Para tareas como la evitación de colisiones, h se define mediante métricas de distancia (por ejemplo, la distancia a un obstáculo menos un umbral).
- Restricciones Semánticas: Para fallos semánticos complejos (por ejemplo, volcar un objeto), los autores exploran el uso de Modelos de Visión-Lenguaje (VLM) como oráculos de fallo. Consultan a 11 VLM diferentes para determinar si un estado viola una restricción, mapeando la salida a una constante positiva o negativa. Sin embargo, encuentran que los VLM actuales no son lo suficientemente fiables para su uso directo como oráculos de fallo en tiempo de ejecución debido a altas tasas de falsos negativos en violaciones de seguridad.
4. Entrenamiento
El crítico y el actor HJ se entrenan utilizando Soft Actor-Critic (SAC) para minimizar la pérdida de error de Bellman, aproximando la función de valor óptima para evitar el conjunto de fallos definido por la restricción. Los datos de entrenamiento incluyen 5,000 trayectorias de manipulación (derivadas de tareas LIBERO modificadas), enriquecidas deliberadamente con violaciones de seguridad (aproximadamente 90%).
Principales Contribuciones
- Formulación: El artículo formula el filtrado de seguridad condicionado por lenguaje, extendiendo la alcanzabilidad HJ para condicionarse a restricciones de lenguaje natural en lugar de conjuntos de fallos fijos.
- Evaluación: Evaluación exhaustiva a través de tres tareas de manipulación (Safe Grab, Safe Wipe, Stack Blocks) examinando la satisfacción de restricciones, la generalización fuera de la distribución (OOD) y el compromiso entre seguridad, éxito de la tarea y tasas de intervención.
- Análisis Comparativo: Una comparación entre el filtro general propuesto condicionado por lenguaje y los filtros especializados no condicionados por lenguaje entrenados por cada restricción.
- Benchmarking de VLM: Una evaluación de 11 VLM como posibles funciones de fallo para la manipulación robótica, destacando sus limitaciones actuales en fiabilidad.
- Liberación de Dataset: Los autores se comprometen a liberar un conjunto de datos de 5,000 trayectorias de manipulación tipo LIBERO con violaciones de seguridad.
Resultados Experimentales
Los experimentos se realizaron en entornos RoboSuite utilizando tanto la modalidad de observación de Verdad de Campo (GT) como la de Visión-Lenguaje (VL).
- Seguridad vs. Éxito de la Tarea: Tanto los filtros General (condicionado por lenguaje) como los Single (específicos de la restricción) redujeron significamente las tasas de colisión en comparación con la política nominal sin filtrar. En configuraciones GT, los filtros preservaron bien el rendimiento de la tarea. En configuraciones VL, las tasas de colisión siguieron siendo más altas, atribuidas a la pérdida de características espaciales durante la agregación de tokens (mean pooling).
- Filtros Generales vs. Especializados:
- En Stack Blocks (restricciones secuenciales), el filtro General superó a los filtros Single en Corrección de Orden (OC), sugiriendo que compartir un filtro permite la transferencia de conocimiento entre restricciones relacionadas (por ejemplo, "agarrar rojo" frente a "agarrar azul").
- En Safe Grab y Safe Wipe (evitación de colisiones), los resultados fueron mixtos. El filtro General logró tasas de colisión más bajas que los filtros Single en la configuración VL, pero a veces a costa de una menor tasa de éxito de la tarea. En configuraciones GT, el filtro General requirió significativamente menos intervenciones (menor IR) que los filtros Single manteniendo una seguridad comparable.
- Especificidad de la Restricción: El filtro General demostró la capacidad de distinguir entre obstáculos especificados y objetos benignos. En escenas con dos objetos, el filtro intervino para evitar el obstáculo nombrado mientras permitía la interacción con el objeto no nombrado, probando que no evita indiscriminadamente todos los objetos.
- Generalización Fuera de la Distribución (OOD): El filtro General exhibió una transferencia parcial a restricciones no vistas:
- Safe Grab/Wipe: El rendimiento se degradó al probarse en tipos de objetos no vistos (por ejemplo, cafetera, libro amarillo), con un aumento en las tasas de colisión.
- Stack Blocks: El filtro generalizó bien a colores no vistos (desplazamiento de solo Color) pero el rendimiento cayó cuando tanto la forma como el color eran desconocidos. El análisis sugirió que el filtro depende de pistas tanto de color como de forma; cuando la instrucción especificaba una forma ausente en la escena (por ejemplo, "cubo" cuando solo había cilindros presentes), el filtro aún podía identificar el objetivo basándose en el color, aunque con una precisión reducida.
- Fiabilidad de los VLM: La evaluación de 11 VLM como oráculos de fallo reveló que, si bien algunos modelos (por ejemplo, Gemini Robotics-ER 1.6) lograron una alta precisión de no-fallo, a menudo fallaron en detectar verdaderos fallos de seguridad (baja precisión de fallo). Esto indica que los VLM actuales aún no son lo suficientemente fiables para servir como oráculos de fallo directos en tiempo de ejecución, pero pueden servir como anotadores débiles para entrenar funciones de fallo aprendidas.
Significado y Reivindicaciones
El artículo afirma demostrar un camino hacia filtros de seguridad generales que pueden adaptarse a diversos requisitos de seguridad especificados por lenguaje sin necesidad de un modelo separado para cada especificación. Los autores argumentan que un único crítico de seguridad aprendido puede representar múltiples restricciones, componer restricciones activas a partir de una sola instrucción y generalizar a instancias de restricciones no vistas dentro de una familia.
El trabajo sugiere que los filtros de seguridad pueden experimentar una transición similar a la de las políticas VLA generalistas: pasando de monitores fijos y específicos de la especificación a mecanismos de ejecución general y condicionados por la especificación. Esto podría permitir que los filtros de seguridad sean entrenados a escala y adaptados para tareas descendentes, de forma análoga al desarrollo de políticas generalistas.
Sin embargo, los autores mantienen la modestia sobre el estado actual de la tecnología. Reconocen que:
- El filtro General no garantiza la satisfacción de las restricciones, particularmente bajo condiciones OOD.
- El rendimiento se degrada cuando las restricciones no han sido vistas durante el entrenamiento.
- El enfoque actual está limitado a tipos específicos de restricciones (evitar/acercarse) y aún no maneja lógica temporal compleja o especificaciones de seguridad totalmente arbitrarias.
- Los VLM actuales son insuficientes como oráculos directos en tiempo de ejecución para definir conjuntos de fallos.
El artículo concluye que, si bien el marco propuesto muestra promesa para la transferencia parcial y la generalización, se requiere más investigación para mejorar las estrategias de agregación de tokens, realizar un ajuste fino conjunto de las arquitectas VLA con los críticos de seguridad y desarrollar métodos más robustos para manejar restricciones de lenguaje ambiguas o complejas.