← Ultimi articoli
💻 computer science

CALOS: Control-Affine Lyapunov On-manifold Safety Layer for Safe Deep Reinforcement Learning for Quadrotors

Il documento introduce CALOS, uno strato di sicurezza basato su Lyapunov e control-affine in tempo reale che impone vincoli di assetto per il quadrotor attraverso un programma quadratico risolvibile efficientemente, eliminando così le violazioni di sicurezza, riducendo gli errori di inseguimento e accelerando la convergenza del Deep Reinforcement Learning senza modificare la policy sottostante.

Autori originali: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

Pubblicato 2026-09-17
📖 1 min di lettura☕ Lettura da pausa caffè

Autori originali: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Sintesi Tecnica: CALOS – Strato di Sicurezza su Manifold Control-Affine basato su Lyapunov

Problematica
Il Deep Reinforcement Learning (DRL) ha dimostrato una capacità significativa nel controllo dei quadrotor, tuttavia le policy apprese mancano di garanzie formali riguardo ai vincoli di sicurezza durante l'addestramento o l'impiego. Gli approcci esistenti alla DRL sicura affrontano una tensione persistente: i Processi Decisionali Markoviani Vincolati (CMDP) possono destabilizzare l'apprendimento, mentre i filtri a runtime (shielding o funzioni di barriera di controllo) spesso degradano i segnali di gradiente se correggono le azioni in modo troppo aggressivo. Inoltre, le attuali limitazioni architettoniche impediscono l'ottimizzazione congiunta di molteplici certificati di sicurezza. Metodi come l'ATACOM proiettano le azioni su manifold di vincolo ma mancano di certificati basati sull'energia per la dissipazione rotazionale, mentre i metodi basati su Lyapunov trattano spesso i vincoli in modo indipendente, rischiando di violare un vincolo mentre si soddisfa un altro. La composizione sequenziale di questi metodi fallisce nel garantire la fattibilità congiunta, specialmente quando grandi errori di inseguimento richiedono la massima autorità di controllo, poiché la scalatura sequenziale spesso annulla tale autorità.

Metodologia
Il documento propone CALOS (Control-Affine Lyapunov On-manifold Safety), uno strato di sicurezza a runtime che opera in modo trasparente sopra una standard policy DRL (specificamente Proximal Policy Optimization, PPO) senza modificare l'algoritmo di apprendimento sottostante. CALOS unifica i vincoli di inclinazione dell'assetto e una condizione di stabilità di Lyapunov in un unico Programma Quadratico (QP) per calcolare la correzione a norma minima rispetto all'output di coppia nominale.

  1. Vincoli di Inclinazione (Proiezione Predittiva dell'Inclinazione):
    L'assetto è rappresentato dal vettore gravità nel frame del corpo (gbg_b) per evitare singolarità degli angoli di Eulero. Utilizzando una discretizzazione di Eulero simpatica, il futuro vettore gravità viene modellato come una funzione affine della coppia di controllo. Questa formulazione permette l'imposizione di limiti di rollio e pitch (ϕmax=θmax=60\phi_{max} = \theta_{max} = 60^\circ) come quattro disuguaglianze lineari (APTPτbPTPA_{PTP}\tau \le b_{PTP}).

  2. Vincolo di Lyapunov:
    Una funzione candidata di Lyapunov V(x)V(x) è definita sulla base dell'errore di inclinazione e della velocità angolare. Lo strato impone una condizione di decadimento V˙cV\dot{V} \le -cV, che, a causa della natura control-affine della dinamica rotazionale, si traduce in una singola disuguaglianza lineare (ALτbLA_L\tau \le b_L). Ciò assicura la dissipazione dell'energia rotazionale.

  3. Formulazione Unificata:
    A differenza degli approcci sequenziali che applicano prima la proiezione dell'inclinazione e poi la scalatura di Lyapunov (il che può portare alla nullificazione della coppia quando gli errori sono elevati), CALOS accoda i cinque vincoli lineari (quattro di inclinazione, uno di Lyapunov) in un singolo sistema. Lo strato di sicurezza risolve:
    τ=argminτR312ττ02s.t.A(x)τb(x) \tau^\star = \arg \min_{\tau \in \mathbb{R}^3} \frac{1}{2} \|\tau - \tau_0\|^2 \quad \text{s.t.} \quad A(x)\tau \le b(x)
    dove τ0\tau_0 è la coppia nominale proveniente dalla policy.

  4. Solver:

    • CALOS-P: Un'approssimazione proiettiva utilizzando una correzione con pseudo-inversa smorzata. Impone tutti i vincoli congiuntamente senza garantire la soluzione esatta a norma minima, dando priorità alla velocità per l'addestramento parallelo su larga scala.
    • CALOS-QP: Un solver esatto che sfrutta lo spazio di coppia tridimensionale. Esso enumera tutti i possibili set attivi (26 candidati) per trovare la soluzione esatta a norma minima che soddisfi le condizioni di Karush–Kuhn–Tucker (KKT). Se non esiste una soluzione fattibile, il sistema torna alla azione della policy non corretta con clamping degli attuatori.

Contributi Chiave

  • Strato di Sicurezza Unificato: Il primo strato a runtime che ottimizza congiuntamente i vincoli di inclinazione e la stabilità di Lyapunov in un singolo step QP, evitando i problemi di fattibilità della composizione sequenziale.
  • Scalabilità in Tempo Reale: Il solver esatto (CALOS-QP) è computazionalmente efficiente quanto basta per essere eseguito attraverso migliaia di ambienti di simulazione paralleli, un requisito per l'addestramento DRL massivamente parallelo moderno.
  • Zero Violazioni sulle Traiettorie di Addestramento: Il metodo impone rigorosamente i vincoli durante l'addestramento, impedendo all'agente di esplorare regioni non sicure dello spazio degli stati.

Risultati Sperimentali
Valutato in NVIDIA Isaac Lab su compiti di inseguimento di traiettoria, CALOS è stato confrontato con PPO non vincolato, proiezione dell'inclinazione (PTP) standalone, scalatura di Lyapunov standalone e una cascata sequenziale di entrambi.

  • Prestazioni di Inseguimento: CALOS-P e CALOS-QP hanno ridotto l'errore di inseguimento laterale del 55–60% rispetto al baseline PPO non vincolato sulle traiettorie di addestramento. Su traiettorie non viste con grandi offset iniziali di posizione, le varianti CALOS hanno mantenuto gli errori al di sotto di 0.08 m, mentre i metodi Lyapunov e Cascade sono falliti nell'inseguimento a causa della nullificazione della coppia.
  • Metriche di Sicurezza: Sulla traiettoria di addestramento, CALOS-QP ha ottenuto zero violazioni del vincolo di assetto. Sotto estremi offset iniziali, le violazioni sono state limitate al massimo a 3 passi consecutivi (CALOS-P) o 9 passi (CALOS-QP), rispetto ai 27 passi dei metodi sequenziali.
  • Convergenza e Efficienza dei Dati: Limitando l'esplorazione alle regioni sicure, CALOS ha accelerato la convergenza dell'addestramento.
  • Comportamento Internalizzato: Le policy addestrate con CALOS hanno mantenuto comportamenti più sicuri e accurati anche quando lo strato di sicurezza veniva disabilitato al tempo di test, mostrando un errore laterale inferiore del 55-74% rispetto alle policy addestrate con PPO. Ciò indica che la policy ha internalizzato con successo i vincoli di sicurezza.

Significatività
Il documento afferma che CALOS risolve il compromesso tra l'imposizione della sicurezza e l'efficienza dell'apprendimento. Formulando la sicurezza come un singolo QP a bassa dimensionalità, assicura che il segnale del gradiente non sia degradato da correzioni sequenziali aggressive. Il metodo permette alla policy di apprendere comportamenti ottimali all'interno del manifold sicuro, risultando in policy intrinsecamente più sicure e più efficienti nei dati senza sacrificare le prestazioni di inseguimento. Gli autori notano che l'insieme fattibile del QP è rimasto non vuoto in tutti i test, confermando la robustezza della formulazione congiunta.

Lavoro Futuro
Gli autori identificano tre direzioni per la ricerca futura:

  1. Sviluppare certificati di Lyapunov apprendibili e task-aware per evitare interventi non necessari quando il drone segue un riferimento di assetto non nullo ma fattibile.
  2. Estendere il framework a dinamiche non control-affine (ad esempio, modelli che includono la dinamica della velocità dei rotori o gli effetti del blade-flapping).
  3. Investigare il trasferimento sim-to-real utilizzando la randomizzazione del dominio e filtri di sicurezza basati sui dati per gestire l'incertezza del modello sull'hardware fisico.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →