← Nieuwste papers
💻 computer science

CALOS: Control-Affine Lyapunov On-manifold Safety Layer for Safe Deep Reinforcement Learning for Quadrotors

Het artikel introduceert CALOS, een real-time, control-affine Lyapunov-gebaseerde veiligheidslaag die de houdingsrestricties van een quadrotor afdwingt via een efficiënt oplosbaar kwadratisch programmeerprogramma, waardoor veiligheidschendingen worden geëlimineerd, trackingfouten worden verminderd en de convergentie van Deep Reinforcement Learning wordt versneld zonder het onderliggende beleid te wijzigen.

Oorspronkelijke auteurs: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

Gepubliceerd 2026-09-17
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: CALOS – Control-Affine Lyapunov On-manifold Safety Layer

Probleemstelling
Deep Reinforcement Learning (DRL) heeft een aanzienlijk vermogen getoond bij het aansturen van quadrotors, maar geleerde beleidscycli (policies) missen formele garanties met betrekking tot veiligheidsrestricties tijdens de training of implementatie. Bestaande veilige DRL-benaderingen kampen met een hardnekkige spanning: Constrained Markov Decision Processes (CMCMDPs) kunnen het leerproces destabiliseren, terwijl runtime-filters (shielding of control barrier functions) vaak de gradiëntsignalen verzwakken als ze acties te agressief corrigeren. Bovendien voorkomen huidige architecturale beperkingen de gezamenlijke optimalisatie van meerdere veiligheidscertificaten. Methoden zoals ATACOM projecteren acties op restrictiemanifolds, maar missen energiegebaseerde certificaten voor rotatiedissipatie, terwijl Lyapunov-gebaseerde methoden restricties vaak onafhankelijk behandelen, wat het risico met zich meebrengt dat één restrictie wordt geschonden terwijl een andere wordt voldaan. Sequentiële compositie van deze methoden slaagt er niet in om gezamenlijke haalbaarheid te garanderen, met name wanneer grote fouten in het volgen van trajecten maximale controle-autoriteit vereisen, waarbij sequentiële schaling dit vaak tenietdoet.

Methodologie
Het artikel stelt CALOS (Control-Affine Lyapunov On-manifold Safety) voor, een runtime safety layer die transparant bovenop een standaard DRL-beleid (specifiek Proximal Policy Optimization, PPO) werkt zonder het onderliggende leeralgoritme te wijzigen. CALOS verenigt attitude-tilt restricties en een Lyapunov-stabiliteitsconditie in één enkele Quadratic Program (QP) om de minimum-norm correctie van de nominale koppeloutput te berekenen.

  1. Tilt-restricties (Predictive Tilt Projection):
    De attitude wordt gerepresenteerd door de zwaartekrachtvector in het body-frame (gbg_b) om Euler-hoek-singulariteiten te vermijden. Met behulp van een symplectic Euler-discretisatie wordt de toekomstige zwaartekrachtvector gemodelleerd als een affine functie van het controlekoppel. Deze formulering maakt het mogelijk om roll- en pitch-limieten (ϕmax=θmax=60\phi_{max} = \theta_{max} = 60^\circ) op te leggen als vier lineaire ongelijkheden (APTPτbPTPA_{PTP}\tau \le b_{PTP}).

  2. Lyapunov-restrictie:
    Een Lyapunov-kandidaatfunctie V(x)V(x) wordt gedefinieerd op basis van de tilt-fout en hoeksnelheid. De laag dwingt een vervalconditie af: V˙cV\dot{V} \le -cV, wat vanwege de control-affine aard van de rotatiedynamica vertaalt naar een enkele lineaire ongelijkheid (ALτbLA_L\tau \le b_L). Dit zorgt voor rotatie-energie-dissipatie.

  3. Verenigde Formulering:
    In tegenstelling tot sequentiële benaderingen die eerst tilt-projectie toepassen en daarna Lyapunov-schaling (wat kan leiden tot het tenietdoen van het koppel wanneer de fouten groot zijn), stapelt CALOS de vijf lineaire restricties (vier tilt, één Lyapunov) in één enkel systeem. De safety layer lost het volgende op:
    τ=argminτR312ττ02onder de voorwaarde datA(x)τb(x) \tau^\star = \arg \min_{\tau \in \mathbb{R}^3} \frac{1}{2} \|\tau - \tau_0\|^2 \quad \text{onder de voorwaarde dat} \quad A(x)\tau \le b(x)
    waarbij τ0\tau_0 het nominale koppel is van het beleid.

  4. Solvers:

    • CALOS-P: Een geprojecteerde benadering met behulp van een gedempte pseudo-inverse correctie. Het dwingt alle restricties gezamenlijk af zonder een exacte minimum-norm oplossing te garanderen, waarbij de voorkeur wordt gegeven aan snelheid voor grootschalige parallelle training.
    • CALOS-QP: Een exacte solver die de driedimensionale koppelruimte exploiteert. Het enumereert alle mogelijke actieve verzamelingen (26 kandidaten) om de exacte minimum-norm oplossing te vinden die voldoet aan de Karush–Kuhn–Tucker (KKT) condities. Als er geen haalbare oplossing bestaat, valt het systeem terug op de ongecorrigeerde actie van het beleid met actuator-clamping.

Belangrijkste Bijdragen

  • Verenigde Safety Layer: De eerste runtime-laag die tilt-restricties en Lyapunov-stabiliteit gezamenlijk optimaliseert in één enkele QP-stap, waardoor de haalbaarheidsproblemen van sequentiële compositie worden vermeden.
  • Real-time Schaalbaarheid: De exacte solver (CALOS-QP) is computationeel efficiënt genoeg om te draaien over duizenden parallelle simulatieomgevingen, een vereiste voor moderne massaal parallelle DRL-training.
  • Nul Violaties op Trainings-trajecten: De methode handhaaft restricties strikt tijdens de training, waardoor het voorkomt dat de agent onveilige gebieden van de state space verkent.

Experimentele Resultaten
Geëvalueerd in NVIDIA Isaac Lab voor traject-volgtaken, werd CALOS vergeleken met onbeperkte PPO, standalone tilt-projectie (PTP), standalone Lyapunov-schaling, en een sequentiële cascade van beide.

  • Tracking Prestaties: CALOS-P en CALOS-QP verminderden de laterale tracking-fout met 55–60% ten opzichte van de onbeperkte PPO-baseline op trainings-trajecten. Op onbekende trajecten met grote initiële positie-offsets behielden CALOS-varianten fouten onder de 0,08 m, terwijl de Lyapunov- en Cascade-methoden faalden in het volgen door koppel-nullificatie.
  • Veiligheidsmetrieken: Op het trainings-traject behaalde CALOS-QP nul attitude-restrictie-overtredingen. Onder extreme initiële offsets waren overtredingen beperkt tot maximaal 3 opeenvolgende stappen (CALOS-P) of 9 stappen (CALOS-QP), vergeleken met tot wel 27 stappen voor sequentiële methoden.
  • Convergentie en Data-efficiëntie: Door exploratie te beperken tot veilige regio's, versnelde CALOS de convergentie van de training.
  • Geïnternaliseerd Gedrag: Beleid getraind met CALOS behield zelfs een veiliger en nauwkeuriger gedrag wanneer de safety layer tijdens de testtijd werd uitgeschakeld, wat een 55–74% lagere laterale fout liet zien dan de met PPO getrainde beleidscycli. Dit geeft aan dat het beleid de veiligheidsrestricties succesvol heeft geïnternaliseerd.

Betekenis
Het artikel beweert dat CALOS de afruil tussen veiligheidsafdwinging en leer-efficiëntie oplost. Door veiligheid te formuleren als een enkele, laag-dimensionale QP, zorgt het ervoor dat het gradiëntsignaal niet wordt verzwakt door agressieve, sequentiële correcties. De methode stelt het beleid in staat om optimale gedragingen te leren binnen de veilige manifold, wat resulteert in beleid dat inherent veiliger en data-efficiënter is zonder de tracking-prestaties op te offeren. De auteurs merken op dat de QP-haalbare verzameling in alle tests niet-leeg bleef, wat de robuustheid van de gezamenlijke formulering bevestigt.

Toekomstig Werk
De auteurs identificeren drie richtingen voor toekomstig onderzoek:

  1. Het ontwikkelen van geleerde, taak-bewuste Lyapunov-certificaten om onnodige interventies te voorkomen wanneer de drone een traject volgt met een niet-nul maar haalbare referentie-attitude.
  2. Het uitbreiden van het framework naar niet-control-affine dynamica (bijv. modellen die rotor-snelheidsdynamica of blade-flapping effecten bevatten).
  3. Onderzoek naar sim-to-real transfer met behulp van domein-randomisatie en data-gedreven veiligheidsfilters om modelonzekerheid op fysieke hardware op te vangen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →