← Neueste Arbeiten
🤖 machine learning

Adaptive Probabilistic Shielding by Learning MDPs for Safe Reinforcement Learning

Dieses Paper schlägt ein adaptives probabilistisches Shielding-Framework für sicheres Reinforcement Learning vor, das Online-Modelllernen integriert, um Sicherheitsbeschränkungen dynamisch zu berechnen und zu aktualisieren, während Übergangswahrscheinlichkeiten aus einem ursprünglich unbekannten MDP geschätzt werden.

Ursprüngliche Autoren: Astrid Horn Brorholt (Aalborg University, Aalborg, Denmark), Maris F. L. Galesloot (Radboud University, Nijmegen, Netherlands), Nils Jansen (Radboud University, Nijmegen, Netherlands), Kim Guldstrand
Veröffentlicht 2026-08-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Astrid Horn Brorholt (Aalborg University, Aalborg, Denmark), Maris F. L. Galesloot (Radboud University, Nijmegen, Netherlands), Nils Jansen (Radboud University, Nijmegen, Netherlands), Kim Guldstrand Larsen (Aalborg University, Aalborg, Denmark), Christian Schilling (Aalborg University, Aalborg, Denmark)

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der künstlichen Intelligenz lernen Maschinen, Entscheidungen zu treffen, indem sie Dinge ausprobieren, ganz ähnlich wie ein Kind, das das Laufen lernt, indem es hinfällt und wieder aufsteht. Dieser Prozess, bekannt als Reinforcement Learning (bestärkendes Lernen), ermöglicht es Software-Agenten, den besten Weg zur Lösung von Problemen zu entdecken, indem sie mit einer Umgebung interagieren und Belohnungen für gute Entscheidungen erhalten. In der realen Welt kann jedoch der Preis eines falschen Schritts katastrophal sein. Ein selbstfahrendes Auto kann es sich nicht leisten, ein gefährliches Manöver zu testen, um zu sehen, ob es funktioniert; ein medizinischer Roboter kann es nicht riskieren, einen Patienten zu verletzen, während er den sichersten Pfad ermittelt. Dies erzeugt ein grundlegendes Spannungsverhältnis: Um effektiv zu lernen, muss ein Agent explorieren, aber um sicher zu bleiben, muss er das Unbekannte vermeiden. Jahrelang haben Forscher versucht, dies zu lösen, indem sie einen „Schild“ bauten – einen Sicherheitswächter, der jede Aktion des Agenten blockiert, die zu einer Katastrophe führen könnte. Das Problem ist, dass traditionelle Schilde eine perfekte, bereits existierende Karte der Welt erfordern, einschließlich exakter Wahrscheinlichkeiten für jedes mögliche Ergebnis. In der chaotischen Realität der physischen Welt existiert eine solche perfekte Karte selten, bevor der Agent mit dem Lernen beginnt.

Ein Team von Forschern hat einen neuen Weg entwickelt, um dieses Dilemma zu bewältigen, indem sie ein System schufen, in dem der Sicherheitsschild mit dem Agenten gemeinsam lernt und sich anpasst. Anstatt auf eine perfekte Karte zu warten, geht ihr Ansatz davon aus, dass der Agent die allgemeine Struktur der Umgebung kennt – die möglichen Orte, die er besuchen kann, und die Aktionen, die er ausführen kann – aber nicht die genauen Wahrscheinlichkeiten dafür kennt, wohin diese Aktionen führen werden. Während der Agent exploriert, sammelt er Daten darüber, was tatsächlich passiert, wenn er sich bewegt. Ein Computerprogramm nutzt dann diese frischen Daten, um eine Schätzung der Regeln der Welt zu erstellen und die fehlenden Wahrscheinlichkeiten zu ergänzen. Aus dieser Schätzung konstruiert das System einen Sicherheitsschild. Da die Daten anfangs spärlich sind, ist der Schild sehr vorsichtig und blockiert viele Aktionen, um sicherzugehen. Aber wenn der Agent mehr Erfahrung sammelt, wird die Schätzung präziser, die Unsicherheit schrumpft und der Schild lockert seinen Griff, wodurch er dem Agenten erlaubt, effizientere Risiken einzugehen. Dies schafft eine Partnerschaft, in der sich der Agent und sein Sicherheitswächter gemeinsam verbessern, was sicherstellt, dass der Agent sicher bleibt, während er lernt, effektiv zu werden.

Die Forscher testeten diese Idee in mehreren simulierten Welten, die von einem Flugzeug, das einer Kollision mit einem anderen Flugzeug ausweicht, bis hin zu einer Ameise, die um einen Prädator herum navigiert, reichten. In diesen Umgebungen musste der Agent ein Ziel erreichen und gleichzeitig spezifische Gefahren vermeiden, wobei die genauen Wahrscheinlichkeiten für ein Ausgleiten oder Scheitern vor ihm verborgen blieben. Sie verglichen ihre adaptive Methode mit zwei anderen Ansätzen: einem, bei dem der Agent gar keinen Sicherheitswächter hatte, und einem, bei dem der Agent einen perfekten Schild basierend auf einer bekannten, vollständigen Karte der Welt besaß. Die Ergebnisse zeigten, dass die adaptive Methode bemerkenswert erfolgreich war. Sie erlernte Strategien, die fast so sicher waren wie der perfekte Schild, während sie gleichzeitig die häufigen, gefährlichen Abstürze vermied, die auftraten, wenn der Agent keinen Wächter hatte. In einigen Fällen fand das adaptive System sogar bessere Routen als der perfekte Schild, weil seine vorsichtige frühe Exploration es ihm ermöglichte, profitable Pfade zu entdecken, die der statische, vorab berechnete Schild übersehen hatte.

Eine zentrale Erkenntnis war, dass das System am besten funktioniert, wenn der Sicherheitsschild regelmäßig aktualisiert wird, sobald neue Daten eintreffen. Wenn der Schild zu selten aktualisiert wird, bleibt der Agent in einem Zustand der Übervorsichtlichkeit stecken und ist nicht in der Lage, das gewonnene Wissen zu nutzen. Wenn er zu oft aktualisiert wird, verbringt das System zu viel Zeit mit der Neuberechnung der Sicherheit, anstatt zu lernen. Die Forscher fanden ein Gleichgewicht, bei dem die Aktualisierung des Schildes alle tausend Lernepisoden dem Agenten erlaubte, sein Verständnis der Welt zu verfeinern, ohne seinen Fortschritt zu bremsen. Sie entdeckten auch, dass die Art und Weise, wie das System Wahrscheinlichkeiten schätzt, entscheidend ist. Einige Methoden, die das Schlimmste für unbekannte Daten annehmen, neigen dazu, übermäßig restriktiv zu sein, während Methoden, die etwas optimistischer sind, dem Agenten erlauben, freier zu explorieren. Der effektivste Ansatz nutzte eine ausgewogene Strategie, die zwar sicher blieb, aber nicht potenziell nützliche Aktionen blockierte, nur weil die Daten noch nicht perfekt waren.

Die Studie hob auch ein subtiles, aber wichtiges Detail darüber hervor, wie der Agent exploriert. Wenn der Agent entscheidet, eine zufällige Aktion auszuprobieren, um etwas Neues zu lernen, erlaubt das System ihm, aus allen möglichen Aktionen zu wählen, selbst aus solchen, die der aktuelle Schild als unsicher betrachtet. Dies mag kontraintuitiv erscheinen, verhindert aber, dass der Agent in einer kleinen, sicheren Ecke der Welt gefangen bleibt. Indem er gelegentlich über die aktuellen Grenzen des Schildes hinaus ventured, sammelt der Agent genau die Daten, die nötig sind, um zu beweisen, dass diese Grenzen sicher erweitert werden können. Ohsten die Freiheit, die Grenzen des Unbekannten zu erkunden, würde der Schild niemals lernen, weniger konservativ zu werden. Die Forscher beobachteten, dass diese Bereitschaft, kalkulierte Risiken einzugehen, in komplexen Umgebungen entscheidend war, um den bestmöglichen Pfad zu finden.

Letztendlich zeigt diese Arbeit, dass Sicherheit und Lernen keine Feinde sein müssen. Indem man den Sicherheitsschild nicht als feste Wand, sondern als einen lebendigen Führer behandelt, der mit der Erfahrung des Agenten mitwächst, ist es möglich, gefährliche Umgebungen ohne eine vorherige perfekte Karte zu navigieren. Das System bewies, dass ein Agent sowohl sicher als auch geschickt lernen kann, vorausgesetzt, der Sicherheitsmechanismus ist flexibel genug, um mit der Vertiefung des Verständnisses des Agenten für die Welt zu wachsen. Dieser Ansatz bietet einen praktischen Weg nach vorn für den Einsatz intelligenter Systeme in realen Szenarien, in denen die Regeln nicht vollständig bekannt sind, und stellt sicher, dass der Weg zur Meisterschaft nicht auf Kosten der Sicherheit geht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →