← Neueste Arbeiten
⚡ electrical engineering

Towards smart and adaptive agents for active sensing on edge devices

Dieses Paper stellt ein kompaktes, auf aktiver Inferenz basierendes agentisches System vor, das durch die Ermöglichung einer dynamischen Planung und Steuerung von Kamerabewegungen die Grenzen traditioneller TinyML-Ansätze überwindet und somit eine Echtzeit-adaptive aktive Sensorik auf ressourcenbeschränkten Edge-Geräten ermöglicht.

Ursprüngliche Autoren: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

Veröffentlicht 2026-09-17
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Kamera vor, die die Welt nicht nur aufzeichnet, sondern aktiv auswählt, worauf sie blickt, ganz ähnlich wie ein menschliches Auge, das von einem Detail zum nächsten springt, um ein vollständiges Bild aufzubauen. Dies ist der Bereich des aktiven Sensorik (Active Sensing), ein Konzept, bei dem Maschinen nicht passiv darauf warten, Daten zu erhalten, sondern ihre Sensoren bewegen, um die nützlichsten Informationen zu sammeln. Jahrelang war es der Traum, diese Art von intelligentem, adaptivem Verhalten auf kleine, batteriebetriebene Geräte zu übertragen, die genau dort sitzen, wo das Geschehen stattfindet, wie etwa auf einer Überwachungskamera oder einem Roboter, ohne dass Daten an einen entfernten Cloud-Server gesendet werden müssen müssen. Die Herausforderung bestand darin, dass die leistungsstarken KI-Systeme, die dazu in der Lage sind, normalerweise enorme Mengen an Rechenleistung und Speicher benötigen, was sie auf diesen kleinen, lokalen Geräten unmöglich macht.

Ein Team von Forschern hat nun ein System entwickelt, das diese Lücke schließt, indem es einen intelligenten Agenten erschafft, der in Echtzeit sehen, planen und eine Kamera bewegen kann, während er auf einem Gerät läuft, das nicht größer als eine kleine Computerplatine ist. In einer kürzlich veröffentlichten Studie wird dargelegt, dass es möglich ist, zwei verschiedene Ansätze der künstlichen Intelligenz zu kombinieren: einen, der exzellent im Erkennen von Objekten in Bildern ist, und einen anderen, der exzellent darin ist, Entscheidungen unter Unsicherheit zu treffen. Das Ergebnis ist ein „Sakkaden-Agent“, benannt nach den schnellen, ruckartigen Augenbewegungen, die Menschen machen, um sich auf Details zu konzentrieren, welcher eine Kamera steuern kann, um Menschen zu verfolgen oder einen Raum autonom zu erkunden. Das System läuft vollständig auf dem Edge-Gerät, was bedeutet, dass es alles lokal verarbeitet, wodurch schnelle Reaktionen gewährleistet und die Daten privat gehalten werden.

Die Forscher standen vor einem spezifischen Problem: Standardmäßige Deep-Learning-Modelle, die sehr gut darin sind, Dinge wie Menschen oder Autos in einem Videofeed zu entdecken, sind starr. Sobe sie trainiert wurden, haben sie Schwierigkeiten, sich anzupassen, wenn sich die Umgebung verändert oder wenn sie entscheiden müssen, wohin sie als Nächstes schauen sollen, um etwas Neues zu finden. Sie verlassen sich auf riesige Mengen an Daten und Rechenleistung, was das Gegenteil von dem ist, was ein kleines, stromsparendes Gerät benötigt. Um dieses Problem zu lösen, versuchte das Team nicht, das Deep-Learning-Modell größer oder intelligenter zu machen. Stattdessen fügten sie eine zweite Ebene der Intelligenz über das Modell hinzu, die auf einem Prinzip namens „Active Inference“ basiert. Dieser Ansatz betrachtet den Agenten als einen Wissenschaftler, der ständig seine Überzeugungen über die Welt aktualisiert. Er fragt: „Was erwarte ich zu sehen?“ und „Was würde mich überraschen?“ Wenn die Kamera nichts Neues sieht, entscheidet der Agent, sich an einen anderen Ort zu bewegen, um mehr zu lernen. Wenn sie etwas Interessantes sieht, wie zum Beispiel eine Person, konzentriert sie sich auf diese. Dieser Entscheidungsprozess ist unglaublich leichtgewichtig und erfordert nur sehr wenig Speicher, was es ermöglicht, ihn neben der schwereren Objekterkennungssoftware laufen zu lassen.

Um diese Idee zu testen, baute das Team einen physischen Prototypen unter Verwendung eines NVIDIA Jetson-Geräts, eines leistungsstarken Computers, der für KI-Aufgaben am Edge konzipiert ist. Sie verbanden dieses Gerät mit einer Kamera, die schwenken und neigen konnte, ähnlich den Sicherheitskameras, die man in vielen Gebäuden findet. Das System erhielt eine einfache, aber kraftvolle Aufgabe: Eine Szene zu beobachten und zu entscheiden, wohin die Linse gerichtet werden soll. Der erste Teil des Systems, das Wahrnehmungsmodul, nutzte ein bekanntes Objekterkennungstool namens YOLO, um den Videofeed zu scannen und Menschen oder Objekte zu finden. Dieses Tool wurde optimiert, um schnell auf der Hardware des Geräts zu laufen. Der zweite Teil, das Planungsmodul, nahm die Liste der Dinge, die die Kamera sah, und nutzte Active Inference, um den nächsten Schritt zu planen. Es berechnete, in welche Richtung die Kamera drehen sollte, um entweder eine Person im Auge zu behalten oder einen leeren Bereich zu scannen, um zu sehen, ob etwas Neues erscheint.

Die Ergebnisse zeigten, dass diese Kombination innerhalb der strengen Grenzen der Hardware bemerkenswert gut funktionierte. Das gesamte System, einschließlich der Software, die zum Betrieb benötigt wird, passte in einen Speicherbedarf von nur 304 Megabyte, was für ein KI-System winzig ist. In einer Konfiguration konnte die Kamera das Video verarbeiten und eine Entscheidung darüber treffen, wohin sie als Nächstes schauen soll, 108 Mal pro Sekunde – eine Geschwindigkeit, die für einen menschlichen Beobachter fast instantan wirkt. In einem anderen Setup priorisierte das System Geschwindigkeit gegenüber Speicherplatz und erreichte 45 Frames der Videoanalyse pro Sekunde bei gleichzeitig 250 Entscheidungen pro Sekunde. Die Forscher fanden heraus, dass die Zeit, die für eine Entscheidung benötigt wurde, so kurz war, dass das System problemlos mit dem Videofeed Schritt halten konnte, was es der Kamera ermöglichte, beweglichen Zielen reibungslos zu folgen oder einen Raum ohne Verzögerung abzutasten.

Was diese Errungenschaft bedeutend macht, ist nicht nur, dass die Kamera sich bewegte, sondern wie sie sich bewegte. Der Agent folgte keinem vorprogrammierten Pfad. Stattdessen reagierte er in Echtzeit auf die Umgebung. Wenn eine Person ins Bild lief, fixierte die Kamera sie. Wenn die Person sich bewegte, folgte die Kamera ihr. Wenn die Person ging und der Raum leer war, entschied der Agent, den Rest des Raumes zu scannen, um zu sehen, ob sonst noch etwas geschieht. Dieses Verhalten ahmt die Art und Weise nach, wie Menschen natürlich ihre Umgebung erkunden, indem sie das Gleichgewicht zwischen der Notwendigkeit, sich auf das Wichtige zu konzentrieren, und der Notwendigkeit, sich der Gesamtsituation bewusst zu bleiben, halten. Die Forscher demonstrierten dies mit einer Kamera, die auf einem kleinen Roboter montiert war, und zeigten, dass das System helfen kann, eine neue Umgebung effizient und ohne menschliche Intervention zu erkunden.

Die Studie testete auch sorgfältig verschiedene Möglichkeiten, die Software auf der Hardware auszuführen, um das beste Gleichgewicht zwischen Geschwindigkeit und Speichernutzung zu finden. Sie fanden heraus, dass die Verwendung spezifischer Werkzeuge, die für den Grafikprozessor des Geräts entwickelt wurden, das System wesentlich schneller laufen ließ als Standardmethoden. Sie entdeckten jedoch auch, dass der Versuch, den Entscheidungsteil des Systems, der sehr klein ist, auf dem leistungsstarken Grafikprozessor laufen zu lassen, die Geschwindigkeit tatsächlich verlangsamte, da der Overhead für die Verwaltung der Aufgabe größer war als der Nutzen der zusätzlichen Leistung. Dieser Befund unterstreicht die Bedeutung der Abstimmung der richtigen Softwarewerkzeuge auf die richtige Hardware, ein entscheidender Schritt, um solche Systeme für den realen Einsatz praktikabel zu machen.

Diese Arbeit legt nahe, dass die Zukunft smarter Geräte nicht zwangsläufig massiven, cloudbasierten Supercomputern bedarf. Durch die Kombination einer robusten Fähigkeit zu sehen mit einer leichtgewichtigen Fähigkeit zu planen, ist es möglich, Agenten zu schaffen, die sowohl intelligent als auch effizient sind. Die Forscher zeigten, dass diese Systeme unabhängig operieren können, indem sie in komplexen, sich verändernden Umgebungen blitzschnelle Entscheidungen treffen, um Informationen zu sammeln. Während das aktuelle System die Steuerung einer Kamera fokussiert, könnten dieselben Prinzipien auf andere Aufgaben angewendet werden, wie etwa dabei zu helfen, dass ein Roboter einen belebten Raum navigiert oder eine Drohne eine vermisste Person sucht. Die Studie kommt zu dem Schluss, dass Active Inference einen vielversprechenden Weg für die Entwicklung adaptiver, ressourceneffizienter Maschinen bietet, die mit der Unvorhersehbarkeit der realen Welt umgehen können, und bringt die Kraft intelligenter Sensorik direkt an den Edge.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →