← Nieuwste papers
⚡ electrical engineering

Towards smart and adaptive agents for active sensing on edge devices

Dit artikel introduceert een compact, op active inference gebaseerd agentisch systeem dat real-time, adaptieve actieve sensing op resource-beperkte edge-apparaten mogelijk maakt door deze toe te staan dynamisch camerabewegingen te plannen en te besturen om de beperkingen van traditionele TinyML-benaderingen te overwinnen.

Oorspronkelijke auteurs: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

Gepubliceerd 2026-09-17
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een camera voor die niet alleen de wereld registreert, maar ook actief kiest waar hij naar kijkt, net zoals een menselijk oog van het ene detail naar het andere schiet om een compleet beeld op te bouwen. Dit is het domein van actieve waarneming (active sensing), een concept waarbij machines niet passief wachten op data, maar hun sensoren bewegen om de meest nuttige informatie te verzamelen. Jarenlang was de droom om dit soort slim, adaptief gedrag te brengen naar kleine, op batterijen werkende apparaten die zich direct daar bevinden waar de actie plaatsvindt, zoals op een beveiligingscamera of een robot, zonder dat er data naar een verre cloudserver gestuurd hoeft te worden. De uitdaging was dat de krachtige kunstmatige intelligentiesystemen die dit in staat stellen, meestal enorme hoeveelheden rekenkracht en geheugen vereisen, waardoor ze onmogelijk te draaien zijn op deze kleine, lokale apparaten.

Een team van onderzoekers heeft nu een systeem gebouwd dat deze kloof overbrugt, door een slimme agent te creëren die in realtime kan zien, plannen en een camera bewegen terwijl deze draait op een apparaat dat niet groter is dan een kleine computerkaart. In een recente studie gepubliceerd, laat dit werk zien dat het mogelijk is om twee verschillende benaderingen van kunstmatige intelligentie te combineren: één die uitstekend is in het herkennen van objecten in afbeeldingen, en een andere die uitstekend is in het nemen van beslissingen onder onzekerheid. Het resultaat is een "saccade-agent", vernoemd naar de snelle, schokkerige oogbewegingen die mensen maken om zich op details te concentreren, die een camera kan aansturen om mensen te volgen of een kamer autonoom te verkennen. Het systeem draait volledig op het edge-apparaat, wat betekent dat het alles lokaal verwerkt, wat zorgt voor snelle reacties en de privacy van gegevens waarborgt.

De onderzoekers stonden voor een specifief probleem: standaard deep learning-modellen, die erg goed zijn in het opsporen van zaken zoals mensen of auto's in een videofeed, zijn rigide. Zodra ze getraind zijn, hebben ze moeite met het aanpassen als de omgeving verandert of als ze moeten beslissen waar ze als volgende moeten kijken om iets nieuws te vinden. Ze vertrouwen op enorme hoeveelheden data en rekenkracht om te leren, wat precies het tegenovergestelde is van wat een klein, energiezuinig apparaat nodig heeft. Om dit op te lossen, probeerde het team het deep learning-model niet groter of slimmer te maken. In plaats daarvan voegden ze een tweede laag intelligentie toe bovenop het model, gebaseerd op een principe genaamd actieve inferentie (active inference). Deze benadering behandelt de agent als een wetenschapper die voortdurend zijn overtuigingen over de wereld bijwerkt. Hij vraagt: "Wat verwacht ik te zien?" en "Wat zou mij verrassen?". Als de camera niets nieuws ziet, besluit de agent naar een andere plek te bewegen om meer te leren. Als de camera iets interessants ziet, zoals een persoon, richt hij zich daarop. Dit besluitvormingsproces is ongelooflijk lichtgewicht en vereist zeer weinig geheugen, waardoor het naast de zwaardere objectdetectiesoftware kan draaien.

Om dit idee te testen, bouwde het team een fysieke prototype met behulp van een NVIDIA Jetson-apparaat, een krachtige computer ontworpen voor kunstmatige intelligentie-taken aan de edge. Ze verbonden dit apparaat met een camera die kon draaien en kantelen (pan en tilt), vergelijkbaar met de beveiligingscamera's die in veel gebouwen te vinden zijn. Het systeem kreeg een eenvoudige maar krachtige taak: een scène in de gaten houden en beslissen waar de lens naartoe moet wijzen. Het eerste deel van het systeem, de perceptiemodule, gebruikte een bekende objectdetectietool genaamd YOLO om de videofeed te scannen en mensen of objecten te vinden. Deze tool was geoptimaliseerd om snel op de hardware van het apparaat te draaien. Het tweede deel, de planningsmodule, nam de lijst met dingen die de camera zag en gebruikte actieve inferentie om de volgende beweging te bepalen. Het berekende in welke richting de camera moest draaien om ofwel een persoon in de gaten te houden, ofwel een leeg gebied te scannen om te zien of er iets nieuws verscheen.

De resultaten toonden aan dat deze combinatie verrassend goed werkte binnen de strikte beperkingen van de hardware. Het hele systeem, inclusief de software die nodig is om het te laten draaien, paste in een geheugenvoetafdruk van slechts 304 megabyte, wat minuscuul is voor een kunstmatige intelligentiesysteem. In één configuratie kon de camera video verwerken en een beslissing nemen over waar hij als volgende naar moest kijken, 108 keer per seconde – een snelheid die snel genoeg is om voor een menselijke waarnemer instantaan aan te voelen. In een andere opstelling gaf het systeem prioriteit aan snelheid boven geheugen, waarbij het 45 frames van videoanalyse per seconde bereikte terwijl het 250 keer per seconde beslissingen nam. De onderzoekers ontdekten dat de tijd die nodig was om een beslissing te nemen zo kort was, dat het systeem gemakkelijk het tempo van de videofeed kon bijhouden, waardoor de camera vloeiend bewegende doelwitten kon volgen of een kamer kon scannen zonder vertraging.

Wat deze prestatie belangrijk maakt, is niet alleen dat de camera bewoog, maar hoe hij bewoog. De agent volgde geen vooraf geprogrammeerd pad. In plaats daarvan reageerde hij in realtime op de omgeving. Als een persoon in het beeld liep, zou de camera op die persoon focussen. Als de persoon bewoog, volgde de camera. Als de persoon vertrok en de kamer leeg was, besloot de agent de rest van de kamer te scannen om te zien of er nog iets anders aan de hand was. Dit gedrag bootst de manier na waarop mensen van nature hun omgeving verkennen, waarbij ze een balans zoeken tussen de noodzaak om te focussen op wat belangrijk is en de noodzaak om een volledig beeld te behouden. De onderzoekers demonstreerden dit met een camera gemonteerd op een kleine robot, waarmee zij lieten zien dat het systeem een machine kan helpen een nieuwe omgeving efficiënt en zonder menselijke tussenkomst te verkennen en informatie te verzamelen.

De studie testte ook zorgvuldig verschillende manieren om de software op de hardware te draaien om de beste balans te vinden tussen snelheid en geheugengebruik. Ze ontdekten dat het gebruik van specifieke tools die ontworpen zijn voor de grafische processor van het apparaat, de systeemprestaties aanzienlijk verbeterde vergeleken met standaardmethoden. Ze ontdekten echter ook dat voor het besluitvormingsgedeelte van het systeem, dat zeer klein is, het proberen uit te voeren op de krachtige grafische processor de boel juist vertraagde, omdat de overhead van het beheren van de taak groter was dan het voordeel van de extra rekenkracht. Deze bevinding onderstreept het belang van het matchen van de juiste softwaretools met de juiste hardware, een cruciale stap voor het praktisch bruikbaar maken van deze systemen voor echt gebruik.

Dit werk suggereert dat de toekomst van slimme apparaten niet noodzakelijkerwijs massieve, cloud-gebaseerde supercomputers vereist. Door een robuust vermogen om te zien te combineren met een lichtgewicht vermogen om te plannen, is het mogelijk om agents te creëren die zowel slim als efficiënt zijn. De onderzoekers hebben aangetoond dat deze systemen onafhankelijk kunnen opereren en razendsnelle beslissingen kunnen nemen om informatie te verzamelen in complexe, veranderende omgevingen. Hoewel het huidige systeem zich richt op het aansturen van een camera, kunnen dezelfde principes worden toegepast op andere taken, zoals het helpen van een robot bij het navigeren door een drukke kamer of een drone die een vermiste persoon zoekt. De studie concludeert dat actieve inferentie een veelbelovende weg voorwaarts biedt voor het creëren van adaptieve, efficiënte machines die de onvoorspelbaarheid van de echte wereld aankunnen, waardoor de kracht van intelligente waarneming rechtstreeks naar de edge wordt gebracht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →