KLTNet: Learning Sparse Feature Tracking for Robust and Accurate Monocular Visual-Inertial Odometry
Het artikel stelt KLTNet voor, een lichtgewicht, op leren gebaseerde sparse feature tracker die de klassieke KLT in visuele-inertiele odometriesystemen vervangt door een coarse-to-fine dense-to-sparse architectuur en anisotrope confidentiegewichten te combineren om robuuste, nauwkeurige en real-time staatsschatting te bereiken, met name in uitdagende omgevingen met weinig textuur of hoge beweging.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Om te begrijpen hoe een robot of een zelfrijdende auto weet waar hij zich bevindt, moet je je voorstellen dat hij door een donkere kamer loopt met zijn ogen dicht, waarbij hij alleen vertrouwt op het gevoel van zijn eigen stappen en de vage herinnering aan de muren die hij is gepasseerd. Dit is de uitdaging van visual-inertial odometry, een technologie die machines in staat stelt hun omgeving in kaart te brengen en hun beweging te volgen met niets anders dan een camera en een bewegingssensor. De camera fungeert als de ogen en scant voortdurend de wereld op zoek naar duidelijke punten van belang, zoals de hoek van een tafel of een barst in het wegdek. De machine probeert vervolgens deze punten van de ene naar de volgende afbeelding te volgen, waarbij het berekent hoe ver het bewogen heeft op basis van hoe die punten verschuiven. Decennialang was de meest gebruikelijke manier om dit te doen een methode genaamd KLT, die werkt als een paar ogen die proberen zich vast te leggen op een enkel stofje en dit frame voor frame te volgen. Het is snel en efficiënt, maar het heeft een zwakte: als de kamer te kaal is, of als de camera te snel beweegt, verdwijnt het stofje en raakt de machine de weg kwijt, waardoor hij zonder het te beseffen van zijn koers afdrijft.
Onderzoekers aan de Shanghai Jiao Tong Universiteit hebben een nieuw systeem ontwikkeld genaamd KLTNet om dit probleem op te lossen. In plaats van alleen naar één punt te staren en te hopen dat het zichtbaar blijft, neemt hun systeem een breder overzicht voordat het inzoomt. Het kijkt eerst naar de hele scène om een ruwe indruk te krijgen van hoe de camera beweegt, vergelijkbaar met een persoon die een blik werpt op de hele kamer om zich te oriënteren voordat hij zich op een specifief object concentreert. Deze eerste, brede blik helpt het systeem op koers te blijven, zelfs wanneer de camera snel draait of wanneer de muren te glad zijn om veel details te bieden. Zodra het systeem een ruwe indruk heeft van waar een punt zich zou moeten bevinden, voert het vervolgens een nauwkeurige, fijnmazige aanpassing uit met behulp van een klein deel van de afbeelding dat het oorspronkelijke startpunt, de vorige positie en de huidige positie bevat. Door het oorspronkelijke startpunt als referentie vast te houden, voorkomt het systeem dat de kleine fouten die normaal gesproken na verloop van tijd zich opstapelen, de hele berekening verstoren.
Het team testte deze nieuwe tracker door deze aan te sluiten op bestaande navigatiesystemen die door robots en drones worden gebruikt. Ze lieten het door een verscheidenheid aan uitdagende omgevingen gaan, waaronder lange, lege gangen met witte muren waar traditionele systemen vaak falen, en sequenties met snelle, schokkerige bewegingen. In deze tests presteerde het nieuwe systeem consequent beter dan de oude methode. In standaard benchmarks die gebruikt worden om robotnavigatie te meten, verminderde de nieuwe aanpak de totale afstandsfout met 34 procent in één reeks tests en met 49 procent in een andere. Misschien wel het belangrijkste is dat het systeem stabiel bleef in de texturearme gangen waar de oude methode aanzienlijk zou afdrijven, terwijl het in eenvoudigere omstandigheden net zo goed presteerde als de oude methode. De onderzoekers hebben het systeem ook geleerd om een betrouwbaarheidsscore toe te kennen aan elk punt dat het volgt, waardoor de robot de punten kan vertrouwen die duidelijk zijn en de punten kan negeren die wazig of verwarrend zijn. Deze extra laag van oordeelsvorming hielp de robot betere beslissingen te nemen over zijn eigen positie.
Het succes van dit werk ligt in het vermogen om de snelheid van eenvoudige tracking te combineren met de robuustheid van complexere computer vision-technieken, terwijl het snel genoeg blijft om te worden gebruikt op kleine, op batterijen werkende apparaten. De onderzoekers toonden aan dat hun systeem in realtime kan draaien op een ingebedde computer ter grootte van een klein boek, wat bewijst dat het geen enorme, energieverslindende servers nodig heeft om te functioneren. Door de oude, fragiele trackingmethode te vervangen door deze nieuwe, hybride aanpak, hebben ze machines een betrouwbaardere manier gegeven om de wereld te zien, wat ervoor zorgt dat ze hun weg kunnen vinden door zowel de rommelige als de lege ruimtes van onze fysieke omgeving.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.