← Nieuwste papers
💻 computer science

Approach to Robust Visual Relocalization for Humanoid Robots via Mixture-of-Experts with Hierarchical Distillation

Dit artikel stelt een robuust visueel relokalisatieframework voor humanoïde robots voor dat een Mixture-of-Experts-architectuur integreert met hiërarchische kennisdistillatie om nauwkeurige, stabiele en efficiënte 6-DoF pose-estimatie te bereiken onder uitdagende omstandigheden zoals abrupte gezichtspuntveranderingen en zelf-occlusie.

Oorspronkelijke auteurs: Shichu Sun, Jingwen Luo

Gepubliceerd 2026-09-07
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shichu Sun, Jingwen Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die op twee benen loopt en de balans en beweging van een mens nabootst. Voor een dergelijke machine om zich in de echte wereld te kunnen verplaatsen, moet hij constant weten waar hij is en hoe hij georiënteerd is, een taak die bekend staat als visuele relokalisatie. Het vertrouwt op zijn camera om naar de wereld te kijken, bekende vormen en texturen te herkennen en zijn positie in de ruimte te berekenen. Echter, dit proces is uiterst fragiel. Wanneer een robot zijn hoofd snel draait, wanneer een persoon voor zijn lens loopt, of wanneer het licht verandert van fel zonlicht naar diepe schaduw, kan de robot gemakkelijk de weg kwijtraken. Traditionele methoden hebben vaak moeite met het balanceren van de behoefte aan extreme nauwkeurigheid met de behoefte aan snelheid, vooral bij een robot met beperkte rekenkracht die geen zware, trage processors kan meedragen.

Onderzoekers aan de Yunnan Normal University hebben een nieuwe aanpak ontwikkeld om dit probleem op te lossen, waarbij ze een systeem hebben gecreëerd dat humanoïde robots in staat stelt om zelfs in chaotische omgevingen betrouwbaar hun weg te vinden. Hun werk, gepubliceerd in een recente studie, richt zich op het aanleren van een "brein" aan een robot dat zowel slim als efficiënt is. Ze bereikten dit door twee geavanceerde concepten te combineren: een methode waarmee de robot verschillende mentale strategieën kan kiezen voor verschillende scènes, en een techniek die een complex, krachtig model inkrimpt tot een kleinere, snellere versie zonder het vermogen te verliezen om helder na te denken. Het resultaat is een systeem dat een robot genaamd KUAVO-4pro helpt om binnen gangen en buitenruimtes te navigeren met centimeterprecisie, waarbij het zijn balans en richting behoudt, zelfs wanneer de wereld om hem heen snel verandert.

De kernuitdaging waar de onderzoekers mee te maken kregen, is dat een enkele, rigide set regels niet de diversiteit van de echte wereld kan aanpakken. Een gang met gladde, herhalende muren ziet er heel anders uit dan een rommelig kantoor met veel hoeken en objecten. Oudere systemen probeerden vaak één massief model te gebruiken om alles te verwerken, wat hen traag maakte en vatbaar voor fouten wanneer de scène veranderde. Het nieuwe framework introduceert een concept genaamd een "mixture of experts" (een mengeling van experts). In plaats van te vertrouwen op één gigantisch brein, gebruikt het systeem een verzameling gespecialiseerde sub-netwerken, of experts. Wanneer de robot naar een scène kijkt, selecteert een kleine besluitvormingspoort automatisch welke expert het best geschikt is voor dat specifieke beeld. Als de robot een textuurrijke hoek ziet, kan het een expert activeren die goed is in het herkennen van details. Als het een lange, lege muur ziet, kan het overschakelen naar een expert die beter is in het begrijpen van rechte lijnen. Dit stelt de robot in staat om zijn denken in realtime aan te passen, door de juiste tool voor de klus te gebruiken zonder dat hij alle mogelijkheden tegelijkert === moet verwerken.

Om dit systeem praktisch te maken voor een robot met een beperkte batterij en rekenkracht, werden de onderzoekers geconfronteerd met een tweede hindernis: de meest krachtige versie van dit "mixture of experts"-systeem is te groot om direct op de robot te draaien. Om dit op te lossen, gebruikten ze een techniek genaamd hiërarchische distillatie. In dit proces trainden ze eerst een groot, complex "leraar"-model dat alle moeilijke scenario's perfect kon afhandelen. Vervolgens trainden ze een veel kleiner "student"-model om de leraar na te bootsen. Ze vroegen de student echter niet alleen om het uiteindelijke antwoord te kopiëren. In plaats daarvan leerden ze de student het interne denkproces van de leraar na te bootsen. De student leerde hoe de leraar besliste welke expert te gebruiken, hoe deze vormen in de afbeelding interpreteerde, en hoe deze punten en lijnen verbond om de 3D-structuur van de kamer te begrijpen. Door deze interne stappen op elkaar af te stemmen, erfde het kleine student-model de robuustheid en intelligentie van de leraar, waardoor het accuraat genoeg werd voor echt wereldgebruik terwijl het klein genoeg bleef om snel te draaien.

De onderzoekers testten hun systeem met behulp van een verscheidenheid aan uitdagende scenario's. Ze voerden simulaties uit op publieke datasets die kamers met zwakke texturen, extreme lichtveranderingen en bewegende objecten bevatten. In deze tests presteerde het systeem consequent beter dan eerdere methoden, waarbij het een hoge nauwkeurigheid behield, zelfs wanneer het zicht van de robot gedeeltelijk geblokkeerd was of het licht drastisch veranderde. Het team voerde ook experimenten in de echte wereld uit met de humanoïde robot KUAVO-4pro, die ongeveer 1,66 meter groot is. Ze begeleidden de robot door binnenomgevingen en lange gangen, gebieden die bekend staan om het verwarren van robots vanwege hun repetitieve patronen en gebrek aan onderscheidende kenmerken. De robot navigeerde succesvol door deze ruimtes, waarbij de geschatte route opmerkelijk dicht bij de werkelijke route bleef. In de binnenruimte-tests was de gemiddelde fout ongeveer 2,1 centimeter, en zelfs in de moeilijke gang bleef de fout binnen een beheersbare marge en raakte deze nooit uit de hand.

Een belangrijke bevinding van de studie was hoe goed het systeem de overgang tussen verschillende soorten omgevingen afhandelde. Wanneer de robot bewoog van een helder, open gebied naar een minder verlichte hoek, of wanneer een persoon voor de camera liep, raakte het systeem niet in paniek of de weg kwijt. De gespecialiseerde experts binnen het model werden soepel geactiveerd en gedeactiveerd, waardoor het begrip van de robot van zijn omgeving stabiel bleef. Het kleinere student-model, dat ongeveer 70% kleiner was in termen van parameters dan het oorspronkelijke leraar-model, presteerde bijna net zo goed als de grotere versie. Dit bewees dat het distillatieproces de complexe geometrische redenering van het grote model succesvol heeft overgedragen naar een compact pakket. De robot kon zijn positie berekenen in ongeveer 33 milliseconden, een snelheid die snel genoeg is om de snelle bewegingen van een wandelende humanoïde bij te houden.

Het succes van deze aanpak suggereert een levensvatbaar pad voor autonome robots die moeten opereren in dynamische, ongestructureerde menselijke omgevingen. Door de flexibiliteit van het kiezen van verschillende experts te combineren met de efficiëntie van een gedestilleerd student-model, hebben de onderzoekers een systeem gecreëerd dat geen accuraatheid hoeft op te offeren voor snelheid. De robot kan nu omgaan met de onvoorspelbaarheid van de echte wereld, van plotselinge schaduwen tot bewegende mensen, zonder een supercomputer op zijn rug nodig te hebben. Hoewel de onderzoekers opmerken dat toekomstig werk de toevoeging van gegevens van andere sensoren zoals gyroscopen kan omvatten om de stabiliteit verder te verbeteren, demonstreert dit huidige werk dat een robot zowel lichtgewicht als zeer betrouwbaar kan zijn. Het vertegenwoordigt een belangrijke stap naar machines die zich met dezelfde zelfverzekerdheid en aanpassingsvermogen als mensen door onze wereld kunnen bewegen, en hun weg vinden zelfs wanneer het zicht belemmerd is of het pad onduidelijk is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →