CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning
Dit artikel introduceert CLIFT, een niet-invasieve, iteratieve closed-loop fine-tuning methode die humanoïde robots die gebruikmaken van closed-weight foundation modellen (zoals Gemini Robotics On-Device) in staat stelt om bijna perfecte taakbeheersing te bereiken door beloningsfeedback tijdens de implementatie om te zetten in gesuperviseerde data voor API-gebaseerde beleidsverbetering, waardoor de beperkingen van pure imitatieleer worden overwonnen zonder toegang te vereisen tot de interne werking van het model.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij een complexe dans moet uitvoeren. In de wereld van kunstmatige intelligentie zijn er twee belangrijke manieren om dit te doen. De eerste is "open-source", waarbij je de volledige hersenen van de robot krijgt, de code en de interne bedrading, en je elke schroef zelf kunt aanpassen. De tweede is "closed-source", waarbij de robot een zwarte doos is. Je kunt niet naar binnen kijken, je kunt de draden niet aanraken en je kunt de code niet veranderen. Alleen kun je de robot een lijst met instructies geven (zoals "dans zoals dit") en hem vragen ervan te leren. Dit wordt de standaard voor de krachtigste robotbreinen die vandaag de dag beschikbaar zijn: ze zijn ongelooflijk slim, maar ze zitten achter een digitale deur op slot.
De grote vraag waar wetenschappers zich mee bezighouden is: als je niet in de hersenen van de robot kunt kijken, kun je hem dan nog steeds leren om moeilijke, real-world taken te beheersen? Meestal, wanneer je de binnenkant niet kunt zien, ben je beperkt tot alleen het kopiëren van wat je ziet (imitatie). Maar het echte leven is rommelig. Een robot kan een mens in een video perfect kopiëren, maar wanneer hij het probeert op een wiebelende vloer of met een gladde beker, kan hij falen vanwege kleine vertragingen of natuurkunde waar hij geen rekening mee heeft gehouden. Om echt goed te worden, moet een robot oefenen, falen, beseffen wat er misging en het opnieuw proberen — een proces dat "closed-loop learning" wordt genoemd. De uitdaging is: hoe leer je een robot te leren van zijn eigen fouten als je niet de toestemming hebt om zijn interne leermechanismen aan te raken?
Dit artikel, getiteld CLIFT, pakt precies dat probleem aan. De onderzoekers wilden zien of ze een krachtig, op slot gezet robotmodel genaamd "Gemini Robotics On-Device" konden veranderen in een meester van lastige, contact-intensieve taken (zoals het stapelen van borden of het inpakken van dozen) zonder ooit de "modeldoos" te openen. Ze ontdekten dat het simpelweg kopiëren van menselijke video's (een methode genaamd Supervised Fine-Tuning) de robot veel beter maakte dan andere open-source robots, maar dat het nog steeds niet perfect genoeg was voor real-world behendigheid. De robot zou vaak dingen laten vallen of de laatste stappen verprutsen.
Om dit op te lossen, hebben het team een slimme truc bedacht genaamd CLIFT (Closed-Loop Iterative Fine-Tuning). Denk aan het als een video game coach die de code van het spel niet kan veranderen, maar de speler er nog steeds in kan leren. Zo werkt het:
- De oefenronde: De robot probeert een taak uit te voeren in de echte wereld. Hij kan slagen, of hij kan falen.
- Het scorebord: In plaats van alleen "Goed gedaan" of "Slecht gedaan" te zeggen, kijkt een speciale AI-rechter (een reward model) naar de video en geeft een score aan elk klein fragment van de beweging. Het identificeert precies welke delen vloeiend en nuttig waren, en welke delen onhandig of gevaarlijk waren.
- Het magische label: Het team neemt deze gescoorde video's en verandert ze in een nieuwe trainingsles. Ze voegen een speciaal "embleem" toe aan de goede delen (zoals een gouden ster) en een "waarschuwing" aan de slechte delen.
- De les: Ze sturen deze nieuwe, gelabelde les terug naar de op slot gezette hersenen van de robot via een API (een digitaal menu). De robot traint zichzelf opnieuw op deze nieuwe data, waarbij hij leert te zoeken naar de "gouden sterren" en de "waarschuwingen" te vermijden.
De onderzoekers draaiden deze cyclus twee keer, als een vliegwiel dat steeds sneller gaat draaien. De resultaten waren indrukwekkend. Tegen de tijd dat ze klaar waren, kopieerde de robot niet meer alleen de mensen; hij begon zijn eigen slimme bewegingen te verzinnen. Bijvoorbeeld, bij het inpakken van een doos leerde de robot de doos met zijn vingers te duwen en te draaien om een betere grip te krijgen voordat hij hem optilde — een beweging die de menselijke docenten hem nooit hadden getoond. Wanneer hij probeerde een fles in een beker te zetten, leerde hij bij een mislukking in plaats van op te geven gewoon het opnieuw te proberen.
Het artikel laat zien dat deze "niet-invasieve" methode wonderen deed. Het succespercentage van de robot sprong van ongeveer 50-70% naar bijna 100% bij moeilijke taken zoals het stapelen van borden en het plaatsen van flessen. Nog verrassender was dat toen ze dezelfde truc probeerden op een andere, open-source robot (één waarbij ze de code wel hadden kunnen aanpassen), de op slot gezette robot nog steeds beter presteerde. Dit suggereert dat het hebben van een echt sterke, vooraf getrainde "hersenen" belangrijker is dan het hebben van volledige toegang tot de code.
Kortom, het artikel bewijst dat je de hersenen van de robot niet hoeft te breken om hem te leren. Door real-world oefensessies te veranderen in slimme, gelabelde lessen, kun je een op slot gezette robot begeleiden om een specialist te worden, die complexe fysieke taken beheerst via een eenvoudige, iteratieve lus van proberen, scoren en opnieuw leren. De auteurs ontdekten dat deze aanpak de robot naar bijna perfecte beheersing stuwt na slechts twee cycli, zonder ooit de "modeldoos" te openen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.