← Nieuwste papers
🤖 AI

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA introduceert een snelheid-controleerbaar Vision-Language-Action-beleid dat gebruikmaakt van Variable-Speed Trajectory Augmentation (VSTA) en expliciete snelheid-conditionering om robots in staat te stellen hun uitvoeringssnelheid dynamisch aan te passen voor zowel snellere transit- als langzamere, precieze contactfasen, waardoor de vaste-snelheidsbeperkingen van bestaande modellen worden overwonnen.

Oorspronkelijke auteurs: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot hebt die heeft geleerd hoe hij een taak moet uitvoeren, zoals het stapelen van bekers of het vouwen van een handdoek, door een mens één keer te zien doen. Het probleem is dat deze robot vastzit in een "één-snelheidswereld". Als de menselijke demonstratie traag was, beweegt de robot voor altijd langzaam. Als de menselijke demonstratie snel was, raast de robot voor altijd rond. De robot kan niet besluiten om te vertragen voor een delicaat deel van de klus of op te versnellen wanneer hij gewoon door een lege ruimte beweegt.

TempoVLA is een nieuw systeem dat een robot een "volumeknop" geeft voor zijn snelheid. Het stelt een enkele robot hersenen in staat om exact dezelfde taak uit te voeren op 0,5x snelheid (superlangzaam en voorzichtig), 1x snelheid (normaal), of 2x snelheid (supersnel), op commando.

Hier is hoe ze het hebben gedaan, onderverdeeld in twee eenvoudige delen:

1. De "Video Editor" (De datakant)

Voordat de robot werd onderwezen, moesten de onderzoekers de trainingsvideo's repareren. Ze creëerden een slimme tool genaamd VSTA (Variable-Speed Trajectory Augmentation).

Beschouw een robotdemonstratie als een film.

  • Om het sneller te maken: De editor neemt een reeks opeenvolgende frames en voegt deze samen tot één grote sprong. Het is alsof je de saaie stukken uit een film knipt om direct bij de actie te komen.
  • Om het langzamer te maken: De editor neemt één grote beweging en splitst deze op in veel kleine, langzame stappen. Het is alsof je een "slow-motion" effect toevoegt aan een specifieke scène.

Cruciaal is dat deze montage de inhoud van wat de robot doet (de semantiek) niet verandert, alleen hoe snel hij het doet. Ze namen één originele demonstratie en maakten daar een bibliotheek van, met dezelfde taak uitgevoerd op zes verschillende snelheden.

2. De "Snelheidsregelaar" (De modelkant)

Zodra de robot deze bibliotheek van snelle en langzame voorbeelden heeft, leren ze de robot een nieuwe truc. Ze geven de robot een eenvoudige "snelheidsregelaar" (een getal zoals 0, de 0,5, 1,0 of 1,5) die de robot kan zien terwijl hij werkt.

  • Als je tegen de robot zegt: "Doe dit op 1,5x snelheid", kijkt de robot naar zijn trainingsdata, ziet de snelle voorbeelden en voorspelt grotere, dunnere bewegingen.
  • Als je zegt: "Doe dit op 0,5x snelheid", kijkt hij naar de langzame voorbeelden en voorspelt hij kleine, voorzichtige bewegingen.

De robot hoeft niet vanaf nul opnieuw getraind te worden voor elke nieuwe snelheid. Hij leert simpelweg te luisteren naar de "snelheidsregelaar" en past daar zijn spierbewegingen naar aan te passen.

De "Smart Pilot" Bonus

Het paper laat ook zien dat je deze robot kunt koppelen aan een "Smart Pilot" (een groot AI-taalmodel). In plaats van dat jij handmatig "langzamer" typt, kijkt de Smart Pilot naar de camerabeelden van de robot.

  • Scenario: De robot reikt over een lege tafel.
    • Smart Pilot: "Vrij pad! Ga snel!" (De robot versnelt).
  • Scenario: De robot staat op het punt een kwetsbare beker te pakken.
    • Smart Pilot: "Gevaarzone! Vertraag!" (De robot vertraagt tot een kruipje).

Dit creëert een robot die van nature versnelt wanneer het veilig is en vertraagt wanneer precisie nodig is, zonder menselijke tussenkomst.

Wat ze vonden

  • Flexibiliteit: De robot kan naadloos tussen snelheden schakelen tijdens de uitvoering.
  • Betere Prestaties: Verrassend genoeg maakte het trainen van de robot op deze gemengde snelheden hem zelfs beter in de normale snelheid (1x) dan robots die alleen op normale snelheid zijn getraind. Het lijkt erop dat leren bewegen op verschillende snelheden de robot helpt de taak beter te begrijpen.
  • Limieten: Er is een fysieke limiet. Als je de robot vraagt om te snel te gaan (zoals 4x snelheid), kunnen de fysieke motoren en controllers van de robot de instructies van de hersenen niet bijhouden, en begint hij zijn doel te missen. Maar binnen een redelijke marge (0,5x tot 1,5x) werkt het perfect.

Kortom, TempoVLA verandert een rigide, een-snelheid-robot in een flexibele werker die zijn eigen tempo kan kiezen, wat de robot veiliger maakt voor delicate taken en sneller voor routinematige taken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →