VisualClaw: A Real-Time, Personalized Agent for the Physical World
VisualClaw is een zelfevoluerende, realtime multimodale agent die hybride codering gebruikt om API-kosten en latentie drastisch te verminderen terwijl deze continu leert van fouten om de nauwkeurigheid te verbeteren, gevalideerd over standaard video-QA-benchmarks en een nieuwe agentic workspace-benchmark genaamd VisualClawArena.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente assistent hebt (een AI) die video's kan bekijken, documenten kan lezen en computerhulpmiddelen kan gebruiken om problemen voor je op te lossen. Het paper introduceert een nieuwe versie van deze assistent genaamd VisualClaw.
Het hoofddoel dat de auteurs oplossen, is dat huidige AI-assistenten lijken op overijverige toeristen: ze proberen elke seconde van een video te bekijken, elk woord van een handleiding te lezen en de "hersenen" (het AI-model) om hulp te vragen bij elk klein detail. Dit is ongelooflijk duur, traag en verwart de AI vaak omdat er te veel informatie is.
VisualClaw lost dit op door te fungeren als een slimme, ervaren gids die precies weet waar hij op moet letten en hoe hij slimmer kan worden na verloop van tijd. Hier is hoe het werkt, onderverdeeld in drie eenvoudige delen:
1. De "Slimme Filter" (Besparen van geld en tijd)
Stel je voor dat je een video van 30 minuten bekijkt van een persoon die door een bos wandelt.
- De Oude Manier: De AI probeert elk frame (elk fractie van een seconde aan beeld) te analyseren. Het is alsof je een mens vraagt om elk blaadje aan elke boom te beschrijven, zelfs wanneer de camera niet beweegt. Dit kost een fortuin aan rekenkracht.
- De VisualClaw-manier: VisualClaw heeft een "slimme filter" die op je apparaat draait (zoals je bril of telefoon) voordat de video de cloud bereikt. Het werkt als een beveiliger bij een museum.
- Als de camera slechts lichtjes schudt of de scène saai is (statisch), zegt de bewaker: "Sla dit over, hier gebeurt niets nieuws."
- Als de camera een hoek om gaat of er iets belangrijks gebeurt, zegt de bewaker: "Stop! Dit is een cruciaal moment. Stuur dit frame naar de baas."
- Resultaat: In plaats van 1.800 frames te sturen voor een video van 30 minuten, stuurt het er misschien slechts 5 of 6. Dit verlaagt de kosten met 98% en maakt het systeem snel genoeg om te draaien op real-time apparaten zoals AI-brillen.
2. De "Levende Handleiding" (Slimmer worden zonder te herbedraden)
De meeste AI-modellen zijn als bevroren standbeelden: zodra ze zijn gebouwd, kunnen ze niet leren van hun fouten zonder volledig te worden herbouwd (wat moeilijk en duur is).
- De Oude Manier: Als een AI een taak niet volbrengt, faalt het gewoon. De volgende keer probeert het weer hetzelfde en faalt het opnieuw.
- De VisualClaw-manier: VisualClaw houdt een levende handleiding bij (een "Skill Bank").
- Wanneer de AI een fout maakt, kijkt een aparte "coach" (een offline evolver) naar wat er misging.
- De coach schrijft een nieuwe regel of tip in de handleiding (bijv. "Controleer bij het vasthouden van een touw altijd eerst de stabiliteit").
- De volgende keer controleert de AI deze handleiding voordat hij antwoordt. Hij hoeft zijn brein niet te veranderen; hij leest gewoon een betere instructiehandleiding.
- De "Warm/Koud" Truc: Om te voorkomen dat de handleiding te zwaar wordt, laat VisualClaw de AI alleen de 5 meest relevante tips (Warm) zien op dit moment, terwijl de rest van het boek op een plank staat (Koud), voor het geval dat. Dit houdt de AI snel en gefocust.
3. De "Oefenarena" (Testen in de echte wereld)
De auteurs realiseerden zich dat standaardtests voor deze AI's lijken op meerkeuzevragen waarbij je alleen een antwoord kiest. Maar in de echte wereld moet een AI daadwerkelijk dingen doen: bestanden openen, documenten bewerken en controleren of zijn werk correct is.
- Om dit op te lossen, hebben ze een nieuwe test gebouwd genaamd VisualClawArena.
- Zie dit als een level in een videogame waar de AI het volgende moet doen:
- Een videoclip bekijken.
- Een chatlog of document lezen.
- Een bestand op een computer openen.
- Een fout herstellen of een rapport schrijven.
- Een "check" passeren om te bewijzen dat hij de klus goed heeft uitgevoerd.
- Dit test of de AI daadwerkelijk het visuele bewijs kan gebruiken om echte problemen op te lossen, in plaats van alleen het juiste antwoord te raden.
De Resultaten: Wat is er gebeurd?
Toen ze VisualClaw testten:
- Het werd slimmer: In de meeste tests werd de AI nauwkeuriger omdat hij leerde van zijn eerdere fouten via de "Levende Handleiding."
- Het werd goedkoper: Omdat de "Slimme Filter" stopte met het sturen van nutteloze videoframes, daalde de kosten om de AI te draaien met bijna 99% voor lange video's.
- Het werkt in de echte wereld: Op de nieuwe "Arena"-test versloeg de AI die kan leren en evolueren (VisualClaw) de standaard AI met een aanzienlijke marge, wat bewijst dat deze methode helpt bij complexe, meerstaps-taken.
Kortom: VisualClaw is een AI-assistent die niet naar alles staart (bespaart geld), een notitieblok bijhoudt van de lessen die geleerd zijn van zijn fouten (wordt slimmer) en oefent in een realistische simulatie om te bewijzen dat hij complexe taken in de echte wereld aankan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.