← Nieuwste papers
🤖 AI

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

Dit artikel presenteert een datacentrische aanpak die gebruikmaakt van multimodale egocentrische en exocentrische video en narratie om gestructureerde taakkennis te extraheren uit expertdemonstraties, wat effectieve procedurele documentatie en contextbewuste begeleiding mogelijk maakt voor assemblage- en demontagebewerkingen.

Oorspronkelijke auteurs: Vivek Chavan, Jörg Krüger

Gepubliceerd 2026-08-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vivek Chavan, Jörg Krüger

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het stille gezoem van een fabriekshal werkt een bekwame technicus aan een complexe machine. Ze weet precies welke schroef ze eerst moet losdraaien, hoe ze een verwarde kabel moet geleiden zonder deze te beschadigen, en wat te doen wanneer een onderdeel ontbreekt of versleten is. Deze kennis leeft in hun handen en hun geest, opgebouwd door jarenl eyes oefening. Decennialang hebben ingenieurs geprobeerd robots dit werk te leren, maar machines worstelen met de rommelige, onvoorspelbare realiteit van het uit elkaar halen van zaken. In tegenstelling tot het bouwen van een product vanaf nul, waarbij elk stukje in een perfect plan past, betekent het uit elkaar halen van een oud apparaat vaak het omgaan met roest, gebroken clips en onderdelen die in de loop der tijd zijn verschoven. Traditionele automatisering, die steunt op rigide, vooraf geprogrammeerde bewegingen, faalt vaak wanneer de wereld het script niet volgt. Om dit op te lossen, richten onderzoekers zich op een ander soort intelligentie: systemen die kunnen leren door te kijken en te luisteren naar menselijke experts, waarbij ze niet alleen vastleggen wat ze doen, maar ook waarom ze het doen.

Een team onderzoekers van het Fraunhofer Instituut en de Technische Universiteit van Berlijn heeft een nieuwe manier ontwikkeld om deze deskundige kennis vast te leggen en om te zetten in een gids voor werkers. Hun aanpak richt zich op de moeilijke taak van het demonteren van afgedankte elektrische en elektronische apparatuur, zoals oude computers. In plaats van te proberen een robot zelfstandig elke stap te laten uitzoeken, legt het systeem een menselijke expert vast die de taak uitvoert terwijl hij een slimme bril draagt en zijn gedachten hardop uitspreekt. De opstelling maakt gebruik van twee camera's: één gemonteerd op de bril van de expert om precies te zien wat hij ziet, en een stationaire camera in de ruimte om de hele werkplek te tonen. Terwijl de expert werkt, beschrijft hij zijn acties, legt hij zijn redenering uit en wijst hij op potentiële fouten. Dit creëert een rijk verslag dat combineert wat het oog ziet met wat de stem verklaart.

De onderzoekers gebruiken vervolgens geavanceerde computerprogramma's om deze opname om te zetten in een gestructureerde kaart van de taak. Eerst transcribeert het systeem de gesproken woorden naar tekst, waarbij elke zin wordt gekoppeld aan het exacte moment waarop deze werd uitgesproken. Een krachtig taalmodel leest vervolgens dit transcript om de logica van de klus te begrijpen. Het bepaalt welke stappen vóór andere moeten gebeuren, welke stappen in een willekeurige volgorde kunnen worden uitgevoerd en welke onderdelen onafhankelijk zijn. Het resultaat is een visueel stroomdiagram, of een precedentie-grafiek, die de juiste volgorde van handelingen laat zien. Deze kaart is niet slechts een lijst met instructies; het begrijpt de relaties tussen de stappen. Het weet bijvoorbeeld dat een afdekplaat verwijderd moet worden voordat een specifieke schroef bereikbaar is, maar dat twee verschillende interne componenten in willekeurige volgorde kunnen worden verwijderd.

Zodra deze kaart is gemaakt en door een mens is gecontroleerd om te waarborgen dat deze correct is, leert het systeem de handelingen in de video te herkennen. Het breekt de opname op in kleine fragmenten, die elk zijn gelabeld met de specifieke stap die wordt uitgevoerd. Hierdoor kan de computer de visuele details van het werk begrijpen, zoals hoe een hand een gereedschap vasthoudt of hoe een onderdeel wordt uitgetrokken. Het systeem is vervolgens klaar om een werker in realtime bij te staan. Terwijl een werker de taak uitvoert, bekijkt het systeem de videofeed, herkent wat hij doet en controleert de voortgang aan de hand van de kaart. Als de werker op de goede weg is, blijft het systeem stil. Als de werker aarzelt of een fout maakt, kan het systeem de volgende geldige stap voorstellen of een kort videoclipje tonen van de expert die precies die handeling correct uitvoert.

Het team testte deze methode op de demontage van een workstation computer, een taak die veel interagerende onderdelen en gereedschappen omvat. Ze ontdekten dat het systeem erin slaagde de logische structuur van de klus te extraheren uit slechts één demonstratie van een expert. Wanneer ze opnames van vier verschillende experts gebruikten, werd het systeem nog betrouwbaarder, beter in het herkennen van handelingen en het suggereren van de juiste volgende stappen. In hun tests identificeerde het systeem de volgorde van stappen en de afhankelijkheden tussen hen met hoge nauwkeurigheid. Het was in staat om een werker door het proces te leiden door advies te geven dat paste bij de huidige situatie. De resultaten lieten zien dat het systeem zelfs met één voorbeeld een nuttige gids kon maken, en dat het toevoegen van meer voorbeelden het robuust genoeg maakte om variaties in de uitvoering door verschillende mensen aan te kunnen.

Dit werk suggereert een pad vooruit voor industrieën die complexe producten moeten repareren, recyclen of uit elkaar halen. Door de impliciete kennis van bekwame werkers vast te leggen en om te zetten in een digitale gids, kunnen fabrieken minder ervaren werkers ondersteunen zonder elke individuele robotbeweging te hoeven programmeren. Het systeem vervangt de mens niet; in plaats daarvan fungeert het als een deskundige partner die meekijkt, begrijpt en hulp biedt wanneer dat nodig is. De onderzoekers geloven dat deze aanpak kan worden uitgebreid om robots te helpen deze taken zelf te leren, waardoor machines lange sequenties van handelingen kunnen plannen op basis van menselijke demonstraties. Voor nu ligt de focus op het helpen van menselijke werkers bij het navigeren door de complexiteit van de moderne productie, om ervoor te zorgen dat waardevolle vaardigheden niet verloren gaan, maar in plaats daarvan worden gedeeld en bewaard voor de toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →