RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment
Het artikel introduceert RAG-HAR+, een kostengeoptimaliseerd, retrieval-first framework voor Human Activity Recognition dat een offline agent gebruikt om dataset-specifieke kenmerken te ontwerpen en meerderheidsstemming toepast om het gebruik van LLM's te minimaliseren terwijl de competitieve prestaties over diverse benchmarks worden behouden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je lichaam een druk orkest is, en kleine sensoren op je pols of kleding zijn de dirigenten die constant luisteren naar het ritme van je stappen, het zwaaien van je armen en de hartslag van je hart. Dit vakgebied, gena de Human Activity Recognition (HAR), is hoe computers leren het verschil te zien tussen wanneer je jogt, slaapt of typt. Lange tijd was de beste manier om computers dit te leren hen enorme bibliotheken met gelabelde voorbeelden te laten memoriseren, zoals een student die voor een examen leert door elk boek in de bibliotheek te lezen. Maar dit is duur, traag en gaat kapot als je de sensor of de activiteit verandert. Onlangs kwam er een nieuw idee naar voren: in plaats van te memoriseren, waarom laten we de computer niet "opzoeken" wat vergelijkbare voorbeelden uit het verleden in een gigantische database, en vragen we een superintelligente AI (een Large Language Model, of LLM) om te helpen begrijpen wat er aan de hand is? Het is alsof je een geniale bibliothecaris hebt die direct de meest vergelijkbare verhalen kan vinden om je te helpen een mysterie op te lossen. Maar zelfs deze nieuwe methode heeft een struikelblok: de geniale bibliothecaris om hulp vragen bij elke stap die je zet, is traag, kost veel geld en vereist een constante internetverbinding.
Dit artikel introduceert een slimme upgrade genaamd RAG-HAR+ die dit probleem oplost door te veranderen wanneer en hoe we om hulp vragen. De auteurs ontdekten dat de vorige methode was alsof je voor elke vraag een consultant inhuurt, zelfs voor de makkelijke vragen. RAG-HAR+ werkt meer als een slim detectiebureau. Eerst gebruikt het de AI offline (voordat je zelfs maar begint met bewegen) om een beter "archiveringssysteem" voor de database te ontwerpen, waarbij de specifieke aanwijzingen kiest die het belangrijkst zijn voor jouw specifieke activiteit. Vervolgens, wanneer je beweegt, probeert het systeem het mysterie op te lossen door simpelweg te kijken naar de meest vergelijkbare voorbeelden uit het verleden in de database. Het roept pas de dure AI-consultant in actie als de aanwijzingen verwarrend zijn en de database het niet eens kan worden over een antwoord. Door dit te doen, wordt het systeem ongelooflijk snel, goedkoop en werkt het zelfs als de internetverbinding slecht is, terwijl het nog steeds net zo nauwkeurig is als de oude, tragere methoden.
Het Probleel: De "Overdreven Roepende" Detective
Stel je voor dat je een superintelligente AI-assistent hebt die alles weet over menselijke beweging. In het oorspronkelijke systeem (RAG-HAR) stopt het systeem bij elke stap die je zet, stuurt een bericht naar de AI en vraagt: "Wat ben ik aan het doen?" De AI leest het bericht, kijkt naar enkele voorbeelden uit het verleden en antwoordt. Dit werkt, maar het is alsof je een wereldberoemde detective inhuurt om elke zaak op te lossen, van "Wie heeft de koekjes gestolen?" tot "Wie heeft de butler vermoord?". Het is een verspilling van de tijd en het geld van de detective voor de diefstal van de koekjes. Bovendien, als de detective in een ander land is (de cloud), moet je wachten tot een bericht heen en weer is gereisd telkens wanneer, wat het hele proces traag maakt.
De onderzoekers realiseerden zich dat voor de meeste stappen het antwoord overduidelijk is als je maar naar de juiste voorbeelden uit het verleden kijkt. Je hebt geen genie nodig om je te vertellen dat wandelen op wandelen lijkt; je hoeft alleen maar een paar andere voorbeelden van wandelen in de database te vinden. Het probleem met het oude systeem was dat het een "one-size-fits-all" manier gebruikte om de beweging te beschrijven, waardoor het soms de subtiele aanwijzingen miste die een activiteit uniek maken.
De Oplossing: Het Slimme Archiveringssysteem en de "Ambiguïteitsoplosser"
RAG-HAR+ verandert het spel met twee belangrijke trucs.
1. De Offline "Archiveringssysteem" Ontwerper
Voordat je zelfs aan je workout begint, gebruikt het systeem de AI één keer om een op maat gemaakt archiveringssysteem voor jouw specifieke dataset te ontwerpen. Zie dit als de AI die optreedt als een bibliothecaris die jouw collectie bestudeert en besluit: "Oké, voor deze collectie boeken moet ik ze organiseren op kleur en auteur, niet op genre en aantal pagina's." De AI kijkt naar duizenden verschillende manieren om een beweging te beschrijven (zoals hoe snel het is, hoe hobbelig het is of het ritme ervan) en kiest de drie beste groepen aanwijzingen die het beste werken voor jouw specifieke sensoren en activiteiten. Dit gebeurt slechts één keer, offline, zodat het je later niet vertraagt.
2. De "Ambiguïteitsoplosser" (De Slimme Fallback)
Nu, wanneer je beweegt, roept het systeem de AI niet onmiddellijk aan. In plaats daarvan neemt het jouw huidige beweging, vertaalt deze naar die aangepaste aanwijzingen en zoekt in de database naar de top 10 meest vergelijkbare voorbeelden uit het verleden.
- De Meerderheidsstem: Als 8 van de 10 voorbeelden uit het verleden zeggen: "Je bent aan het rennen", dan zegt het systeem gewoon: "Oké, je bent aan het rennen," en gaat verder. Geen AI nodig!
- De Fallback: Als de database in de war is—bijvoorbeeld, 5 voorbeelden zeggen "rennen" en 5 zeggen "joggen"—dan roept het systeem de AI aan. Deze AI, nu de "Ambiguïteitsoplosser" genoemd, kijkt naar de verwarrende aanwijzingen en de voorbeelden uit het verleden om de uiteindelijke, slimme beslissing te nemen.
Dit betekent dat de dure AI alleen wordt opgeroepen voor de lastige, verwarrende momenten. Voor de makkelijke, overduidelijke momenten draait het systeem op eigen kracht, gebruikmakend van eenvoudige wiskunde om stemmen te tellen.
De Resultaten: Snelheid, Besparingen en Slimheid
De onderzoekers testten dit nieuwe systeem op zes verschillende datasets, variërend van mensen die wandelen en rennen tot complexe industriële assemblage-taken. De resultaten waren indrukwekkend:
- Nauwkeurigheid: Het nieuwe systeem was net zo goed, of zelfs beter, in het herkennen van activiteiten dan de oude methode. Op sommige datasets verbeterde de nauwkeurigheid aanzienlijk (bijvoorbeeld op de MHEALTH-dataset ging het van 96,91% naar 98,35% nauwkeurigheid).
- Kostenbesparing: Omdat het stopte met het aanroepen van de AI voor elk enkel monster, verminderde het de hoeveelheid data die naar de AI werd verzonden met 89,3% tot 99,9%. In één geval (MHEALTH) hoefde het de AI slechts voor één enkel monster aan te roepen van de 666!
- Snelheid: Het systeem werd veel sneller. Op de MHEALTH-dataset daalde de tijd die nodig was om een activiteit te herkennen van 18,25 seconden naar slechts 0,41 seconden. Dat is een versnelling van meer dan 44 keer! Zelfs op de langzaamste dataset was het nog steeds ongeveer 5,7 keer sneller.
Waarom dit ertoe doet voor de toekomst
Het artikel bouwde ook een werkend prototype op een echte smartphone om aan te tonen dat dit niet alleen een theorie is. Ze hebben het omgezet in een widget in een fitness-app. Toen ze het op een echte telefoon testten, was de versnelling nog spectaculairder—ongeveer 15 keer sneller—omdat de telefoon niet hoefde te wachten tot het internet met de AI communiceerde voor elke stap.
De auteurs suggereren dat deze aanpak een grote stap is naar het toegankelijk maken van slimme gezondheids- en fitnessapps die overal werken, zelfs zonder een perfecte internetverbinding, en zonder dat het een fortuin kost om te draaien. Het bewijst dat je niet de "genie" om hulp hoeft te vragen bij elk klein dingetje; soms zijn een slim archiveringssysteem en een eenvoudige stemming alles wat je nodig hebt. Het artikel concludeert dat door de rol van de AI te verschuiven van een constante online werker naar een slim ontwerper en een reserve-expert, we activiteitsherkenning goedkoper, sneller en klaar voor de echte wereld kunnen maken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.