← Nieuwste papers
🤖 machine learning

Sound-based Multi-Person 3D Pose Estimation

Dit artikel introduceert SoundMHPE, het eerste framework voor het schatten van 3D-poses van meerdere personen uitsluitend op basis van akoestische signalen door gebruik te maken van een nieuwe encoder-decoderarchitectuur om uitdagingen zoals signalsuperpositie en reflecties te overwinnen, gevalideerd op een nieuw geconstrueerde, 6 uur durende gesynchroniseerde dataset.

Oorspronkelijke auteurs: Yusuke Oumi, Yuto Shibata, Go Irie, Akisato Kimura, Yoshimitsu Aoki, Mariko Isogawa

Gepubliceerd 2026-09-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yusuke Oumi, Yuto Shibata, Go Irie, Akisato Kimura, Yoshimitsu Aoki, Mariko Isogawa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Decennialang hebben wetenschappers gezocht naar manieren om het onzichtbare te zien, waarbij ze technologieën ontwikkelden die menselijke bewegingen kunnen volgen zonder afhankelijk te zijn van het menselijk oog. Camera's, die afhankelijk zijn van licht, falen in het donker of wanneer een persoon achter een muur verborgen is. Radiogolven, die in sommige sensorsystemen worden gebruikt, hebben moeite wanneer ze water of metaal tegenkomen. In deze complexe, reële scenario's is een ander soort signaal opgekomen als een veelbelovend alternatief: geluid. Door actief een geluidspuls uit te zenden en aandachtig te luisteren naar hoe deze terugkaatst, kunnen onderzoekers de vorm en positie van objecten in een kamer in kaart brengen. Deze techniek, bekend als actieve akoestische sensing, heeft al aangetoond dat het de houding van een enkel persoon kan bepalen, zelfs wanneer deze wordt geblokkeerd. Er bleef echter een aanzienlijke kloof bestaan in dit veld. Terwijl een enkele stem of beweging een duidelijk echo creëert, produceert een kamer gevuld met meerdere mensen een chaotische mix van overlappende geluiden. Het ontwarren van deze signalen om te begrijpen waar elke persoon staat en hoe zij bewegen, werd als bijna onmogelijk beschouwd, omdat de echo's van de één ononderscheidbaar samensmelten met die van de ander.

Een team van onderzoekers van de Keio Universiteit, de Tokyo University of Science en NTT heeft nu de eerste stap gezet naar het oplossen van dit probleem. Ze hebben een systeem ontwikkeld dat in staat is om de driedimensionale poses van meerdere mensen te schatten met behulp van alleen geluid. De onderzoekers bouwden een aangepaste dataset om hun systeem te trainen, waarbij ze zes uur aan gesynchroniseerde audio- en bewegingsgegevens opnamen van maximaal drie mensen die tegelijkertijd in een kamer bewogen. De opstelling bestond uit een paar luidsprekers die een specifiek geluidssignaal uitzonden en een gespecialiseerde microfoon die in staat was om geluid uit alle richtingen op te vangen. Terwijl de deelnemers liepen, draaiden en hun armen omhoog brachten, registreerde het systeem de terugkerende echo's. De uitdaging was immens; de akoestische signalen waren een superpositie van vele verschillende bewegingen, wat verder werd gecompliceerd door de manier waarop geluid weerkaatst tegen lichamen en muren, wat vertragingen creëert die de directe link tussen een specifieke pose en een specifiek geluid vertroebelen.

Om deze complexiteit te navigeren, creëerde het team een nieuw framework dat ze SoundMHPE noemen. In plaats van te proberen het geluid als één enkele, rommelige blok te verwerken, breekt hun systeem het audiofragment af in meerdere lagen van detail. Het analyseert het geluid met behulp van verschillende tijdsvensters, waarbij het kijkt naar zowel snelle veranderingen die in een fractie van een seconde plaatsvinden als naar langzamere, fijnere details in de frequentie van het geluid. Dit stelt het systeem in staat om subtiele akoestische handtekeningen te isoleren die anders verloren zouden gaan in de ruis. Zodra het geluid is geanalyseerd, gebruikt het systeem een geavanceerde methode om de mensen te scheiden. Het wijst een specifieke set digitale "queries" toe aan elk individu, waardoor de software de temporele evolutie van de bewegingen van één persoon kan volgen, terwijl het tegelijkertijd begrijpt hoe zij interageren met de anderen in de kamer. Deze aanpak ontwarrelt de overlappende informatie, waardoor het systeem in staat is de pose van elke persoon frame voor frame te reconstrueren.

De resultaten van dit werk laten zien dat het systeem werkt. Wanneer het werd getest tegen bestaande methoden die oorspronkelijk waren ontworpen voor tracking van één persoon of werden aangepast van radiogolf-sensing, bleek het nieuwe op geluid gebaseerde systeem nauwkeuriger. Het volgde succesvol complexe bewegingen, zoals een persoon die zijn lichaam draait of beide armen opsteekt, zelfs wanneer dit werd uitgevoerd naast andere bewegende individuen. In tests met twee en drie personen behield het systeem een hoog niveau van precisie, waarbij het de baseline-modellen overtrof in het meten van de afstand tussen voorspelde en werkelijke gewrichtsposities. De onderzoekers ontdekten ook dat hun methode kon adapteren aan onbekende omgevingen; wanneer ze tussenwanden in de kamer plaatsten om de manier waarop geluid reflecteert te veranderen, slaagde het systeem er nog steeds in om grove poses te schatten, wat suggereert dat het verschillende akoestische omstandigheden kan hanteren. Bovendien bleek de onderliggende logica van hun systeem zelfs effectief te zijn wanneer deze werd toegepast op radiofrequentiegegevens, wat aangeeft dat de aanpak robuust is over verschillende soorten signalen.

Dit onderzoek markeert een significante uitbreiding van wat mogelijk is met akoestische sensing. Door te bewegen van scenario's met één persoon naar omgevingen met meerdere personen, heeft het team de deur geopend voor toepassingen in drukke ruimtes, rampenbestrijding en sportanalyse waar camera's niet kunnen worden gebruikt en radiosignalen mogelijk geblokkeerd worden. Hoewel de technologie zich nog in een vroeg stadium bevindt en verdere ontwikkeling vereist om in de echte wereld te worden ingezet, vormt de constructie van deze nieuwe dataset en de validatie van de methode voor multi-persoon schatting een cruciaal fundament. Het werk bevestigt dat geluid, wanneer geanalyseerd met de juiste instrumenten, de verborgen geometrie van een groep mensen kan onthullen, waardoor een chaotische mix van echo's wordt omgezet in een helder beeld van menselijke beweging.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →