← Neueste Arbeiten
🤖 machine learning

Sound-based Multi-Person 3D Pose Estimation

Dieses Paper stellt SoundMHPE vor, das erste Framework zur Schätzung von 3D-Posen mehrerer Personen ausschließlich aus akustischen Signalen durch die Nutzung einer neuartigen Encoder-Decoder-Architektur zur Überwindung von Herausforderungen wie Signalüberlagerung und Reflexionen, validiert an einem neu erstellten, 6-stündigen synchronisierten Datensatz.

Ursprüngliche Autoren: Yusuke Oumi, Yuto Shibata, Go Irie, Akisato Kimura, Yoshimitsu Aoki, Mariko Isogawa

Veröffentlicht 2026-09-07
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yusuke Oumi, Yuto Shibata, Go Irie, Akisato Kimura, Yoshimitsu Aoki, Mariko Isogawa

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Seit Jahrzehnten suchen Wissenschaftler nach Wegen, das Unsichtbare sichtbar zu machen, und entwickeln Technologien, die die menschliche Bewegung verfolgen können, ohne auf das menschliche Auge angewiesen zu sein. Kameras, die auf Licht angewiesen sind, versagen in der Dunkelheit oder wenn eine Person hinter einer Wand verborgen ist. Radiowellen, die in einigen Sensorsystemen verwendet werden, haben Schwierigkeiten, wenn sie auf Wasser oder Metall treffen. In diesen komplexen, realen Szenarien hat sich ein anderer Typ von Signal als vielversprechende Alternative herauskristallisiert: Schall. Indem man aktiv einen Schallimpuls aussendet und aufmerksam zuhört, wie dieser zurückgeworfen wird, können Forscher die Form und Position von Objekten in einem Raum erfassen. Diese Technik, bekannt als aktive akustische Sensorik, hat bereits gezeigt, dass sie in der Lage ist, die Körperhaltung einer einzelnen Person zu bestimmen, selbst wenn diese verdeckt ist. Dennoch blieb eine bedeutende Lücke in diesem Bereich. Während eine einzelne Stimme oder Bewegung ein deutliches Echo erzeugt, schafft ein Raum voller Menschen ein chaotisches Gemisch aus überlappenden Geräuschen. Das Entwirren dieser Signale, um zu verstehen, wo jeder Einzelne steht und wie er sich bewegt, galt als nahezu unmöglich, da die Echos einer Person mit denen einer anderen ununterscheidbar verschmelzen.

Ein Team von Forschern der Keio-Universität, der Tokyo University of Science und NTT hat nun den ersten Schritt zur Lösung dieses Problems unternommen. Sie haben ein System entwickelt, das in der Lage ist, die dreidimensionalen Posen mehrerer Personen allein mithilfe von Schall zu schätzen. Die Forscher erstellten einen maßgeschneiderten Datensatz, um ihr System zu trainieren, indem sie sechs Stunden synchronisierter Audio- und Bewegungsdaten von bis zu drei gleichzeitig in einem Raum agierenden Personen aufzeichneten. Der Aufbau bestand aus einem Paar Lautsprechern, die ein spezifisches Schallsignal aussendeten, und einem spezialisierten Mikrofon, das in der Lage war, Schall aus alle Richtungen zu erfassen. Während die Teilnehmer gingen, sich drehten und die Arme hoben, zeichnete das System die zurückkehrenden Echos auf. Die Herausforderung war immens; die akustischen Signale waren eine Superposition vieler verschiedener Bewegungen, was zusätzlich durch die Art und Weise kompliziert wurde, wie Schall von Körpern und Wänden reflektiert wird und dadurch Verzögerungen erzeugt, die die direkte Verbindung zwischen einer spezifischen Pose und einer spezifischen Schalländerung verschleiern.

Um diese Komplexität zu bewältigen, entwickelte das Team ein neues Framework namens SoundMHPE. Anstatt zu versuchen, den Schall als einen einzigen, chaotischen Block zu verarbeiten, zerlegt ihr System das Audio in mehrere Detail-Ebenen. Es analysiert den Schall unter Verwendung verschiedener Zeitfenster und betrachtet sowohl schnelle Veränderungen, die in einem Bruchteil einer Sekunde stattfinden, als auch langsamere, feinere Details in der Frequenz des Schalls. Dies ermöglicht es dem System, subtile akustische Signaturen zu isolenieren, die sonst im Rauschen verloren gehen könnten. Sobön der Schall analysiert wurde, nutzt das System eine ausgeklügelte Methode, um die Personen zu trennen. Es weist jeder Person einen spezifischen Satz digitaler „Abfragen“ (Queries) zu, was der Software ermöglicht, die zeitliche Entwicklung der Bewegungen einer Person zu verfolgen und gleichzeitig zu verstehen, wie diese mit den anderen Personen im Raum interagiert. Dieser Ansatz entwirrt die überlappenden Informationen und ermöglicht es dem System, die Pose jeder Person Bild für Bild zu rekonstruieren.

Die Ergebnisse dieser Arbeit belegen, dass das System funktioniert. In Tests gegen bestehende Methoden, die ursprünglich für das Tracking einzelner Personen entwickelt oder aus der Radiofrequenz-Sensorik adaptiert wurden, erwies sich das neue schallbasierte System als genauer. Es verfolgte erfolgreich komplexe Bewegungen, wie etwa das Drehen des Körpers oder das Heben beider Arme, selbst wenn diese neben anderen sich bewegenden Personen ausgeführt wurden. In Tests mit zwei und drei Personen behielt das System eine hohe Präzision bei und übertraf die Baseline-Modelle bei der Messung des Abstands zwischen vorhergesagten und tatsächlichen Gelenkpositionen. Die Forscher fanden auch heraus, dass ihre Methode an ungesehene Umgebungen angepasst werden kann; als sie Trennwände im Raum platzierten, um die Schallreflexion zu verändern, war das System dennoch in der Lage, grobe Posen zu schätzen, was darauf hindeutet, dass es unterschiedliche akustische Bedingungen bewältigen kann. Darüber hinaus zeigte sich, dass die zugrunde liegende Logik ihres Systems selbst bei der Anwendung auf Radiofrequenzdaten effektiv war, was darauf hindeutet, dass der Ansatz über verschiedene Arten von Signalen hinweg robust ist.

Diese Forschung stellt eine bedeutende Erweiterung dessen dar, was mit akustischer Sensorik möglich ist. Indem das Team von Ein-Personen-Szenarien zu Multi-Personen-Umgebungen überging, hat es die Tür für Anwendungen in überfüllten Räumen, bei der Katastrophenhilfe und in der Sportanalyse geöffnet, wo Kameras nicht eingesetzt werden können und Radiosignale blockiert werden könnten. Obwohl sich die Technologie noch in einem frühen Stadium befindet und weitere Entwicklungen erfordert, um in der realen Welt eingesetzt zu werden, bildet die Erstellung dieses neuen Datensatzes und die Validierung der Multi-Personen-Schätzung eine entscheidende Grundlage. Die Arbeit bestätigt, dass Schall, wenn er mit den richtigen Werkzeugen analysiert wird, die verborgene Geometrie einer Gruppe von Menschen offenbaren kann, indem er ein chaotisches Gemisch aus Echos in ein klares Bild menschlicher Bewegung verwandelt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →