← Neueste Arbeiten
🤖 machine learning

Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates

Human-JEPA ist ein menschenzentriertes Vision-Modell, das mittels verankerter Vorhersage auf Videos trainiert wurde und gleichzeitig sowohl eine hochmoderne statische Wahrnehmung als auch zukünftige Antizipation mit signifikant weniger Parametern als bestehende Spezialisten erreicht, wodurch frühere Einschränkungen im Bewegungsverständnis und beim Modellkollaps überwunden werden.

Ursprüngliche Autoren: Hui Wei, Licai Sun, Guoying Zhao

Veröffentlicht 2026-08-24
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hui Wei, Licai Sun, Guoying Zhao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das menschliche Sehvermögen ist ein Dual-Engine-System. Es zeichnet nicht bloß auf, was gerade geschieht; es führt ständig eine Simulation dessen aus, was als Nächstes passieren wird. Wenn Sie beobachten, wie jemand nach einem Becher greift, identifiziert Ihr Gehirn gleichzeitig die Person, verfolgt ihre Körperhaltung und sagt exakt voraus, wo ihre Hand landen wird, noch bevor sie dort ankommt. Jahrzehntelang hat die künstliche Intelligenz darum gestruggelt, die zweite Hälfte dieser Gleichung zu replizieren. Während Maschinen exzellent darin geworden sind, ein einzelnes Foto zu analysieren – das Gesicht einer Person, ihre Kleidung oder ihre Pose zu identifizieren –, blieben sie weitgehend blind für den Fluss der Zeit. Sie können ein Standbild mit großer Detailgenauigkeit beschreiben, aber sie können die zukünftige Bewegung innerhalb eines Videos nicht antizipieren. Diese Lücke hat einen signifikanten Teil des menschlichen Verständnisses für Computer unerreichbar gemacht, was ihre Fähigkeit einschränkt, auf eine Weise mit der Welt zu interagieren, die sich natürlich oder sicher anfühlt.

Eine neue Studie stellt ein System namens Human-JEPA vor, das darauf ausgelegt ist, diese Kluft zu überbrücken. Die Forscher entwickelten ein Modell, das lernt, die Gegenwart wahrzunehmen und die Zukunft gleichzeitig zu antizipieren, und zwar ausschließlich unter Verwendung von Videomaterial ohne menschliche Labels oder manuelle Annotationen. Der Kern ihrer Entdeckung liegt darin, wie sie das System trainiert haben. Frühere Versuche, Maschinen menschliche Bewegungen beizubringen, scheiterten oft, weil der Lernprozess selbst fehlerhaft war. Wenn das System versuchte, aus Videos zu lernen, verlor es im Stillen die Fähigkeit, die Details des menschlichen Körpers zu verstehen, wie etwa die Form einer Gliedmaße oder die Textur der Kleidung, während es sich zu sehr auf das Kopieren statischer Muster konzentrierte. Die Forscher fanden heraus, dass sie den Zusammenbruch verhindern konnten, indem sie die Erinnerung des Systems an die menschliche Form an einen festen Startpunkt koppelten und es zwangen, die Zukunft vorherzusagen, anstatt nur fehlende Teile der Vergangenheit zu ergänzen. Das Ergebnis ist ein Modell, das signifikant kleiner ist als die bisherigen Spitzenreiter auf diesem Gebiet, aber dennoch besser darin ist, menschliche Bewegungen zu verfolgen und Individuen zu identifizieren, während es gleichzeitig die Fähigkeit beibehält, zu erraten, was als Nächstes passiert.

Die Herausforderung für das Team bestand darin, dass bestehende leistungsstarke Modelle auf statischen Bildern trainiert wurden. Diese Modelle sind hervorragend darin, ein Foto zu lesen, aber sie verstehen keine Bewegung. Um ein System zu schaffen, das Menschen in Bewegung versteht, begannen die Forscher mit einem videobasierten Modell, das bereits allgemeine Muster aus dem Internet gelernt hatte. Sie spezialisierten es dann darauf, sich auf Menschen zu konzentrieren. Doch das bloße Zeigen von mehr Videos mit Menschen funktionierte nicht. Das System begann zu degradieren und verlor die Fähigkeit, feine Details wie Körperteile oder Kleidung zu erkennen – ein Versagen, das so subtil war, dass der Trainingsprozess nicht einmal ein Fehlersignal ausgab. Das Modell vergaß im Grunde, wie ein Mensch aussieht, während es versuchte zu lernen, wie er sich bewegt.

Um dies zu lösen, führten die Forscher eine Methode ein, die sie „Anchored Forecasting“ (verankerte Vorhersage) nennen. Stellen Sie sich einen Studenten vor, der versucht, eine neue Fertigkeit zu erlernen, während ihm gesagt wird, er solle die Grundlagen vergessen, die er bereits kennt; der Student würde wahrscheinlich verwirrt werden und sein Fundament verlieren. Die Forscher verhinderten dies, indem sie das Verständnis des Systems für die menschliche Form an eine eingefrorene, unveränderliche Kopie seines ursprünglichen Wissens „pinnten“. Dieser Anker stellte sicher, dass das Modell, während es lernte, zukünftige Bewegungen vorherzusagen, nicht seine Fähigkeit verlor, die Gegenwart zu erkennen. Zusätzlich fügten sie einen Strom von Trainingsdaten mittels Standbildern von Menschen hinzu, was dem System half, ein scharfes Verständnis des menschlichen Erscheinungsbildes zu bewahren. Diese Kombination ermöglichte es dem Modell, seine detaillierte Wahrnehmung des menschlichen Körpers beizubehalten und gleichzeitig die Bewegung zu antizipieren.

Die zweite große Änderung betraf die Art und Weise, wie das System während des Trainings getestet wurde. Standardmethoden fordern das Modell oft dazu auf, fehlende Blöcke eines Videos zu ergänzen, was es dazu ermutigt, einfach das zu kopieren, was es in der Nähe in Zeit und Raum sieht. Dies ist eine Abkürzung, die verhindert, dass das Modell wirklich lernt, wie eine Szene sich entwickelt. Die Forscher ersetzten dies durch eine reine Past-to-Future-Split-Methode (Vergangenheit-zu-Zukunft-Trennung). Dem Modell wurde die erste Hälfte eines Videoclips gezeigt, und es wurde aufgefordert, die zweite Hälfte vorherzusagen. Da die Zukunft vollständig verborgen war, war der einzige Weg zum Erfolg der Aufbau eines echten Modells dafür, wie sich die Szene im Laufe der Zeit verändert. Dies zwang das System, die Dynamik menschlicher Bewegungen zu lernen, anstatt nur statische Muster auswendig zu lernen.

Die Ergebnisse dieses Ansatzes waren beeindruckend. Als das Modell auf eingefrorenen Checkpoints getestet wurde – das heißt, das System durfte während des Tests nicht weiter lernen –, übertraf das neue Modell die größten und spezialisiertesten Modelle der menschlichen Vision, obwohl es 2,7-mal weniger Parameter besaß. Es erreichte eine höhere Genauigkeit beim Verfolgen menschlicher Posen und beim Identifizieren von Personen in einer Menge. Beispielsweise verbesserte es bei einem Standardtest zur Re-Identifizierung von Personen seinen Score um 2,7 Punkte gegenüber seiner eigenen Basisversion und übertraf den führenden bildbasierten Spezialisten. Vielleicht am wichtigsten ist, dass die Fähigkeit des Modells, die Zukunft zu antizipieren, durch diese Änderungen nicht beeinträchtigt wurde. Tatsächlich war der Predictor-Head des Systems der erste, der die Antizipation verbesserte, ohne seine anderen Fähigkeiten zu schädigen.

Die Studie testete auch rigoros, was nicht funktionierte, und schloss mehrere intuitive Ideen aus. Die Forscher versuchten, die Person selbst als die Einheit der Vorhersage zu nehmen, indem sie ganze Menschen maskierten, um zu sehen, ob das Modell deren Interaktionen mit Partnern lernen könnte. Dieser Ansatz scheiterte vollständig und brachte die Fähigkeit des Modells zusammen, Interaktionen zu verstehen, zum Kollaps. Sie fanden auch heraus, dass das bloße Hinzufügen von mehr Daten oder die Erhöhung der Modellgröße die grundlegenden Probleme, die durch die Trainingsmethode verursacht wurden, nicht behob. Das Scheitern lag nicht an einem Mangel an Daten oder Rechenleistung, sondern an einem fundamentalen Fehler in der Strukturierung des Lernziels. Die Studie kommt zu dem Schluss, dass der Schlüssel zum Verständnis von Menschen in der Zeit nicht nur darin besteht, sie zu beobachten, sondern das System in der Wahrnehmung ihrer Form zu verankern, während man es zwingt, ihre Zukunft vorherzusagen.

Diese Arbeit etabliert eine neue Richtung für die künstliche Intelligenz. Sie demonstriert, dass ein einzelnes Modell erfolgreich sowohl die statische Wahrnehmung der Gegenwart als auch die dynamische Antizipation der Zukunft bewältigen kann – zwei Aufgaben, von denen man zuvor annahm, dass sie getrennte Ansätze erfordern würden. Indem sie den stillen Zusammenbruch der detaillierten Wahrnehmung verhinderten und die Abkürzungen entfernten, die echtes Lernen behindern, haben die Forscher ein System geschaffen, das Menschen so sieht, wie sie sind: Wesenheiten, die in der Zeit existieren, sich bewegen und sich verändern. Die Ergebnisse legen nahe, dass Maschinen, um Menschen wirklich zu verstehen, lernen müssen, nach vorne zu blicken, nicht nur zurück.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →