← Neueste Arbeiten
💻 computer science

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

Das Papier stellt GigaBrain-0.7 vor, ein embodied Foundation Model, das eine neuartige Drei-System-Architektur nutzt und auf über 37.000 Stunden heterogener Daten trainiert wurde, um im Vergleich zu bisherigen State-of-the-Art-Modellen überlegene Zero-Shot-Generalisierung, Befolgung von Instruktionen und Aufgabenerfolgsraten über diverse Roboter-Embodiments hinweg zu erreichen.

Ursprüngliche Autoren: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo
Veröffentlicht 2026-08-18
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der ein Roboter einen unordentlichen Küchentisch betrachten, eine gesprochene Aufforderung wie „Leg den roten Apfel in die Schüssel“ verstehen und dann genau herausfinden kann, wie er seinen Arm bewegen muss, um dies zu tun, ohne etwas umzustoßen. Dies ist das Versprechen der verkörperten künstlichen Intelligenz (Embodied AI): Maschinen, die nicht nur Informationen verarbeiten, sondern mit der physischen Welt interagieren. Jahrelang haben Forscher versucht, Roboter zu lehren, indem sie ihnen tausende Videos von menschlichen Händen zeigten, die Objekte bewegen, in der Hoffnung, dass die Maschine die Regeln der Physik und von Ursache und Wirkung lernt. Doch ein großes Hindernis blieb bestehen. Roboter sind unterschiedlich gebaut; einer hat vielleicht zwei Arme, ein anderer einen einzelnen Greifer und ein dritter bewegt sich vielleicht auf Rädern. Daten, die von einem Typ Roboter gesammelt wurden, verwirren oft einen anderen. Zudem lehrt das bloße Zuschauen eines Videos eine Maschine nicht, wie sie vorhersehen kann, was als Nächstes passiert, wenn sie einen Fehler macht, oder wie sie sich erholt, wenn eine Aufgabe schiefgeht. Die Frage war, ob wir ein einziges, intelligentes Gehirn bauen können, das Sprache versteht, die Welt sieht und jeden Art von Roboterkörper steuert, während es gleichzeitig aus einer massiven Mischung verschiedener Erfahrungen lernt.

Ein Forschungsteam hat nun mit einem System namens GigaBrain-0.7 einen bedeutenden Fortschritt erzielt. Dies ist nicht nur ein einzelnes Programm, sondern ein koordiniertes System, das darauf ausgelegt ist, die Komplexität der Interaktion in der realen Welt zu bewältigen. Anstatt zu versuchen, einen Roboter zu zwingen, alles in einem chaotischen Schub zu lernen, organisierten die Forscher den Lernprozess in drei unterschiedlichen, aber miteinander verbundenen Teilen, die zusammenarbeiten. Der erste Teil fungiert als Hände und Reflexe, indem er die unmittelbare Kontrolle über die Motoren des Roboters übernimmt, um Aktionen auszuführen. Der zweite Teil fungiert als Planer und Beobachter, betrachtet die Szene, versteht die sprachliche Anweisung und unterteilt ein großes Ziel wie „Reinige den Tisch“ in kleinere, handhabbare Schritte wie „Hebe den Becher auf“ und „Bewege ihn zum Spülbecken“. Der dritte Teil ist die innovativste Ergänzung: Er fungiert als Prädiktor und Richter. Er stellt sich vor, wie die Szene in wenigen Sekunden aussehen wird, wenn der Roboter seinen aktuellen Pfad fortsetzt, und weist dieser Zukunft eine Punktzahl zu, um zu entscheiden, ob der Roboter Fortschritte macht oder auf ein Scheitern zusteuert.

Um dieses System zu trainieren, verließen sich die Forscher nicht auf eine einzige Datenquelle. Sie stellten eine massive Bibliothek von über 37.000 Stunden Erfahrung zusammen. Diese Sammlung beinhaltete Videos von echten Robotern, die in Fabriken und Haushalten arbeiten, Aufzeichnungen von menschlichen Händen, die Objekte aus einer Ich-Perspektive manipulieren, sowie Daten aus Computersimulationen. Sie nutzten auch künstliche Intelligenz, um neue Trainingsszenarien zu erstellen, wodurch sie die Vielfalt der Situationen, von denen der Roboter lernen konnte, effektiv erweiterten. Indem sie diese vielfältige Mischung aus Daten in das System einspeisten, ermöglichten es die Forscher dem Modell, allgemeine Prinzipien der Bewegung und Interaktion zu lernen, anstatt nur spezifische Tricks für einen ganz bestimmten Roboter auswendig zu lernen. Das System wurde darauf trainiert, 16 verschiedene Arten von Roboterkörpern zu handhaben, von zweiarmigen Maschinen bis hin zu humanoiden Figuren, was ihm lehrte, sein Verständnis von „links“ und „rechts“ oder „greifen“ und „loslassen“ basierend auf dem spezifischen Körper, den es steuerte, anzupassen.

Die Ergebnisse dieses Ansatzes wurden an echten Robotern sowohl in industriellen als als auch in häuslichen Umgebungen getestet. Wenn sie Aufgaben durchgeführt wurden, die sie noch nie zuvor gesehen hatten, zeigte das System eine bemerkenswerte Fähigkeit zur Generalisierung. In einem Test wurde ein Roboter gebeten, ein Kleidungsstück zu falten, das in einem unordentlichen Haufen geworfen worden war – eine Aufgabe, die es der Maschine erfordert, ihren Griff ständig anzupassen, während sich der Stoff verschiebt und seine Form verändert. Ohtlne für dieses spezifische Hemd neu trainiert werden zu müssen, manipulierte das System das deformierbare Objekt erfolgreich. In einem anderen Szenario wurde der Roboter gebeten, einen Löffel einer bestimmten Farbe aus einer Gruppe gemischter Utensilien aufzuheben, was demonstrierte, dass er subtile sprachliche Anweisungen verstehen und auf neue Objekte anwenden kann. Das System erwies sich auch als fähig, lange Aktionssequenzen zu bewältigen, wie etwa das Organisieren eines Schreibtisches oder das Kehren von Reis, wobei der Roboter ein Gefühl für das Gesamtziel bewahren musste, während er viele kleine Bewegungen ausführte.

Eine Schlüsselerkenntnis war, dass die Fähigkeit des Systems, die Zukunft vorherzusagen und den eigenen Fortschritt zu bewerten, einen spürbaren Unterschied bei den Erfolgsraten machte. Als die Forscher den prädiktiven Teil des Systems entfernten, hatte der Roboter größere Schwierigkeiten mit komplexen Aufgaben und geriet oft in Schleifen repetitiver Bewegungen oder scheiterte an der Erholung von kleineren Fehlern. Mit dem aktiven prädiktiven Bestandteil konnte der Roboter antizipieren, dass eine bestimmte Bewegung zu einer Kollision oder einem Herunterfallen führen würde, und er passte seinen Kurs an, bevor der Fehler geschah. Diese Fähigkeit ermöglichte es dem Roboter, schwierige Aufgaben wie das Einpacken eines Geschenks oder das Sortieren von Würfeln mit einer viel höheren Zuverlässigkeit zu bewältigen als bisherige Modelle. Die Forscher fanden heraus, dass sich die Leistung des Roboters konsistent verbesserte, wenn sie die Menge der Trainingsdaten erhöhten, was darauf hindeutete, dass das System wirklich aus dem schieren Volumen und der Vielfalt seiner Erfahrungen lernte.

Die Studie hob auch die Bedeutung der Art und Weise hervor, wie verschiedene Arten von Daten kombiniert werden. Das System funktionierte am besten, wenn es von einer Mischung aus echten Roboterversuchen, menschlichen Demonstrationen und simulierten Umgebungen lernte. Jede Quelle lieferte eine andere Art von Lektion: Echte Roboter lehrten das System die physischen Einschränkungen spezifischer Maschinen, Menschenvideos zeigten ihm, wie Menschen natürlich mit Objekten interagieren, und Simulationen ermöglichten es ihm, seltene oder gefährliche Szenarien sicher zu üben. Durch das Vermischen dieser Quellen entwickelte das System ein robustes Verständnis dafür, wie die Welt funktioniert, das auf verschiedene Roboterkörper anwendbar war. Die Forscher merkten an, dass das System nicht perfekt ist und immer noch mit einigen der komplexesten physischen Interaktionen kämpft, aber es stellt einen Wechsel dar – weg vom Bau spezialisierter Roboter für einzelne Aufgaben hin zur Schaffung einer universellen Intelligenz, die sich an neue Herausforderungen anpassen kann.

Letztendlich zeigt GigaBrain-0.7, dass die Skalierung der Menge und Vielfalt der Trainingsdaten, kombiniert mit einer strukturierten Architektur, die Planung, Handeln und Vorhersage trennt, zu Robotern führen kann, die fähiger und anpassungsfähiger sind. Das System folgt nicht einfach einem Skript; es versteht den Kontext einer Aufgabe, antizipiert die Konsequenzen seines Handelns und lernt aus seiner eigenen Erfahrung, um sich im Laufe der Zeit zu verbessern. Zwar bleibt noch Arbeit zu leisten, bevor solche Systeme jede mögliche Situation in einem Zuhause oder einer Fabrik bewältigen können, doch diese Forschung bietet einen klaren Weg nach vorn. Sie legt nahe, dass die Zukunft der Robotik nicht allein im Bau besserer Hardware liegt, sondern in der Schaffung intelligenterer, flexiblerer Software, die aus der riesigen und vielfältigen Erfahrung der physischen Welt lernen kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →