← Neueste Arbeiten
💬 NLP

MiMo-Embodied: X-Embodied Foundation Model Technical Report

Das Papier stellt MiMo-Embodied vor, das erste Open-Source-Grundlagenmodell für verschiedene Embodiments, das durch den Einsatz von mehrstufigem Lernen, kuratierten Daten und CoT/RL-Feinabstimmung sowohl im autonomen Fahren als auch im Embodied AI State-of-the-Art-Ergebnisse erzielt und damit einen starken positiven Transfer zwischen diesen beiden Domänen demonstriert.

Ursprüngliche Autoren: Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu
Veröffentlicht 2026-04-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben zwei sehr unterschiedliche Schüler in einem Klassenzimmer.

  • Schüler A ist ein Roboter-Kellner. Er ist hervorragend darin, eine unordentliche Küche zu navigieren, herauszufinden, welchen Teil einer Tasse man halten kann, und zu planen, wie man ein Hemd falten kann, ohne es zu knittern. Er ist ein Experte für „Embodied AI" (Interaktion mit Objekten in einem Raum).
  • Schüler B ist ein Autonomes Fahrzeug. Er ist ein Experte darin, die Straße zu beobachten, vorherzusagen, ob ein Fußgänger über die rote Ampel laufen wird, und zu entscheiden, ob er an einer belebten Kreuzung bremsen oder links abbiegen soll. Er ist ein Experte für „Autonomes Fahren".

Normalerweise unterrichten Schulen diese Schüler getrennt. Der Roboter-Kellner weiß nicht, wie man fährt, und das autonome Fahrzeug weiß nicht, wie man einen Löffel aufnimmt.

Dann kommt MiMo-Embodied ins Spiel.

Diese Arbeit stellt einen neuen „Super-Schüler" vor, der von Xiaomi entwickelt wurde. Es ist das erste Open-Source-Modell, das erfolgreich die Gehirne des Roboter-Kellners und des autonomen Fahrzeugs in einem einzigen Paket vereint. Stellen Sie es sich wie ein Schweizer Taschenmesser vor, das genauso gut darin ist, eine Weinflasche zu öffnen, wie auf einer Autobahn zu navigieren.

Wie haben sie diesen Super-Schüler aufgebaut?

Die Forscher haben die beiden nicht einfach nur zusammengewürfelt; sie verwendeten ein vierstufiges Trainingsrezept, um sicherzustellen, dass der Schüler alles lernt, ohne verwirrt zu werden:

  1. Schritt 1: Der „Raum"-Kurs: Zuerst lehrten sie das Modell alles über Räume, Objekte und wie man sich innerhalb eines Hauses bewegt. Sie nutzten Daten über Roboter, die Dinge aufnehmen und verstehen, wo sich Dinge im 3D-Raum befinden.
  2. Schritt 2: Der „Straße"-Kurs: Als Nächstes nahmen sie denselben Schüler und setzten ihn in einen Fahrsimulator. Sie lehrten ihn über Ampeln, andere Fahrzeuge und wie man vorhersagt, was ein vorausfahrender Lkw tun könnte.
  3. Schritt 3: Der „Laut Denken"-Kurs: Dies ist das Geheimnis. Anstatt nur die Antwort zu geben, wurde das Modell darin unterwiesen, laut zu denken (Chain-of-Thought). Bevor es sagt „Links abbiegen", lernt es zu sagen: „Ich sehe eine rote Ampel, also muss ich anhalten. Ich sehe ein Auto, das abbiegt, also muss ich warten." Dies hilft dem Modell zu verstehen, warum es eine Entscheidung trifft.
  4. Schritt 4: Der „Trainer"-Kurs: Schließlich verwendeten sie eine Verstärkungslern-Technik (wie ein Trainer, der Punkte für gute Spielzüge und Strafpunkte für schlechte gibt). Dies feinte das Modell, um es besonders präzise zu machen, und stellte sicher, dass es nicht nur rät, sondern den sichersten und logischsten Zug berechnet.

Was kann dieser Super-Schüler?

Die Arbeit testete MiMo-Embodied an 29 verschiedenen Herausforderungen (Benchmark-Tests) und stellte fest, dass es bei fast allen am besten war und sowohl spezialisierte Roboter als auch spezialisierte Fahrzeuge sowie große kommerzielle KI-Modelle schlug.

In der Welt des „Roboter-Kellners" (Embodied AI):

  • Affordanz-Vorhersage: Wenn man ihm ein Bild eines Stuhls zeigt, sieht er nicht nur „Stuhl". Er sieht „etwas, auf das man sich setzen kann" und „etwas, an dessen Armlehne man fassen kann". Er weiß genau, wo er ein Objekt berühren muss, um es aufzunehmen.
  • Aufgabenplanung: Wenn Sie sagen: „Ich habe Hunger, holen Sie mir einen Snack", kann er das zerlegen: In die Küche gehen -> Kühlschrank öffnen -> Den Apfel finden -> Hierher bringen.
  • Räumliches Verständnis: Er weiß, dass das „Fenster" weit entfernt ist, der „Tisch" nah ist und die „Katze" unter dem Stuhl sitzt. Er kann einen Raum navigieren, ohne gegen Dinge zu stoßen.

In der Welt des „autonomen Fahrzeugs" (Autonomes Fahren):

  • Umgebungswahrnehmung: Es kann eine chaotische Straßenszene betrachten und sofort eine rote Ampel, einen Fußgänger, der vom Bordstein steigt, und einen am Straßenrand geparkten Lkw erkennen.
  • Zustandsvorhersage: Es kann erraten, was andere Fahrer denken. „Dieses Auto verlangsamt sich; sie wollen wahrscheinlich abbiegen." „Dieser Fußgänger wartet; er wird gleich überqueren."
  • Fahrplanung: Es fährt nicht nur; es fährt sicher. Es kann einen sanften Spurwechsel oder ein sanftes Anhalten planen und seine Überlegungen so erklären, wie es ein menschlicher Fahrer tun würde.

Die große Entdeckung: „Cross-Training" funktioniert

Der aufregendste Teil der Arbeit ist die Entdeckung, dass das Erlernen einer Fähigkeit der anderen hilft.

Normalerweise dachte man, ein Modell, das auf Fahrdaten trainiert wurde, würde vergessen, wie man eine Tasse aufnimmt, und ein Modell, das auf Robotern trainiert wurde, würde vergessen, wie man fährt. Aber MiMo-Embodied bewies, dass diese Fähigkeiten sich tatsächlich gegenseitig verstärken.

  • Das Erlernen der Vorhersage, wohin ein Auto fahren wird, hilft dem Modell zu verstehen, wie sich Objekte in einem Raum bewegen.
  • Das Erlernen des Herausfindens, wie man einen Griff fasst, hilft dem Modell, die physikalischen Einschränkungen eines Lenkrads zu verstehen.

Das Fazit

MiMo-Embodied ist ein „Foundation Model", das als universelles Gehirn für physische Maschinen fungiert. Ob die Maschine ein Roboter-Staubsauger, ein humanoider Roboter oder ein autonomes Fahrzeug ist – dieses einzelne Modell kann die Welt verstehen, seine Aktionen planen und sie sicher ausführen.

Die Arbeit behauptet, dies sei ein großer Schritt nach vorne, da er die Mauer zwischen „Indoor-Robotern" und „Outdoor-Autos" einreißt und zeigt, dass eine einzige, vereinheitlichte KI die Komplexität der gesamten physischen Welt bewältigen kann. Sie haben sogar den Code und das Modell für jedermann verfügbar gemacht, um sie zu nutzen und zu studieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →