← Neueste Arbeiten
🤖 AI

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything führt ein skalierbares Pretraining-Framework ein, das einen neuartigen „Sparse Metric Prompt“ nutzt, um metrische Tiefe aus 20 Millionen verrauschten, heterogenen 3D-Quellen zu erlernen, wodurch der erste klare Skalierungstrend in der metrischen Tiefe etabliert und eine State-of-the-Art-Leistung über diverse Aufgaben hinweg, einschließlich monokularer Schätzung, 3D-Rekonstruktion und räumlicher Intelligenz in multimodalen Modellen, erreicht wird.

Ursprüngliche Autoren: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

Veröffentlicht 2026-07-07
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „unordentliche Küche“

Stellen Sie sich vor, Sie möchten einem Roboter beibringen, die reale Welt in 3D zu verstehen – insbesondere, wie weit Dinge entfernt sind (metrische Tiefe). Um dies zu tun, benötigen Sie normalerweise eine riesige Bibliothek an „Lehrbüchern“ (Datensätzen), die Bilder und die exakten 3D-Abstände zeigen.

Das Problem ist, dass diese Lehrbücher ein Chaos sind.

  • Einige wurden von LiDAR (Lasern) geschrieben, die zwar gut, aber verrauscht und spärlich sind (wie eine Skizze mit fehlenden Punkten).
  • Einige wurden von Computern aus Videos rekonstruiert, was zu seltsamen Fehlern in glänzenden oder unscharfen Bereichen führen kann.
  • Einige sind gerendert (computergeneriert), was perfekt ist, aber künstlich aussieht.
  • Sie stammen alle von tausenden verschiedenen Kameras, die jeweils ihre eigenen Eigenheiten und Verzerrungen haben.

Frühere Versuche, Roboter mit dieser „unordentlichen Küche“ an Daten zu trainieren, scheiterten, weil das Rauschen die KI verwirrte. Man versuchte, komplexe, maßgeschneiderte Regeln für jede Art von Rauschen zu erstellen, was jedoch nicht skalierbar war. Es war, als würde man versuchen, eine unordentliche Küche von Hand zu schrubben, anstatt eine Spülmaschine zu benutzen.

Die Lösung: „Metric Anything“

Die Autoren entwickelten ein neues System namens Metric Anything. Betrachten Sie es als eine universelle „Spülmaschine“, die jede Art von schmutzigem Geschirr (Datenquelle) bewältigen kann, ohne dass man für jedes einzelne eine spezielle Einstellung benötigt.

So funktioniert es, unterteilt in drei einfache Schritte:

1. Der „Sparse Prompt“ (Der magische Hinweis)

Anstatt der KI das ganze Bild der 3D-Welt auf einmal zu zeigen (was zu verrauscht wäre), geben sie ihr einen Sparse Metric Prompt (einen spärlichen metrischen Hinweis).

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, die Form eines verborgenen Objekts in einer Box zu erraten. Anstatt dass man die ganze Box sehen darf, gibt Ihnen jemand ein paar zufällige „Hinweise“ (Punkte), die die exakte Entfernung einiger spezifischer Punkte angeben.
  • Wie sie es machen: Sie nehmen eine 3D-Karte, verstecken den Großteil davon zufällig und zeigen der KI nur ein paar verstreute Punkte mit ihren exakten Entfernungen.
  • Warum es funktioniert: Dies zwingt die KI dazu, die Logik des Raums zu lernen (wie Objekte zueinander in Beziehung stehen), anstatt die spezifischen Rauschmuster einer Kamera auswendig zu lernen. Es entkoppelt das „räumliche Denken“ von der „Sensoren-Verzerrung“.

2. Der „Lehrer“ (Das vortrainierte Modell)

Sie haben diesem System eine gewaltige Menge an Daten gefüttert: 20 Millionen Bild-Tiefen-Paare von über 10.000 verschiedenen Kameramodellen.

  • Die Analogie: Das ist so, als würde man einen genialen Tutor einstellen, der jedes Buch in der Bibliothek gelesen hat, egal ob die Bücher auf Englisch, Französisch oder einer erfundenen Sprache geschrieben wurden.
  • Das Ergebnis: Dieses „Lehrer“-Modell lernt, sich ein Bild und ein paar zufällige Distanzhinweise anzusehen und dann den Rest der 3D-Welt perfekt zu vervollständigen. Es wird besser, je mehr Daten man ihm gibt (ein „Skalierungstrend“), was zuvor für diese Art von Aufgabe als unmöglich galt.

3. Der „Schüler“ (Das destillierte Modell)

Der „Lehrer“ ist großartig, benötigt aber diese „Hinweise“ (Prompts), um zu funktionieren. Für viele reale Aufgaben (wie ein selbstfahrendes Auto oder einen Roboter) sind diese Hinweise nicht verfügbar.

  • Die Analogie: Der Lehrer ist ein Meisterkoch, der ein Rezept benötigt. Der Schüler ist der Lehrling des Kochs. Der Lehrer kocht tausende Mahlzeiten unter Verwendung der Rezeptkarten, und der Lehrling schaut genau zu und lernt die Technik, ohne die Karten zu benötigen.
  • Das Ergebnis: Sie haben ein „Schüler“-Modell entwickelt, das vom Lehrer gelernt hat. Nun kann der Schüler ein einfaches Foto betrachten und sofort die exakten 3D-Entfernungen bestimmen, oh ,ne jegliche Hinweise oder Prompts.

Was kann das leisten? (Die „Superkräfte“)

Da dieses System von so vielfältigen und verrauschten Daten gelernt hat, ist es unglaublich robust. Das Paper zeigt, dass es exzellent darin ist:

  • Lücken füllen: Wenn Sie ihm eine unscharfe oder niedrig aufgelöste Tiefenkarte geben, kann es diese „super-auflösen“, um sie scharf und detailliert zu machen.
  • Sensoren mischen: Es kann ein sehr spärliches, verrauschtes Signal von einem Radar (das viel spärlicher ist als LiDAR) nehmen und es mit einer Kamera kombinieren, um eine perfekte 3D-Karte zu erstellen.
  • Kameras korrigieren: Es kann ein Foto betrachten und die Kameraeinstellungen (Brennweite) allein durch das Verständnis der Geometrie der Szene erraten.
  • Robotik & KI: Als sie dieses „räumliche Gehirn“ einem Roboter (VLA) oder einem großen Sprachmodell (MLLM) gaben, wurde der Roboter viel besser darin, sich in Räumen zu bewegen, den Abstand zu einem Becher einzuschätzen und Pfade zu planen. Er hörte auf zu raten und fing an zu messen.

Die wichtigste Erkenntik

Das Paper beweist, dass mehr Daten + eine einfache, intelligente Art, mit Rauschen umzugehen = ein besseres 3D-Gehirn.

Sie mussten keine komplexe, maßgeschneiderte Hardware bauen oder spezielle Regeln für jede Kamera schreiben. Sie brauchten nur eine einfache, „hinweisbasierte“ Trainingsmethode und einen riesigen, unordentlichen Datensatz. Das Ergebnis ist ein Modell, das die 3D-Welt so gut oder sogar besser als jedes bisherige System versteht, und es funktioniert überall – von regnerischen Straßen über Cartoon-Welten bis hin zu Roboter-Küchen.

Kurz gesagt: Sie haben einer KI beigebracht, Entfernungen zu verstehen, indem sie ihr eine Million unordentliche Bilder mit ein paar zufälligen Hinweisen zeigten, und nun kann sie die Welt besser als je zuvor in 3D sehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →