← Nieuwste papers
🤖 AI

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything introduceert een schaalbaar pretraining-framework dat gebruikmaakt van een innovatieve "Sparse Metric Prompt" om metriek diepte te leren van 20 miljoen ruisgevoelige, heterogene 3D-bronnen, waarmee de eerste duidelijke schalingstrend in metriek diepte wordt vastgesteld en state-of-the-art prestaties worden bereikt over diverse taken, waaronder monoculaire schatting, 3D-reconstructie en ruimtelijke intelligentie in multimodale modellen.

Oorspronkelijke auteurs: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Ruisende Keuken"

Stel je voor dat je een robot wilt leren hoe hij de echte wereld in 3D moet begrijpen—specifiek, hoe ver dingen verwijderd zijn (metrische diepte). Om dit te doen, heb je meestal een enorme bibliotheek aan "leerboeken" (datasets) nodig die foto's en de exacte 3D-afstanden laten zien.

Het probleem is dat deze leerboeken een rommeltje zijn.

  • Sommige zijn geschreven door LiDAR (lasers), die geweldig zijn maar ruisachtig en ijl (zoals een schets met ontbrekende stippen).
  • Sommige zijn door computers gereconstrueerd uit video's, wat vreemde fouten kan bevatten in glimmende of wazige gebieden.
  • Sommige zijn gerenderd (door de computer gegenereerd), wat perfect is maar er nep uitziet.
  • Ze komen allemaal van duizenden verschillende camera's, elk met zijn eigen eigenaardigheden en afwijkingen.

Eerdere pogingen om robots met deze "ruisende keuken" aan data te onderwijzen, faalden omdat de ruis de AI in de war bracht. Men probeerde complexe, op maat gemaakte regels te maken voor elk type ruis, wat niet goed schaalbaar was. Het was alsof je een rommelige keuken probeerde schoon te maken door elk bord handmatig te boenen in plaats van een vaatwasser te gebruiken.

De Oplossing: "Metric Anything"

De auteurs creëerden een nieuw systeem genaamd Metric Anything. Denk aan dit systeem als een universele "vaatwasser" die elke soort vuile vaat (databron) kan afhandelen zonder dat er een speciale instelling voor nodig is.

Zo werkt het, opgedeeld in drie eenvoudige stappen:

1. De "Sparse Prompt" (De Magische Hint)

In plaats van de AI in één keer het hele plaatje van de 3D-wereld te laten zien (wat te veel ruis bevat), geven ze het een Sparse Metric Prompt.

  • De Analogie: Stel je voor dat je probeert de vorm van een verborgen object in een doos te raden. In plaats van dat je de hele doos mag zien, geeft iemand je een paar willekeurige "hints" (stippen) die je de exacte afstand van een paar specifieke punten vertellen.
  • Hoe ze het doen: Ze nemen een 3D-kaart, verbergen het grootste deel ervan willekeurig, en laten alleen een paar verspreide stippen met hun exacte afstanden aan de AI zien.
  • Waarom het werkt: Dit dwingt de AI om de logica van de ruimte te leren (hoe objecten zich tot elkaar verhouden) in plaats van de specifieke ruispatronen van een camera uit het hoofd te leren. Het ontkoppelt "ruimtelijk redeneren" van "sensor-bias".

2. De "Teacher" (Het Pre-trained Model)

Ze voerden dit systeem een enorme hoeveelheid data: 20 miljoen beeld-diepte paren van meer dan 10.000 verschillende cameramodellen.

  • De Analogie: Dit is als het inhuren van een briljante tutor die elk boek in de bibliotheek heeft gelezen, ongeacht of die boeken in het Engels, Frans of een verzonnen taal zijn geschreven.
  • Het Resultaat: Dit "Teacher"-model leert naar een foto en een paar willekeurige afstandshints te kijken, en vervolgens de rest van de 3D-wereld perfect in te vullen. Het wordt beter naarmate je het meer data geeft (een "scaling trend"), wat voorheen voor dit soort taken als onmogelijk werd beschouwd.

3. De "Student" (Het Gedistilleerde Model)

De "Teacher" is geweldig, maar heeft die "hints" (prompts) nodig om te werken. Voor veel praktische taken (zoals een zelfrijdende auto of een robot) zijn die hints niet beschikbaar.

  • De Analogie: De Teacher is een meesterkok die een receptenkaart nodig heeft. De Student is de leerling van de meesterkok. De Teacher kookt duizenden maaltijden met behulp van de receptenkaarten, en de leerling kijkt nauwlettend toe en leert de techniek zonder de kaarten nodig te hebben.
  • Het Resultaat: Ze creëerden een "Student"-model dat heeft geleerd van de Teacher. Nu kan de Student naar een gewone foto kijken en direct de exacte 3D-afstanden weten, zonder dat er hints of prompts nodig zijn.

Wat kan dit doen? (De "Superkrachten")

Omdat dit systeem heeft geleerd van zo diverse en ruisende data, is het ongelooflijk robuust. Het artikel laat zien dat het uitblinkt in:

  • Gaten invullen: Als je het een wazige of lage-resolutie dieptekaart geeft, kan het deze "super-resolutie" maken om het scherp en gedetailleerd te maken.
  • Sensoren Mengen: Het kan een zeer ijle, ruisende signalen van een Radar (die veel ijler is dan LiDAR) nemen en deze combineren met een camera om een perfecte 3D-kaart te maken.
  • Camera's Corrigeren: Het kan naar een foto kijken en de instellingen van de camera (brandpuntsafstand) raden, puur door de geometrie van de scène te begrijpen.
  • Robotica & AI: Toen ze deze "ruimtelijke hersenen" gaven aan een robot (VLA) of een groot taalmodel (MLLM), werd de robot veel beter in het navigeren door kamers, het inschatten van de afstand tot een kopje en het plannen van routes. De robot stopte met gokken en begon te meten.

De Belangrijkste Conclusie

Dit artikel bewijst dat meer data + een eenvoudige, slimme manier om met ruis om te gaan = een betere 3D-hersenen.

Ze hadden geen complexe, op maat gemaakte hardware nodig of speciale regels voor elke camera. Ze hadden alleen een eenvoudige "hint-gebaseerde" trainingsmethode en een enorme, rommelige dataset nodig. Het resultaat is een model dat de 3D-wereld begrijpt even goed als (of zelfs beter dan) elk vorig systeem, en het werkt overal—van regenachtige straten tot cartoonwerelden of robotkeukens.

Kortom: Ze hebben een AI geleerd om afstand te begrijpen door het een miljoen rommelige foto's met een paar willekeurige aanwijzingen te laten zien, en nu kan het de wereld in 3D beter zien dan ooit tevoren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →