← Derniers articles
💻 computer science

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

X-Lens est un modèle de type feed-forward compact et en temps réel qui parvient à une estimation robuste de la profondeur métrique à partir de caméras hétérogènes à œil de poisson et à objectif pinhole en exploitant des jetons de calibration apprenables et un biais de distorsion paramétré par la jacobienne, le tout entraîné sur un nouveau jeu de données synthétiques à grande échelle appelé OmniScene.

Auteurs originaux : Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

Publié 2026-07-15
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de construire une carte 3D du monde à l'aide d'un sac à dos de caméra. La plupart des robots et des voitures autonomes portent un sac à dos contenant un mélange d'objectifs : certains sont des caméras « sténopé » standard (comme votre téléphone) qui voient loin avec clarté, et d'autres sont des objectifs « fisheye » qui voient tout autour de vous dans une immense bulle courbe.

Le problème ? Ces deux objectifs parlent des langages géométriques différents. L'objectif fisheye étire les bords de l'image comme un miroir déformant, tandis que l'objectif sténopé garde les choses droites. Pendant longtemps, les ordinateurs ont eu du mal à mélanger ces deux vues pour déterminer exactement à quelle distance des objets se trouvent en mètres réels. Soit ils se trompaient dans les calculs, soit ils nécessitaient de puissants supercalculateurs, ou ils devaient aplatir les images courbes en un étrange « panorama » qui perdait des détails importants.

Entrez en scène X-Lens, un nouveau modèle d'IA minuscule et super rapide qui agit comme un maître traducteur pour ces caméras mixtes.

Le traducteur magique

Considérez X-Lens comme un « cerveau » compact de 0,04 milliard de paramètres (ce qui est minuscule comparé à d'autres modèles qui pèsent plus d'un milliard de paramètres). Au lieu d'essayer de forcer les images fisheye et sténopé à se ressembler, X-Lens les accepte exactement telles qu'elles sont.

Il utilise deux astuces ingénieuses pour donner un sens au chaos :

  1. Tokens de calibration apprenables : Imaginez cela comme de petits post-it que l'IA colle sur les images fisheye. Ces notes disent à l'IA : « Hé, cette partie de l'image est étirée à cause de l'objectif, donc ne fais pas trop confiance à la forme ». Cela aide l'IA à aligner la vue fisheye courbe avec la vue sténopé droite sans avoir à écraser l'image au préalable.
  2. Biais de distorsion Jacobienne : C'est comme une boussole spéciale pour l'IA. Elle calcule exactement comment les rayons lumineux se courbent en chaque point minuscule de l'image. En injectant cette « carte de courbure » dans le système d'attention de l'IA, le modèle apprend à ignorer la distorsion et à se concentrer sur la forme 3D réelle du monde.

Le résultat ? X-Lens peut regarder un mélange de six caméras (quatre fisheye, deux sténopé) et recracher instantanément une carte de profondeur dense avec une échelle réelle. Il ne se contente pas de deviner « proche » ou « loin » ; il vous dit qu'un objet se trouve exactement à 11,07 mètres ou 31,64 mètres. Et il fait cela à 41 images par seconde, ce qui est assez rapide pour qu'un robot puisse éviter des obstacles en temps réel.

Le terrain d'entraînement géant : OmniScene

Pour apprendre à X-Lens comment faire cela, les chercheurs ne pouvaient pas simplement utiliser des photos existantes car il n'y avait pas assez d'exemples de caméras mixtes avec des mesures 3D parfaites. Ils ont donc construit OmniScene, un monde synthétique massif.

Ils ont créé 103 scènes différentes (allant de centres commerciaux à des complexes de science-fiction) et généré 266 000 images synchronisées à l'aide d'un montage à six caméras virtuel. C'est comme entraîner un pilote dans un simulateur de vol qui a déjà vu toutes les conditions météorologiques et toutes les pistes avant même qu'il ne touche un véritable avion. Les données comprennent 1,7 million d'images individuelles avec des étiquettes de profondeur parfaites et sans bruit.

Ce que disent les chiffres

L'article a testé X-Lens contre les modèles les plus gros et les plus lourds du domaine. Voici ce qu'il en est ressorti :

  • Vitesse : X-Lens fonctionne à 41 FPS sur un seul GPU haut de gamme, tandis que les concurrents les plus puissants tournent souvent entre 5 et 13 FPS.
  • Taille : X-Lens utilise 0,04B de paramètres. Le meilleur concurrent, MapAnything, utilise 1,23B de paramètres. Cela signifie que X-Lens est 88,9 % plus petit que la référence.
  • Précision : Sur le test de caméras mixtes (OmniScene-Full), X-ments a réduit l'erreur (AbsRel) de 25,4 % par rapport à la référence la plus forte. Il a également amélioré la « Scale AbsRel » (la capacité à deviner la taille réelle) de 68,1 % par rapport à MapAnything.

Ce que X-Lens n'est PAS

Il est important de savoir ce que ce modèle ne fait pas, car l'article est très clair sur ses limites :

  • Il ne prédit pas les réglages de la caméra : X-Lens a besoin qu'on lui indique exactement à quoi ressemblent les lentilles de la caméra (la calibration) avant de commencer. Il ne peut pas deviner le type d'objectif ou la position de la caméra par lui-même.
  • Ce n'est pas un outil « universel » pour les lentilles étranges : Le modèle a été entraîné sur des types spécifiques d'objectifs fisheye et sténopé. Si vous lui présentez un objectif avec un champ de vision extrême, jamais vu auparavant et totalement différent des données d'entraînement, l'article suggère que les performances pourraient légèrement chuter car il n'a pas encore rencontré ce « miroir déformant » spécifique.
  • Ce n'est pas un outil de reconstruction 3D général : Contrairement à certains modèles massifs qui essaient de deviner à la fois la pose de la caméra, le type de lentille et la carte 3D, X-Lens est spécialisé. Il se concentre strictement sur la profondeur et l'échelle, ce qui explique pourquoi il est si rapide et petit.

L'essentiel

X-Lens prouve que vous n'avez pas besoin d'un ordinateur géant et lent pour comprendre l'espace 3D avec des caméras mixtes. En utilisant une conception intelligente, consciente de la géométrie, et en s'entraînant sur un ensemble de données synthétiques massives et de haute qualité, il atteint une précision de pointe tout en étant assez petit pour fonctionner sur des appareils en périphérie (edge devices). C'est une étape vers des robots capables de réellement « voir » le monde en 3D, en temps réel, sans avoir besoin d'un supercalculateur dans leur sac à dos.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →