← Últimos artículos
💻 computer science

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

X-Lens es un modelo de alimentación hacia adelante (feed-forward) compacto y en tiempo real que logra una estimación de profundidad métrica robusta a partir de cámaras de ojo de pez y pinhole heterogéneas mediante el aprovechamiento de tokens de calibración aprendibles y un sesgo de distorsión parametrizado por Jacobiano, todo ello entrenado en un nuevo conjunto de datos sintéticos a gran escala llamado OmniScene.

Autores originales: Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

Publicado 2026-07-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando construir un mapa 3D del mundo usando una mochila de cámaras. La mayoría de los robots y coches autónomos llevan una mochila con una mezcla de lentes: algunas son cámaras "pinhole" estándar (como las de tu teléfono) que ven lejos con claridad, y otras son lentes "fisheye" (ojo de pez) que ven todo a tu alrededor en una enorme burbuja curva.

¿El problema? Estas dos lentes hablan lenguajes geométricos diferentes. La lente fisheye estira los bordes de la imagen como un espejo de feria, mientras que la lente pinhole mantiene las líneas rectas. Durante mucho tiempo, a las computadoras les costó combinar estas dos visiones para determinar exactamente a qué distancia se encuentran los objetos en metros reales. O bien calculaban mal la matemática, o necesitaban supercomputadoras masivas, o tenían que aplanar las imágenes curvas en un extraño "panorama" que perdía detalles importantes.

Aquí entra X-Lens, un modelo de IA nuevo, diminuto y superrápido que actúa como un maestro traductor para estas cámaras mixtas.

El Traductor Mágico

Piensa en X-Lens como un "cerebro" compacto de 0.04 mil millones de parámetros (eso es diminuto comparado con otros modelos que pesan más de 1 mil millones de parámetros). En lugar de intentar forzar las imágenes fisheye y pinhole para que se vean iguales, X-Lens las acepta exactamente como son.

Utiliza dos trucos ingeniosos para dar sentido al caos:

  1. Tokens de Calibración Aprendibles: Imagina que son pequeñas notas adhesivas que la IA pega en las imágenes fisheye. Estas notas le dicen a la IA: "Oye, esta parte de la imagen está estirada debido a la lente, así que no confíes demasiado en la forma". Esto ayuda a la IA a alinear la vista curva de la fisheye con la vista recta de la pinhole sin tener que aplastar la imagen primero.
  2. Sesgo de Distorsión de Jacobiano: Esto es como una brújula especial para la IA. Calcula exactamente cómo se curvan los rayos de luz en cada punto diminuto de la imagen. Al introducir este "mapa de curvatura" en el sistema de atención de la IA, el modelo aprende a ignorar la distorsión y a concentrarse en la forma 3D real del mundo.

El resultado es que X-Lens puede mirar una mezcla de seis cámaras (cuatro fisheye, dos pinhole) y escupir instantáneamente un mapa de profundidad denso con una escala del mundo real. No solo adivina si algo está "cerca" o "lejos"; te dice que un objeto está exactamente a 11.07 metros o 31.64 metros de distancia. Y hace esto a 41 fotogramas por segundo, lo cual es lo suficientemente rápido para que un robot esquive obstáculos en tiempo real.

El Campo de Práctica Gigante: OmniScene

Para enseñar a X-Lens a hacer esto, los investigadores no podían usar fotos existentes porque no había suficientes ejemplos de cámaras mixtas con mediciones 3D perfectas. Así que construyeron OmniScene, un mundo sintético masivo.

Crearon 103 escenas diferentes (desde centros comerciales hasta complejos de ciencia ficción) y generaron 266,000 fotogramas sincronizados utilizando un montaje virtual de seis cámaras. Esto es como entrenar a un piloto en un simulador de vuelo que ha visto todas las condiciones climáticas y pistas posibles antes de tocar un avión real. Los datos incluyen 1.7 millones de imágenes individuales con etiquetas de profundidad perfectas y sin ruido.

Lo que Dicen los Números

El artículo probó a X-Lens contra los modelos más grandes y pesados en su campo. Esto fue lo que sucedió:

  • Velocidad: X-Lens funciona a 41 FPS en una sola GPU de alto rendimiento, mientras que los competidores más fuertes suelen funcionar a 5 a 13 FPS.
  • Tamaño: X-Lens utiliza 0.04B de parámetros. El siguiente mejor competidor, MapAnything, utiliza 1.23B de parámetros. Eso significa que X-Lens es un 88.9% más pequeño que la línea base.
  • Precisión: En la prueba de cámara mixta (OmniScene-Full), X-Lens redujo el error (AbsRel) en un 25.4% en comparación con la línea base más fuerte. También mejoró el "Scale AbsRel" (qué tan bien adivina el tamaño real) en un 68.1% en comparación con MapAnything.

Lo que X-Lens NO es

Es importante saber lo que este modelo no hace, porque el artículo es muy claro sobre sus límites:

  • No predice la configuración de la cámara: X-Lens necesita que se le diga exactamente cómo son las lentes de la cámara (la calibración) antes de comenzar. No puede adivinar el tipo de lente o la posición de la cámara por sí solo.
  • No es una solución para "todas las lentes extrañas": El modelo fue entrenado con tipos específicos de lentes fisheye y pinhole. Si le entregas una lente con un campo de visión extremo y nunca antes visto que sea totalmente diferente a los datos de entrenamiento, el artículo sugiere que el rendimiento podría bajar ligeramente porque no ha visto ese "espejo de feria" específico antes.
  • No es una herramienta de reconstrucción 3D general: A diferencia de algunos modelos masivos que intentan adivinar la pose de la cámara, el tipo de lente y el mapa 3D todo al mismo tiempo, X-Lens es especializado. Se enfoca estrictamente en la profundidad y la escala, razón por la cual es tan rápido y pequeño.

La Conclusión

X-Lens demuestra que no necesitas una computadora gigante y lenta para entender el espacio 3D con cámaras mixtas. Al utilizar un diseño inteligente que reconoce la geometría y entrenar con un conjunto de datos sintéticos masivo y de alta calidad, logra una precisión de vanguardia siendo lo suficientemente pequeño como para ejecutarse en dispositivos de borde (edge devices). Es un paso hacia robots que pueden realmente "ver" el mundo en 3D, en tiempo real, sin necesidad de una supercomputadora en su mochila.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →