← Últimos artículos
💻 computer science

Towards Robust Monocular Depth Estimation in Non-Lambertian Surfaces

Este artículo propone un marco de estimación de profundidad monocular robusto para superficies no lambertianas que emplea guía regional basada en gradientes, aumentación de mapeo de tonos aleatorios y un módulo opcional de fusión de iluminación basado en Autoencoders Variacionales para lograr un rendimiento de vanguardia en pruebas de cero disparos y en la competencia TRICKY2024 sin depender de máscaras externas.

Autores originales: Junrui Zhang, Jiaqi Li, Yachuan Huang, Yiran Wang, Jinghong Zheng, Liao Shen, Zhiguo Cao

Publicado 2026-07-31
📖 1 min de lectura☕ Lectura para el café

Autores originales: Junrui Zhang, Jiaqi Li, Yachuan Huang, Yiran Wang, Jinghong Zheng, Liao Shen, Zhiguo Cao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Hacia una Estimación de Profundidad Monocular Robusta en Superficies No Lambertianas

Planteamiento del Problema
Los avances recientes en la Estimación de Profundidad Monocular (MDE, por sus siglas en inglés) han producido modelos con impresionantes capacidades de generalización zero-shot en escenas generales. Sin embargo, estos modelos fallan frecuentemente al encontrarse con superficies no lambertianas, específicamente regiones transparentes o de espejo (ToM, por sus siglas en inglés). Las propiedades reflectantes únicas de estas superficies causan que los modelos estándar predigan estructuras de profundidad erróneas basadas en el contenido reflejado en lugar de la superficie misma. Los intentos previos para abordar esto, como Depth4ToM, dependen de máscaras de segmentación externas para realizar un in-painting de las imágenes RGB con colores aleatorios antes de procesarlas a través de un modelo MDE preentrenado. Estos enfoques sufren dos limitaciones principales: dependen altamente de la precisión de las máscaras de entrada adicionales y el uso de colores aleatorios durante el in-painting carece de robustez, requiriendo un ajuste extensivo de hiperparámetros. Además, las condiciones de iluminación impactan significativamente la recuperación de la profundidad en superficies no lambertianas; una iluminación excesiva puede abrumar las texturas, mientras que una iluminación insuficiente introduce ruido y distorsión, afectando particularmente a los objetos transparentes y a los reflejos de espejos.

Metodología
Los autores proponen un marco de entrenamiento diseñado para permitir que un modelo base (específicamente Depth Anything V2) aprenda incrementalmente las características únicas de las superficies no lambertianas, eliminando la necesidad de in-painting de RGB. El método consta de tres componentes principales:

  1. Aumentación de Mapeo de Tonos Aleatorio (RTA):
    Para abordar la sensibilidad de la estimación de profundidad no lambertiana a la iluminación, los autores emplean un mapeo de tonos aleatorio durante la fase de entrenamiento en el conjunto de datos sintético Hypersim. Al aplicar la transformación Iaug=αIoriγI_{aug} = \alpha I_{ori}^{\gamma}, donde γ\gamma es un factor de corrección de gamma estándar y α\alpha es un factor de escala derivado de valores de intensidad de percentiles aleatorios (entre los percentiles 70 y 99), el modelo se expone a una gama diversa de condiciones de iluminación. Esto tiene como objetivo mejorar la capacidad de generalización zero-shot del modelo bajo diversas iluminaciones.

  2. Guía Regional de Superficie No Lambertiana (NSRG):
    En lugar de in-painting, los autores introducen un mecanismo de guía regional que restringe las predicciones del modelo MDE dentro del dominio del gradiente. Basándose en el principio previo de que la mayoría de los objetos ToM son planos continuos, el método impone consistencia entre el gradiente de profundidad predicho y el gradiente de la verdad de terreno (ground truth) dentro de las regiones no lambertianas enmascaradas.
    La función de pérdida, LToM\mathcal{L}_{ToM}, utiliza un estimador robusto para alinear los gradientes de la profundidad predicha (D\nabla D) y el gradiente de la verdad de terreno (D\nabla D^\star). Calcula coeficientes de escala (ss) y desplazamiento (tt) para normalizar los gradientes, eliminando valores atípicos mediante el recorte del 20% de los residuales. La pérdida final minimiza la distancia L1L_1 entre los gradientes normalizados, asegurando que el plano de profundidad predicho permanezca suave y consistente con la verdad de terreno en las regiones ToM.

  3. Fusión de Imágenes de Iluminación Diversa (DLIF) (Opcional):
    Para escenarios donde se dispone de múltiples imágenes de exposición del mismo escenario, los autores proponen un módulo de fusión opcional. Este módulo utiliza un Autoencoder Variacional (VAE) preentrenado de Stable Diffusion para codificar múltiples imágenes con diferentes condiciones de iluminación en características latentes. Al promediar estas características latentes y decodificarlas, el sistema genera una única imagen RGB fusionada que teóricamente posee las condiciones de iluminación óptimas para la estimación de profundidad, aprovechando los sesgos semánticos del VAE.

Contribuciones Clave

  • Aumentación de Mapeo de Tonos Aleatorio: Una estrategia de aumentación de datos que enriquece el conjunto de datos de entrenamiento con variaciones de iluminación, mejorando significativamente la robustez y la generalización zero-shot del modelo MDE ante diversos escenarios de iluminación.
  • Guía Regional de Superficie No Lambertiana: Una restricción de entrenamiento novedosa que opera en el dominio del gradiente. Guía directamente a la red para estimar planos de profundidad correctos para superficies no lambertianas utilizando máscaras de segmentación, evitando la inestabilidad de los métodos de in-painting de RGB.
  • Módulo de Fusión de Imágenes Opcional: Un mecanismo que utiliza VAEs para fusionar imágenes de múltiple exposición, proporcionando una entrada ventajosa para la estimación de profundidad cuando se dispone de múltiples condiciones de iluminación.

Resultados Experimentales
El método fue evaluado en el conjunto de datos Booster y en el NYU Depth Dataset V2 (refinado por Mirror3D), así como en el conjunto de prueba de la competencia TRICKY2024.

  • Desempeño Cuantitativo: Comparado con el modelo base Depth Anything V2, el método propuesto logró mejoras de precisión del 33.39% en el conjunto de datos Booster y del 5.21% en el conjunto de datos Mirror3D dentro de las regiones ToM (medido por δ1.05\delta_{1.05}).
  • Estado del Arte: En el conjunto de prueba de la competencia TRICKY2024, el método alcanzó una puntuación δ1.05\delta_{1.05} de 90.75 dentro de las regiones ToM, demostrando un desempeño de estado del arte.
  • Estudios de Ablación: Los experimentos confirmaron que tanto la aumentación de mapeo de tonos aleatorio como la guía regional de superficie no lambertiana contribuyen de forma independiente a las ganancias de desempeño, siendo la combinación la que produce los mejores resultados. El módulo de fusión de imágenes opcional mejoró aún más los resultados cuando se utilizaron entradas de múltiple exposición.

Significancia y Limitaciones
El artículo afirma que su principal significancia radica en el cambio de paradigma del in-painting de post-procesamiento al aprendizaje directo de las características no lambertianas a través de un marco de entrenamiento bien diseñado. Al centrarse en la consistencia del gradiente y la robustez de la iluminación, el método simplifica el flujo de trabajo y mejora la estabilidad sin depender de ajustes empíricos para colores aleatorios.

Los autores reconocen limitaciones, señalando que en casos de imágenes extremadamente sobreexpuestas donde las texturas de las superficies no lambertianas (como el vidrio) se pierden por completo, la red aún puede fallar. Sugieren que el trabajo futuro podría integrar la optimización de la calidad de la imagen y la fusión de información semántica para mejorar aún más los resultados cualitativos y cuantitativos en tales condiciones extremas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →