CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels
El artículo presenta CapFrame, un nuevo marco de trabajo que aborda la tarea de la Localización de Puntos de Vista Instruida por Texto (TIVG, por sus siglas en inglés) en escenas de Gaussian Splatting 3D mediante la conversión de instrucciones de texto en etiquetas pseudo geométricas a través de un proceso de Recuperación-Traducción-Refinamiento para optimizar automáticamente las poses de cámara de 6 grados de libertad para las composiciones de fotogramas deseadas.