From UAV Images to Semantically Annotated 3D Models: A Keypoint-Guided Vision–Language Model Framework for Infrastructure Inspection
Ce document propose un cadre de modèle vision-langage guidé par des points clés qui convertit efficacement l'imagerie de drone à fort chevauchement en modèles 3D interactifs et annotés sémantiquement pour l'inspection d'infrastructures, en sélectionnant des clusters multi-vues compacts autour de points clés spécifiés par des experts, réduisant ainsi considérablement la consommation de jetons tout en améliorant la précision et le rappel de détection sans nécessiter d'entraînement supplémentaire pour de nouveaux scénarios.