From UAV Images to Semantically Annotated 3D Models: A Keypoint-Guided Vision–Language Model Framework for Infrastructure Inspection
Este artigo propõe um framework de modelo visão-linguagem guiado por pontos-chave que converte eficientemente imagens de UAV com alta sobreposição em modelos 3D interativos e semanticamente anotados para inspeção de infraestrutura, selecionando clusters multivisão compactos ao redor de pontos-chave especificados por especialistas, reduzindo assim significativamente o consumo de tokens enquanto melhora a precisão e o recall de detecção sem exigir treinamento adicional para novos cenários.