From UAV Images to Semantically Annotated 3D Models: A Keypoint-Guided Vision–Language Model Framework for Infrastructure Inspection
Este artículo propone un marco de modelo de visión y lenguaje guiado por puntos clave que convierte eficientemente imágenes de UAV con alto solapamiento en modelos 3D interactivos y semánticamente anotados para la inspección de infraestructura, mediante la selección de grupos multivista compactos alrededor de puntos clave especificados por expertos, reduciendo así significativamente el consumo de tokens mientras mejora la precisión y la exhaustividad de la detección sin requerir entrenamiento adicional para nuevos escenarios.