From UAV Images to Semantically Annotated 3D Models: A Keypoint-Guided Vision–Language Model Framework for Infrastructure Inspection
Dit artikel stelt een keypoint-gestuurd visie-taalmodelframework voor dat efficiënt hoog overlappende UAV-beelden omzet in interactieve, semantisch geannoteerde 3D-modellen voor infrastructuurinspectie door compacte multi-view clusters rond door experts gespecificeerde keypoints te selecteren, waardoor het tokenverbruik aanzienlijk wordt verminderd terwijl de detectieprecisie en -recall worden verbeterd zonder dat extra training voor nieuwe scenario's vereist is.