From UAV Images to Semantically Annotated 3D Models: A Keypoint-Guided Vision–Language Model Framework for Infrastructure Inspection
Dieses Paper schlägt ein durch Keypoints gesteuertes Vision-Language-Modell-Framework vor, das UAV-Bildmaterial mit hoher Überlappung effizient in interaktive, semantisch annotierte 3D-Modelle für die Infrastrukturinspektion umwandelt, indem es kompakte Multi-View-Cluster um von Experten spezifizierte Keypoints auswählt, wodurch der Token-Verbrauch signifikant reduziert und die Detektionspräzision sowie der Recall verbessert werden, ohne dass zusätzliches Training für neue Szenarien erforderlich ist.