From UAV Images to Semantically Annotated 3D Models: A Keypoint-Guided Vision–Language Model Framework for Infrastructure Inspection
Questo articolo propone un framework di modello visione-linguaggio guidato da punti chiave che converte efficientemente l'immaginaria UAV ad alta sovrapposizione in modelli 3D interattivi e semanticamente annotati per l'ispezione delle infrastrutture, selezionando cluster multi-vista compatti attorno a punti chiave specificati da esperti, riducendo così significativamente il consumo di token e migliorando al contempo la precisione e il richiamo della rilevazione senza richiedere un ulteriore addestramento per nuovi scenari.