From UAV Images to Semantically Annotated 3D Models: A Keypoint-Guided Vision–Language Model Framework for Infrastructure Inspection
本論文は、専門家が指定したキーポイントの周囲にコンパクトな多視点クラスターを選択することで、高重複なUAV画像をインフラ点検用のインタラクティブで意味論的に注釈付けされた3Dモデルへと効率的に変換し、新しいシナリオのための追加学習を必要とすることなく、トークン消費を大幅に削減しながら検出の適合率と再現率を向上させる、キーポイント誘導型のビジョン・ランゲージモデル・フレームワークを提案する。