Résumé technique : Ajustement sélectif guidé par l'interprétabilité mécaniste pour l'estimation de la profondeur des inondations au centimètre près
1. Énoncé du problème
Les inondations urbaines constituent une menace critique pour les infrastructures de transport, pourtant les systèmes opérationnels (ex. : Google Maps, Waze) s'appuient actuellement sur des rapports de fermeture binaires plutôt que sur des mesures de profondeur quantitatives. Cette approche binaire ne permet pas de soutenir les applications émergentes à haute criticité de sécurité :
- Véhicules électriques (VE) : Risque d'emballement thermique à des profondeurs de 15–25 cm.
- Véhicules autonomes (VA) : Nécessitent une estimation précise de la profondeur pour définir les domaines de conception opérationnelle, car les piles de perception actuelles ne peuvent pas distinguer l'eau franchissable de l'eau infranchissable.
- Physique de la sécurité : Même un film d'eau de 0,56–1,5 mm peut déclencher l'aquaplaning, et un film de 1 mm peut réduire la friction pneu-chaussée jusqu'à 61 %.
Les solutions existantes basées sur la vision souffrent de limitations significatives :
- Méthodes par objets de référence : Limitées à une MAE d'environ 12 cm et échouent lorsque les objets sont occultés.
- Méthodes de détection d'objets : Traitent la profondeur comme des catégories discrètes plutôt que comme des variables continues.
- Grands modèles multimodaux (LMM) zero-shot : Bien qu'ils offrent un raisonnement ouvert, ils produisent des erreurs élevées (MAE > 8 cm) et fonctionnent comme des boîtes noires propriétaires, empêchant l'interprétabilité requise pour un déploiement critique pour la sécurité.
Il existe une lacune dans la littérature concernant l'ajustement fin (fine-tuning) des modèles de langage visuels (VLM) open-source pour l'estimation de la profondeur à résolution centimétrique continue et la compréhension mécaniste de la manière dont ces modèles acquièrent de telles capacités.
2. Méthodologie
A. Génération de données synthétiques
Pour pallier la rareté des données réelles étiquetées, les auteurs ont généré un corpus synthétique de 2,81 millions d'images à l'aide d'Unreal Engine 5. Le jeu de données comprend :
- Sous-ensemble véhicule unique : 1,73 million d'images avec 7 types de véhicules sur 9 niveaux de profondeur discrets (0–40 cm par pas de 5 cm) et 4 conditions météorologiques.
- Sous-ensemble véhicules mixtes : 1,08 million d'images avec plusieurs véhicules par scène, variant la profondeur par incréments de 1 cm (1–40 cm) pour simuler l'occlusion et la complexité visuelle.
- Évaluation de la fidélité : Le transfert sim-to-real a été validé par des statistiques de Kolmogorov-Smirnov (KS), le sous-ensemble de véhicules mixtes montrant un meilleur alignement avec les images réelles que le sous-ensemble de véhicule unique.
B. Modèle de référence : FloodLlama-Dense
Les auteurs ont ajusté le modèle LLaMA 3.2-11B Vision Instruct en utilisant QLoRA (quantification 4-bit NF4 avec adaptateurs LoRA).
- Architecture : Le modèle couple un encodeur de vision ViT-H/14 gelé avec un décodeur de 40 couches. Des adaptateurs LoRA (r=16,α=16) ont été insérés dans les projections Q/K/V/O de l'ensemble des 40 modules d'attention (32 couches d'auto-attention + 8 couches d'attention croisée).
- Stratégie d'entraînement : Un curriculum progressif en deux phases a été employé :
- Phase 1 : Ajustement fin sur un sous-ensemble équilibré de 340k images de données de véhicule unique pour établir la cartographie de base vision-langage.
- Phase 2 : Ajustement fin cumulatif sur 270k images issues du sous-ensemble de véhicules mixtes (traitées en 9 blocs séquentiels) pour gérer l'occlusion et affiner la régression continue.
- Paramètres : 54,4 millions de paramètres entraînables (0,49 % du modèle de base).
C. Analyse de l'interprétabilité mécaniste
Pour comprendre comment le modèle apprend la profondeur et identifier des cibles d'ajustement fin efficaces, les auteurs ont appliqué quatre techniques d'interprétabilité au modèle FloodLlama-Dense entraîné :
- Sondage linéaire (Linear Probing) : Un régresseur de type ridge a été entraîné sur les états cachés gelés pour prédire la profondeur. Les résultats ont montré une transition de phase abrupte à la couche 23 (L23), où la profondeur devient linéairement décodable (R2 passant de -0,355 à +0,513).
- Logit Lens : A révélé que les jetons (tokens) de profondeur numérique n'émergent que dans les couches L33 et L38, après la transition d'encodage à L23.
- Alignement de noyau centré (CKA) : A mesuré la dérive représentationnelle. Les couches L13–L22 ont montré une dérive significative (restructuration des caractéristiques visuelles) mais n'encodent pas la profondeur. Les couches L23–L38 conservent une haute similitude avec le modèle de base mais portent l'information de profondeur.
- Entropie de l'attention croisée : A mesuré la focalisation de l'attention. L13 présente la réduction d'entropie la plus forte (sélectivité spatiale) mais une capacité d'encodage nulle.
- Analyse des poids LoRA : A identifié que L18, L23, L28, L33 et L38 ont absorbé la majorité des mises à jour de poids.
Résultat clé : Le modèle présente un schéma d'adaptation en deux étapes : les couches précoces à moyennes (L13–L22) restructurent les représentations visuelles, tandis que les couches tardives (à partir de L23) encodent l'information de profondeur.
D. Ajustement sélectif : FloodLlama-MI5 et MI6
En tirant parti des découvertes de l'interprétabilité, les auteurs ont développé des variantes à efficacité de paramètres, qui ajustent uniquement des couches d'attention croisée spécifiques :
- FloodLlama-MI5 : Ajuste 5 couches (L8, L18, L23, L33, L38).
- FloodLlama-MI6 : Ajuste 6 couches (l'ensemble de MI5 + L28).
- Efficacité : Ces modèles réduisent les paramètres entraînables de 86–88 % (6,55M et 7,86M de paramètres, respectivement) par rapport au modèle de référence dense, tout en maintenant le même curriculum d'entraînement en deux phases.
3. Résultats clés
A. Performance sur les tests synthétiques
Sur un ensemble de test de 16 000 images de véhicules mixtes mis de côté :
- FloodLlama-Dense : A atteint une MAE = 0,40 cm, un RMSE = 1,97 cm, et une Acc@5cm = 97,59 %.
- FloodLlama-MI5 : MAE = 0,80 cm, Acc@5cm = 95,1 %.
- FloodLlama-MI6 : MAE = 0,78 cm, Acc@5cm = 95,8 %.
- Observation : Bien que le modèle dense ait obtenu l'erreur absolue la plus faible, les variantes éparses maintiennent une précision opérationnelle dans la bande de tolérance critique de ±5 cm avec une fraction du coût d'entraînement.
B. Benchmark en conditions réelles (vs. STURM-FloodDepth)
Évalué sur un ensemble de données réelles de 300 images par rapport à la ligne de base STURM-FloodDepth (qui produit des catégories discrètes) :
- FloodLlama-MI6 (prompt Chain-of-Thought) : A atteint 98,62 % de précision globale et 100,00 % de précision sur les niveaux d'inondation profonds (> 30 cm).
- STURM-FloodDepth : A atteint 86,61 % de précision globale et 88,27 % sur les inondations profondes.
- Signification statistique : L'amélioration d'environ 12 points de pourcentage a été confirmée par des intervalles de confiance à 95 % non chevauchants.
- Sensibilité au prompt : Les prompts de type Chaîne de Pensée (Chain-of-Thought - CoT) ont produit la plus haute précision et le meilleur calibrage pour les inondations profondes, tandis que les prompts "Simples" avaient tendance à sous-estimer les niveaux d'inondation profonds.
4. Contributions
- Jeu de données : Création d'un corpus de inondations synthétiques de 2,81 millions d'images avec des étiquettes de profondeur à résolution centimétrique et une variation systématique des types de véhicules et de la météo.
- FloodLlama-Dense : Premier VLM open-source ajusté pour la régression continue de la profondeur d'inondation à résolution centimétrique, atteignant une MAE sub-centimétrique sur les données synthétiques.
- Aperçu mécaniste : Première application de l'interprétabilité mécaniste (sondage linéaire, logit lens, CKA, entropie) à un modèle de profondeur d'inondation, identifiant la couche 23 (L23) comme la couche critique de transition d'encodage de la profondeur et révélant un schéma d'adaptation "restructurer-puis-encoder".
- Modèles efficaces : Développement de FloodLlama-MI5 et MI6, qui atteignent une réduction de paramètres de 86–88 % tout en surpassant l'état de l'art STURM-FloodDepth sur des données réelles.
5. Signification et affirmations
L'article affirme que l'interprétabilité mécaniste peut servir de levier de conception pratique pour l'ajustement fin efficace en paramètres (PEFT) dans les tâches de perception liées au transport. En identifiant les couches spécifiques responsables de l'encodage de la tâche (L23) par rapport à celles responsables de la restructuration des caractéristiques (L13–L22), les auteurs démontrent que :
- L'ajustement fin complet de toutes les couches n'est pas nécessaire pour une régression de haute précision.
- L'ajustement sélectif guidé par l'analyse d'interprétabilité peut réduire les coûts de calcul de près de 90 % sans sacrifier la généralisation en conditions réelles.
- Les VLM open-source, lorsqu'ils sont correctement ajustés et interprétés, peuvent fournir la précision sub-décimétrique requise pour les systèmes de sécurité de véhicules de nouvelle génération, surpassant à la fois les méthodes de vision par ordinateur traditionnelles et les modèles propriétaires zero-shot.
Les auteurs notent des limites, notamment le recours à une architecture VLM unique (LLaMA 3.2) et la sous-représentation des scénarios de faible luminosité extrême et d'inondations profondes dans le test réel, suggérant que les travaux futurs devraient étendre ces protocoles d'interprétabilité à d'autres architectures et à des conditions environnementales plus larges.