Towards Spatial Supersensing in the Wild
Cet article présente VSI-Super-Wild, un banc d'essai à grande échelle de vidéos longues et réelles conçu pour évaluer les capacités de super-sensibilité spatiale, révélant que les modèles multimodaux actuels échouent fondamentalement à maintenir un suivi cohérent de l'état du monde au fil du temps en raison de problèmes tels que l'effondrement spatial et des mises à jour insuffisantes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous marchez dans une ville animée. Vous ne voyez pas seulement une série d'images déconnectées ; vous construisez une carte mentale. Vous savez que le café est à votre gauche, que vous avez tourné à droite au niveau de la banque, et que vous êtes passé devant le même vélo rouge trois fois. Cette capacité à tisser ce que vous voyez, où vous êtes et ce que vous avez fait en une histoire unique et continue est la manière dont les humains naviguent dans le monde. Les scientifiques appellent cela la « modélisation du monde ». Pendant longtemps, les programmes informatiques ont été excellents pour reconnaître une photo isolée d'un chat ou d'une voiture. Mais lorsqu'il s'agit de regarder une longue vidéo et de suivre l'histoire — comme se souvenir exactement de l'endroit où vous avez laissé vos clés après une journée entière d'errance — les ordinateurs ont eu du mal. Ils ont tendance à se perdre, oubliant l'intrigue ou confondant les personnages. Ce document plonge dans cette difficulté spécifique : l'intelligence artificielle peut-elle réellement construire une carte interne fiable du monde en regardant un flux vidéo, ou se contente-t-elle de deviner en fonction de l'image actuelle ?
Les chercheurs derrière cette étude, une équipe de l'Université Tsinghua, de NVIDIA et de Stanford, ont décidé de soumettre les modèles d'IA de lecture vidéo les plus intelligents au monde à un test très difficile. Ils ont créé un nouveau benchmark appelé VSI-SUPER-WILD. Considérez cela comme un « défi de survie » pour l'IA. Les tests précédents étaient comme entraîner un chien dans une pièce calme et vide avec quelques tours spécifiques. Ce nouveau test jette l'IA dans la réalité sauvage, non éditée et chaotique du monde réel. Ils ont rassemblé 442 vidéos réelles provenant d'Internet, couvrant tout, des rues animées et centres commerciaux aux hôpitaux et immeubles de bureaux. Il ne s'agit pas de courts clips assemblés ; certains durent plus de 4 heures, capturant le flux désordonné et continu de la vie.
L'objectif était de voir si ces modèles d'IA pouvaient répondre à des questions qui nécessitent une véritable « carte mentale ». Ils ont conçu quatre types de défis basés sur la façon dont les humains se souviennent des choses :
- Le test du « Quel chemin ? » : Après avoir regardé une vidéo, l'IA peut-elle dire si la caméra (la personne qui la tient) se déplaçait vers l'avant, vers l'arrière, vers la gauche ou vers la droite ?
- Le test du « Où étais-je ? » : L'IA peut-elle se souvenir de l'ordre des lieux visités, même si la caméra a pivoté et a regardé le même endroit sous un angle différent ?
- Le test du « Quand cela s'est-il passé ? » : L'IA peut-elle se souvenir exactement quand un objet spécifique, comme un sac à dos bleu, est apparu pour la première fois et quand il a disparu ?
- Le test du « Combien ? » : L'IA peut-elle compter des objets uniques (comme « combien de bornes d'incendie distinctes avons-nous croisées ? ») sans compter deux fois le même objet ?
Les résultats ont été un véritable signal d'alarme. Malgré leur incroyable avancée, les 13 modèles d'IA testés (incluant des modèles de haut niveau de Google et des projets open-source) ont donné des résultats médiocres. Le meilleur modèle n'a obtenu qu'environ 44 % de bonnes réponses au total, ce qui est à peine mieux que le hasard. Le papier suggère que ces modèles échouent parce qu'ils s'appuient sur des « raccourcis ». Au lieu de construire une carte 3D du monde, ils regardent une seule image et devinent. Par exemple, s'ils voient une rue, ils supposent que la personne marche vers l'avant parce que c'est ce qui arrive habituellement, même si la vidéo montre en réalité que la personne marche vers l'arrière.
Les chercheurs ont identifié quatre manières spécifiques dont ces modèles d'IA « s'effondrent » :
- Effondrement spatial : Si vous faites pivoter la vue de la caméra, l'IA oublie qu'il s'agit du même endroit. Elle traite une vue pivotée comme un lieu totalement nouveau, perdant ainsi son sens de l'espace.
- Raccourcis sémantiques : L'IA devine en fonction de ce que les choses ressemblent plutôt qu'en fonction de la façon dont elles bougent. Elle voit une route et suppose un « mouvement vers l'avant » sans réellement suivre le mouvement.
- Mise à jour insuffisante : L'IA est douée pour se souvenir du début d'une vidéo mais échoue à mettre à jour sa mémoire à mesure que de nouvelles informations arrivent. Elle reste bloquée sur la première impression et ignore les preuves ultérieures.
- Confusion d'instance : L'IA est perturbée par le désordre du monde réel. Si un objet est flou ou partiellement caché, elle peut penser qu'il s'agit d'un nouvel objet plutôt que du même qu'elle a vu plus tôt.
L'étude a également révélé que plus la vidéo est longue, plus les performances de l'IA diminuent. À mesure que les vidéos s'allongent (passant de 10 minutes à plus de 2 heures), la capacité des modèles à maintenir une histoire cohérente chute de manière significative. Cela suggère que, bien que l'IA s'améliore pour comprendre des instants isolés, elle manque encore de la capacité à maintenir une mémoire cohérente et à long terme du monde. Le papier conclut que pour que l'IA comprenne réellement le monde comme les humains, elle doit aller au-delà de la simple reconnaissance d'images et apprendre à construire des cartes stables et évolutives de l'espace et du temps. D'ici là, si vous demandez à une IA où vous avez laissé vos clés après une longue journée, elle pourrait simplement vous raconter une histoire qui semble bonne, mais qui n'est pas vraie.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.