← Derniers articles
⚡ electrical engineering

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

Le document présente Audio-Visual Flamingo (AV-Flamingo), un grand modèle de langage entièrement ouvert et à la pointe de l'état de l'art, conçu pour la compréhension et le raisonnement conjoints sur des vidéos réelles longues et complexes en exploitant un nouvel ensemble massif de données, un programme d'entraînement progressif en trois étapes et un nouveau cadre de chaîne de pensée temporellement entrelacé.

Auteurs originaux : Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon K
Publié 2026-07-20
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un film. Vous voyez les visages des acteurs, le décor et l'action, mais vous entendez aussi les dialogues, la musique de fond, le bruit des pas et le bruissement des feuilles. Pendant longtemps, les ordinateurs ont été comme des personnes qui regardaient un film les yeux fermés, se contentant d'écouter la piste audio, ou inversement. Ils étaient excellents pour reconnaître un chat sur une image ou transcrire un discours, mais ils avaient du mal à comprendre la scène entière où un chat miaule tout en traversant l'écran. Ce domaine d'étude est appelé l'intelligence « multimodale », où les machines tentent de combiner différents sens — comme la vue et l'ouïe — pour comprendre le monde comme le font les humains. La grande question que les chercheurs se posent est la suivante : pouvons-nous construire une IA qui ne se contente pas de regarder une vidéo ou d'écouter un podcast, mais qui réfléchit réellement à la manière dont le son et l'image fonctionnent ensemble, surtout quand l'histoire est longue et complexe ?

Voici Nemotron-Labs-Audio-Visual Flamingo (ou AV-Flamingo pour faire court), un nouveau type de cerveau artificiel conçu par des chercheurs de NVIDIA et de l'Université du Maryland. Considérez les précédentes IA vidéo comme des étudiants qui ne peuvent lire qu'une seule page d'un manuel scolaire et répondre à une question rapide à son sujet. Si vous leur demandiez de résumer un film entier ou d'expliquer une scène complexe qui évolue sur 15 minutes, ils s'y perdraient, oublieraient le début ou confondraient les personnages. AV-Flamingo est différent. C'est comme un étudiant hyper attentif capable de regarder un film entier, d'écouter la bande sonore, puis de s'asseoir pour rédiger une dissertation détaillée sur la façon dont la musique a changé l'ambiance, pourquoi un personnage a réagi d'une certaine manière, ou exactement quand un son spécifique s'est produit par rapport à un événement visuel.

Les chercheurs ont découvert que pour y parvenir, ils ne pouvaient pas simplement nourrir l'IA avec les mêmes anciennes données. Ils ont dû lui enseigner trois nouveaux tours. Premièrement, ils ont créé une immense bibliothèque d'environ 7 millions d'exemples vidéo du monde réel (incluant 4,8 millions de paires question-réponse) spécifiquement conçus pour tester la capacité de l'IA à lier le son et la vue au fil du temps. Ils ont appelé cela Audio-Visual-Skills. Deuxièmement, ils ne l'ont pas jetée directement dans le grand bain ; ils ont utilisé un « curriculum » qui commençait par des clips courts pour enseigner les compétences de base, puis passait progressivement à des vidéos plus longues et plus complexes pour lui apprendre à suivre une histoire au fil du temps. Troisièmement, et de manière très ingénieuse, ils ont appris à l'IA à utiliser un processus de réflexion appelé Temporal Audio-Visual Interleaved Chain-of-Thought. Imaginez l'IA regardant une vidéo et faisant une pause toutes les quelques secondes pour dire : « D'accord, à cette seconde exacte, le tambour a frappé, et ensuite, le personnage a sauté ». Cela aide l'IA à ancrer ses pensées dans le temps, afin qu'elle ne se confonde pas sur ce qui s'est passé en premier ou en dernier.

Les résultats sont assez impressionnants. Testé sur plus de 15 défis différents — allant de la compréhension de la musique et de la parole à l'analyse de vidéos longues et à la réponse à des questions complexes — AV-Flamingo a surpassé les autres modèles open-source de taille similaire par une marge claire. En fait, il a même réussi à rivaliser avec, et parfois à battre, des modèles « fermés » (dont on ne peut pas voir le code) beaucoup plus grands et coûteux qui sont actuellement les meilleurs au monde. L'article suggère que ce modèle est particulièrement doué pour gérer des vidéos réelles longues et complexes où les indices sont dispersés dans le temps, prouvant qu'avec les bonnes données et les bonnes méthodes d'entraînement, l'IA open-source peut rattraper les géants. C'est un grand pas vers la capacité des ordinateurs à véritablement « regarder et écouter » le monde, plutôt que de simplement le fixer du regard.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →