← Derniers articles
💻 computer science

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa introduit une nouvelle famille de modèles vision-langage fondés sur des mécanismes de diffusion discrète qui exploitent le décodage parallèle et le contexte bidirectionnel pour atteindre des performances compétitives, une inférence plus rapide et une meilleure contrôlabilité par rapport aux modèles autorégressifs traditionnels.

Auteurs originaux : Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

Publié 2026-07-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les ordinateurs peuvent « voir » et « parler » en même temps. C'est le domaine des modèles vision-langage (VLM), ces assistants IA super intelligents capables de regarder la photo d'un coucher de soleil et d'en écrire un poème, ou d'examiner un graphique complexe et d'en expliquer les tendances. Pendant des années, la manière standard dont ces modèles réfléchissent est comparable à un étudiant passant un examen : ils répondent un mot à la fois, strictement de gauche à droite. Ils écrivent « Le », puis « ciel », puis « est », sans jamais revenir en arrière pour modifier un mot précédent. Bien que cela fonctionne bien, c'est lent car ils ne peuvent pas écrire en parallèle, et c'est rigide ; s'ils se trompent sur le premier mot d'une phrase, ils ne peuvent pas facilement revenir en arrière pour le corriger sans tout recommencer.

Mais et s'il y avait une autre façon de faire ? Imaginez qu'au lieu d'écrire une phrase mot par mot, vous commenciez avec une page blanche remplie de points d'interrogation et que vous remplissiez lentement les blancs, en décidant de l'emplacement de chaque mot en même temps, en affinant constamment vos choix jusqu'à ce que l'image soit claire. C'est l'idée derrière les « modèles de diffusion ». À l'origine célèbres pour créer de magnifiques images à partir de bruit, les chercheurs ont récemment tenté d'utiliser cette approche de « remplissage de blancs » pour le texte. La grande question est la suivante : pouvons-nous combiner cette façon de penser flexible et parallèle avec la capacité de voir des images ? Si nous pouvions, nous pourrions obtenir une IA non seulement plus intelligente pour suivre des règles strictes (comme écrire un poème où chaque vers commence par une lettre spécifique), mais aussi beaucoup plus rapide car elle n'aurait pas besoin d'attendre qu'un mot soit terminé avant de commencer le suivant.

Voici entré LaViDa (Large Vision-Language Diffusion Model), une nouvelle famille de modèles d'IA introduite par des chercheurs de l'UCLA, de Panasonic, d'Adobe et de Salesforce. Considérez LaViDa comme le premier « artiste polyvalent » qui utilise la méthode de diffusion pour comprendre les images et écrire à leur sujet. Au lieu d'écrire une histoire un mot à la fois comme un robot traditionnel, LaViDa commence par une toile blanche de « masques » (des espaces réservés) et révèle progressivement la réponse, remplissant les blancs d'une manière qui lui permet de considérer l'ensemble de la phrase d'un seul coup.

Les chercheurs ont découvert que cette approche possède certains superpouvoirs. Parce que LaViда peut observer la structure entière de la phrase avant de la finaliser, il est incroyablement doué pour les tâches qui exigent des règles strictes, comme compléter un poème où chaque vers doit commencer par une lettre spécifique. Lors des tests, il a écrasé la concurrence sur ces tâches « contraintes », améliorant ses performances de 59 % par rapport aux meilleurs modèles standards. Il offre également un « curseur de vitesse » unique aux utilisateurs : vous pouvez lui dire d'être super rapide en remplissant moins de blancs à la fois, ou d'être de super haute qualité en prenant plus d'étapes pour affiner la réponse. Sur le légendage d'images, il a réussi à être presque 2 fois plus rapide que ses rivaux tout en écrivant de meilleures descriptions (obtenant un score de +4,1 points sur une métrique de qualité appelée CIDEr).

Cependant, l'article note également que cette nouvelle méthode n'est pas une baguette magique qui résout tout instantanément. Les chercheurs ont dû inventer des astuces ingénieuses pour qu'elle fonctionne bien. Pour l'une d'elles, ils ont créé une technique de « masquage complémentaire », qui revient à donner au modèle deux versions différentes d'un puzzle à résoudre en même temps afin qu'il ne manque aucun indice important. Ils ont également construit un système « Prefix-DLM », qui agit comme un raccourci intelligent, permettant au modèle de se souvenir de l'image et de la question sans avoir à les relire à chaque fois qu'il devine un nouveau mot.

Malgré ces succès, l'article souligne prudemment que LaViDa a encore une marge de progression. Bien qu'il batte d'autres modèles sur de nombreux tests de raisonnement et de connaissances générales, il éprouve parfois des difficultés à lire le texte minuscule à l'intérieur des images (OCR) car il a dû compresser les détails de l'image pour les faire tenir dans sa mémoire. Les auteurs suggèrent que, bien que les modèles de diffusion soient une alternative puissante et prometteuse à l'approche standard « un mot à la fois », ils apprennent encore comment passer à l'échelle supérieure pour égaler les modèles d'IA les plus vastes et les plus gourmands en données. En fin de compte, LaViDa prouve que la méthode du « remplissage de blancs » n'est pas seulement destinée à créer des images ; elle peut être une façon forte, flexible et rapide pour les ordinateurs de comprendre notre monde visuel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →