← Derniers articles
💻 computer science

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

Cet article introduit le Logit Lens Loss (LLL), un objectif auxiliaire léger qui améliore l'explicabilité au niveau des patchs dans les modèles vision-langage en alignant les plongements de jetons visuels avec leurs concepts textuels correspondants, améliorant ainsi l'ancrage et réduisant les hallucinations sans nécessiter de changements architecturaux ou de réentraînement intensif.

Auteurs originaux : Parsa Esmaeilkhani, Longin Jan Latecki

Publié 2026-08-12
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Parsa Esmaeilkhani, Longin Jan Latecki

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un ami robot super intelligent capable de regarder une image et de vous raconter une histoire à son sujet. Ce robot est construit à partir de deux parties très différentes : une paire d'« yeux » qui voit l'image comme une grille de minuscules carrés colorés (des patchs), et un « cerveau » qui est un expert pour écrire des histoires en utilisant des mots. Quand vous demandez au robot : « Où est le chat ? », ses yeux envoient un signal pour chaque petit carré de la photo à son cerveau. Le cerveau mélange ensuite ces signaux d'image avec ses propres signaux de mots pour trouver la réponse.

Le problème est qu'au fur et à mesure que ces signaux d'image circulent dans le cerveau, ils se perdent un peu dans la foule. Le cerveau est si doué pour parler qu'il commence parfois à ignorer les détails spécifiques des carrés de l'image, ou pire, il commence à mélanger les signaux de l'image si intensément avec les signaux de mots que le robot oublie quel carré appartient réellement au chat. Il peut deviner « chat » correctement, mais il ne fait que deviner en se basant sur les mots, et non en voyant réellement le chat dans la photo. C'est un problème majeur car si nous voulons faire confiance à ces robots, ou si nous voulons savoir pourquoi ils pensent qu'il y a un chat dans une image, nous devons être capables de voir exactement quelle partie de l'image ils regardent. Si le robot ne peut pas pointer du doigt le chat, il est peut-être en train d'halluciner — en inventant des choses qui n'existent pas.

Ce document s'attaque précisément à ce problème. Les auteurs, Parsa Esmaeilkhani et Longin Jan Latecki, ont remarqué que dans les modèles vision-langage (VLM) modernes, la connexion entre un patch d'image spécifique et le mot qui le décrit devient faible et floue à mesure que les données traversent le système. Pour correr cela, ils ont inventé une nouvelle astuce d'entraînement appelée Logit Lens Loss (LLL).

Considérez le cerveau du robot comme une immense bibliothèque où chaque livre représente un mot. Habituellement, le robot apprend seulement à choisir le bon livre pour parler ensuite (comme répondre à une question). Les auteurs ont réalisé que si le robot regarde un patch de chat, ce patch spécifique devrait murmurer « chat » à la bibliothèque, même avant que le robot ne décide de parler. Ils ont créé une nouvelle règle d'entraînement : chaque fois que le robot voit un patch qui contient un chat, ils forcent ce patch à prédire fortement le mot « chat » dans le vocabulaire de la bibliothèque. Ils appellent cela « Logit Lens Loss » car ils utilisent un outil appelé « Logit Lens » pour jeter un coup d'œil à l'intérieur du cerveau du robot et voir quels mots les patchs d'images pensent secrètement.

Le meilleur dans tout cela ? Ils n'ont pas eu à reconstruire le robot ni à ajouter de nouvelles pièces. Ils ont simplement ajusté les règles d'entraînement. Lorsqu'ils ont testé cette nouvelle règle sur deux robots populaires (LLaVA-v1.5 et Qwen2.5-VL), les résultats ont été comme l'allumage d'un projecteur. Avant, la « carte de confiance » du robot (une carte thermique montrant où il pense que l'objet se trouve) était floue et éparpillée, comme une fenêtre embrumée. Après avoir utilisé leur nouvelle règle, la carte est devenue nette et précise, éclairant exactement là où se trouvait le chat.

Le document montre que ce correctif simple accomplit un travail colossal. Il rend les robots bien meilleurs pour trouver des objets dans les images (le grounding), réduit les moments où ils inventent des objets qui ne sont pas là (les hallucinations), et les aide même à pointer des objets dans de nouvelles images qu'ils n'ont jamais vues auparavant. Étonnamment, cela n'a pas rendu les robots moins bons pour répondre à des questions ou raconter des histoires ; en fait, cela a maintenu leurs compétences linguistiques tout aussi fortes. Les auteurs suggèrent qu'en gardant les signaux d'image liés à leur signification d'origine, les robots deviennent à la fois plus intelligents et plus honnêtes sur ce qu'ils voient. C'est un peu comme apprendre à un étudiant non pas seulement à mémoriser la réponse, mais à réellement comprendre la carte qu'il regarde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →