← Derniers articles
💻 computer science

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP est une méthode entièrement de type « forward-only » et efficace en termes de requêtes qui optimise les prompts profonds dans les branches vision et texte de modèles CLIP gelés en utilisant l'approximation stochastique par perturbation simultanée, surpassant les approches d'ordre zéro existantes sur de multiples benchmarks en exploitant la reparamétrisation de bas rang cross-modale, le momentum de correction de gradient et un calendrier de rang dynamique.

Auteurs originaux : Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

Publié 2026-08-11
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un robot super intelligent qui a lu tout l'internet et a appris à comprendre à la fois les images et les mots. C'est comme un bibliothécaire de génie qui peut instantanément vous dire de quoi parle une photo rien qu'en la regardant, ou décrire une scène avec des phrases parfaites. Ce robot s'appelle un Modèle Vision-Langage, et il est incroyablement puissant. Mais voici le hic : d'habitude, pour apprendre au robot un nouveau tour — comme reconnaître un type spécifique de fleur rare ou un scanner médical étrange — vous devez le laisser « recâbler » son propre cerveau. Ce processus est lourd, comme si l'on essayait de réorganiser une immense bibliothèque alors qu'elle est encore ouverte au public, et cela nécessite énormément de puissance de calcul et de mémoire.

Parfois, pourtant, vous ne pouvez pas faire cela. Peut-être que le robot vit sur un petit appareil minuscule alimenté par une batterie dans votre poche, ou peut-être que c'est un service secret à qui vous ne pouvez parler qu'à travers une fenêtre de chat qui ne vous permet pas de voir comment il réfléchit. Dans ces cas, vous ne pouvez pas recâbler le cerveau ; vous pouvez seulement lui murmurer de nouvelles instructions. C'est ce qu'on appelle le « prompt tuning » (ajustement par invite). Au lieu de changer le cerveau du robot, vous lui donnez un ensemble spécial d'indices ou de « prompts » pour l'aider à résoudre un nouveau puzzle. Le problème est que trouver les indices parfaits nécessite généralement beaucoup de tâtonnements et d'essais, et si vous ne pouvez pas voir les pensées internes du robot (les gradients), c'est comme essayer de trouver une aiguille dans une botte de foin les yeux bandés. Vous pourriez avoir besoin de milliers de tentatives pour réussir, ce qui est trop lent et trop coûteux pour la vie réelle.

C'est là qu'intervient une nouvelle méthode appelée ZOMP. Considérez ZOMP comme un détective ingénieux qui résout le problème de « l'aiguille les yeux bandés » en changeant la façon dont il cherche. Au lieu de deviner chaque détail de l'indice d'un seul coup, ZOMP utilise une stratégie intelligente pour deviner d'abord les parties les plus importantes, puis remplit lentement le reste.

Voici comment cela fonctionne, en utilisant quelques métaphores amusantes :

L'astuce du « Plan Partagé »
D'habitude, quand vous essayez d'apprendre de nouvelles choses au robot, vous devez écrire des indices séparés pour ses « yeux » (vision) et sa « voix » (texte). Si vous essayez d'écrire des indices profonds et complexes pour les deux en même temps, le nombre de possibilités devient si énorme que la recherche les yeux bandés s'y perd. ZOMP change la donne en disant : « Utilisons un plan partagé ». Imaginez que les indices pour les yeux et la voix sont tous deux construits à partir du même petit ensemble de briques LEGO. Vous n'avez qu'à découvrir comment assembler ces quelques briques, et elles construisent automatiquement les bons indices pour les yeux et la voix en même temps. Cela garde l'espace de recherche petit et gérable, même si les indices sont profonds et complexes.

L'expansion « Indexée par le Budget »
Même avec le plan partagé, essayer d'assembler toutes les briques à la fois est encore trop difficile quand on est les yeux bandés. ZOMP utilise un système de « budget ». Imaginez que vous avez un nombre limité de tentatives (requêtes) pour trouver le meilleur indice. ZOMP commence par ne s'autoriser à jouer qu'avec la toute première brique, la plus importante. Il trouve la bonne direction pour cette pièce unique. Une fois qu'il est sûr de sa voie, il « débloque » la brique suivante, puis la suivante, élargissant lentement la recherche seulement lorsqu'il a une direction fiable. C'est comme apprendre à conduire : vous commencez dans un parking vide (un espace de recherche minuscule), vous vous mettez à l'aise, puis vous pasz lentement dans les rues du quartier, et enfin sur l'autoroute. Vous n'essayez pas de conduire sur l'autoroute dès votre premier jour.

La Mémoire de « l'Élan »
Parce que la recherche se fait les yeux bandés, les indices que l'on reçoit sont souvent bruyants et instables, comme si l'on marchait sur un bateau dans une mer agitée. ZOMP ajoute une mémoire d'« élan » (momentum). Considérez cela comme un surfeur qui ne se contente pas de réagir à chaque vague, mais qui se souvient de la direction générale vers laquelle l'océan pousse. Même si une vague le fait dévier sur le côté, il continue d'avancer dans la bonne direction parce qu'il se souvient où il allait. Cela aide le robot à ignorer le bruit et à rester sur le chemin qui fonctionne réellement.

Les Résultats
Les chercheurs ont testé cette méthode sur 13 défis différents, allant de l'identification de fleurs à la reconnaissance de véhicules sur des images satellites. Ils ont donné à ZOMP et aux autres méthodes exactement le même nombre de tentatives (5 000 requêtes). Les résultats ont montré que ZOMP trouvait systématiquement de meilleurs indices que les autres méthodes. Il n'était pas seulement légèrement meilleur ; il était souvent nettement plus précis, surtout sur les tâches difficiles où le robot rencontre habituellement des difficultés.

Ce qui est vraiment génial, c'est que ZOMP ne s'est pas contenté de devenir meilleur pour la tâche spécifique sur laquelle il a été entraîné. Il est également devenu meilleur pour gérer de nouvelles situations étranges qu'il n'avait jamais vues auparavant (comme reconnaître le croquis d'un objet au lieu d'une photo). Cela suggère qu'en cherchant avec soin et efficacité, ZOMP a appris une manière plus intelligente d'utiliser les connaissances existantes du robot, plutôt que de simplement mémoriser les exemples d'entraînement.

En résumé, ZOMP prouve que vous n'avez pas besoin de recâbler le cerveau du robot pour le rendre plus intelligent. En utilisant un plan partagé, en élargissant la recherche lentement et en gardant une mémoire constante de la direction, vous pouvez apprendre de nouveaux tours à une IA puissante même lorsque vous ne pouvez que lui murmurer des instructions et que vous disposez d'un nombre limité d'essais. C'est une façon pratique et efficace de tirer le meilleur parti de ces modèles géants sans avoir besoin d'un supercalculateur dans votre poche.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →