Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
Cet article propose le Refusal-Calibrated Group Relative Policy Optimization (RC-GRPO), une stratégie d'apprentissage par renforcement qui permet aux modèles de langage de grande taille multimodaux de rejeter efficacement les objets inexistants dans la compréhension de références généralisées sans compromettre leur précision de localisation sur les cibles existantes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseigniez à un robot à jouer à un jeu de « Je vois » avec un humain. L'humain pointe une image et dit : « Trouve la balle rouge. » Si la balle rouge est présente, le robot doit la pointer précisément. Mais que se passe-t-il si l'humain dit : « Trouve la balle rouge », alors que l'image montre en réalité un chat bleu ? Un robot intelligent devrait dire : « Je ne trouve pas de balle rouge ici ; il n'y en a pas. » Cependant, beaucoup de cerveaux informatiques ultra-intelligents d'aujourd'hui (appelés Modèles de Langage Multimodaux de Grande Taille) sont comme des élèves enthousiastes qui sont terrifiés à l'idée d'avoir tort. Ils sont si désespérés de donner une réponse que, lorsqu'ils ne voient pas la balle rouge, ils se contentent de deviner quand même, en pointant le chat bleu et en affirmant : « C'est ici ! » C'est ce qu'on appelle une « hallucination » : inventer des faits qui ne sont pas vrais.
Cet article s'attaque à une version spécifique et délicate de ce problème appelée « Compréhension de l'Expression de Référence Généralisée ». C'est une façon sophistiquée de dire : « Le robot peut-il trouver l'objet s'il est présent, et peut-il honnêtement dire "Je ne le vois pas" s'il ne l'est pas ? » Les chercheurs ont découvert que si ces robots sont excellents pour trouver des choses, ils sont terribles pour admettre quand des choses sont manquantes. Si vous entraînez simplement les robots à dire « non » plus souvent, ils deviennent trop craintifs et cessent de trouver les choses qui sont pourtant bien présentes. L'équipe avait besoin d'un moyen d'enseigner au robot à dire « non » uniquement quand c'est vraiment nécessaire, sans qu'il oublie comment dire « oui » quand il a raison.
Les auteurs de cet article proposent une nouvelle méthode d'entraînement ingénieuse appelée Refusal-Calibrated Group Relative Policy Optimization (RC-GRPO). Voyez le processus d'apprentissage du robot comme un jeu de « Chaud ou Froid ». Habituellement, le robot reçoit un score basé sur la proximité de sa supposition. Mais quand l'objet est absent, le robot continue de deviner de toute façon, donc il n'apprend jamais la bonne réponse. La première astuce des chercheurs a été de forcer le robot à dire « Aucun, je ne le vois pas » pendant ses séances d'entraînement, même s'il voulait deviner. Cela a donné au robot une « récompense » claire pour avoir dit la chose juste lorsque l'objet était manquant.
Cependant, ils ont réalisé que s'ils complimentaient simplement le robot pour avoir dit « Aucun », celui-ci commencerait à dire « Aucun » pour tout, même quand l'objet était présent. Pour corriger cela, ils ont ajouté une règle spéciale : si le robot dit « Aucun » alors qu'un objet est réellement présent, il reçoit une grosse pénalité. C'est comme dire au robot : « Il est acceptable de dire que tu ne vois pas la balle si la balle n'est pas là, mais si tu dis que tu ne la vois pas alors qu'elle est juste devant toi, tu perds des points. » Ils ont également ajouté une deuxième étape où le robot doit expliquer pourquoi il pense que l'objet est manquant (par exemple, « Je ne vois pas de balle rouge car il n'y a qu'un chat bleu »). Cela force le robot à réellement comprendre l'image plutôt que de simplement mémoriser un motif.
Les résultats montrent que cette méthode fonctionne très bien. Lorsqu'ils ont testé leur nouvelle méthode sur trois tests différents et exigeants, les robots sont devenus bien meilleurs pour trouver des objets et pour refuser de deviner quand ils n'étaient pas là. Par exemple, lors d'un test, leur méthode a amélioré la précision globale du robot de 45 % à 62 %, et elle a même surpassé d'autres méthodes avancées par une marge significative. L'article suggère que cette approche aide le robot à trouver un équilibre parfait : il cesse d'inventer de faux emplacements pour les objets manquants, mais ne perd pas sa capacité à trouver les objets réels. C'est un pas vers une IA qui n'est pas seulement intelligente, mais aussi honnête sur ce qu'elle voit et sur ce qu'elle ne voit pas.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.