← Derniers articles
💬 NLP

FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA

Le document présente FilterRAG, un cadre de génération augmentée par la récupération zero-shot qui intègre BLIP-VQA avec des sources de connaissances externes telles que Wikipedia et DBpedia afin de réduire considérablement les hallucinations et d'améliorer la précision dans le domaine du Visual Question Answering, particulièrement pour les scénarios fondés sur la connaissance et hors distribution.

Auteurs originaux : Nobin Sarwar

Publié 2026-01-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nobin Sarwar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes à une fête, et que quelqu'un vous montre la photo d'un hot-dog avec des garnitures étranges et vous demande : « Qu'est-ce que c'est ? » Si vous n'avez jamais vu cette garniture spécifique auparavant, votre cerveau pourrait essayer de deviner en se basant sur ce que vous pensez qu'elle ressemble. Vous pourriez dire : « C'est probablement de la moutarde », même s'il s'agit en réalité de relish. Dans le monde de l'intelligence artificielle, ce jeu de devinettes est appelé hallucination. L'IA est confiante, mais elle se trompe.

Ce document présente un nouveau système appelé FilterRAG pour empêcher l'IA de commettre ces erreurs confiantes, surtout lorsqu'elle rencontre des choses qu'elle n'a pas vues dans ses données d'entraînement.

Voici comment cela fonctionne, décomposé en concepts simples :

1. Le Problème : Le « Monsieur Je-Sais-Tout » qui devine

Les modèles d'IA actuels (comme ceux qui peuvent regarder une image et répondre à des questions) sont excellents pour décrire ce qu'ils voient. Mais si vous leur posez une question qui nécessite des connaissances extérieures — comme « À quel sport cette moto est-elle utilisée ? » ou « Quel est cet assaisonnement spécifique ? » — ils ont souvent du mal.

Sans moyen de vérifier les faits, ces modèles s'appuient sur leurs « souvenirs » de leur entraînement. Si les données d'entraînement sont biaisées ou incomplètes, l'IA devine. C'est comme un étudiant qui passe un examen sans avoir étudié le chapitre spécifique ; il essaie de simper une réponse qui semble bonne, mais qui est en réalité fausse.

2. La Solution : L'approche du « Bibliothécaire »

Les auteurs ont créé FilterRAG. Considérez ce système comme un étudiant qui est autorisé à utiliser une bibliothèque pendant l'examen.

  • L'Étudiant (BLIP-VQA) : C'est la partie de l'IA qui regarde l'image et lit la question. Elle est intelligente pour voir les images, mais a besoin d'aide pour les faits.
  • La Bibliothèque (Wikipedia & DBpedia) : Au lieu de deviner, le système fait une pause et court vers une bibliothèque numérique. Il recherche des faits réels sur l'image et la question.
  • Le Bibliothécaire (GPT-Neo) : C'est la partie qui lit les faits trouvés par la bibliothèque et rédige la réponse finale.

En forçant l'IA à « consulter la bibliothèque » avant de répondre, cela l'empêche de deviner et l'amène à utiliser des faits.

3. Comment cela fonctionne étape par étape

Le document décrit un processus spécifique, que nous pouvons visualiser comme la préparation d'un repas :

  1. Découper les ingrédients (La Grille) : Le système prend l'image et la découpe en une grille 2x2 (quatre carrés).
    • Pourquoi ? Si vous coupez une photo en trop de petits morceaux (comme une grille 4x4), vous perdez la vue d'ensemble, et l'IA se confond. Si vous la gardez comme un seul gros bloc, vous manquez les petits détails. La grille 2x2 est la taille « Goldilocks » (juste ce qu'il faut) — elle garde l'image cohérente tout en étant assez détaillée.
  2. Regarder l'image : Le système analyse ces quatre carrés ainsi que la question.
  3. La Recherche : Il envoie une requête à la « bibliothèque » (Wikipedia et DBpedia) pour trouver des faits pertinents. Pour la question sur la moto, il pourrait trouver des faits sur le « motocross ». Pour le hot-dog, il pourrait trouver des faits sur la « relish ».
  4. L'Assemblage : Le système combine l'image, la question et les nouveaux faits qu'il vient de trouver.
  5. La Réponse : Un modèle de langage gelé (GPT-Neo) lit toutes ces informations combinées et rédige la réponse. Parce qu'il possède les faits, il n'a pas besoin de deviner.

4. Les Résultats : Meilleur dans l'« Inconnu »

Les chercheurs ont testé cela sur un ensemble de données appelé OK-VQA, qui regorge de questions difficiles nécessitant des connaissances extérieures.

  • La Référence (Baseline) : Les modèles d'IA standards (sans la bibliothèque) ont obtenu environ 40 % de bonnes réponses sur ces questions délicates. Ils hallucinaient beaucoup.
  • FilterRAG : Le nouveau système a obtenu 36,5 % de précision.
    • Attendez, est-ce plus bas ? Le document note que bien que le chiffre brut soit légèrement inférieur à celui de certains systèmes massifs et super complexes utilisant de gros ordinateurs, FilterRAG est beaucoup plus efficace. Il équilibre la performance avec la vitesse et le coût.
    • La vraie victoire : Le système était bien meilleur dans les scénarios Out-of-Distribution (OOD). Cela signifie que lorsque l'IA voyait quelque chose de totalement nouveau ou de bizarre (comme une moto dans un contexte qu'elle n'avait pas vu auparavant), elle était moins susceptible d'halluciner. Elle restait ancrée dans les faits plutôt que d'inventer des choses.

5. Le « Score d'Ancrage » (Grounding Score)

Pour prouver que l'IA ne faisait pas que deviner, les auteurs ont utilisé un « Score d'Ancrage ». Imaginez que c'est un compteur de vérité.

  • Si l'IA dit « Moutarde » mais que la bibliothèque dit « Relish », le score chute.
  • Si l'IA dit « Relish » parce que la bibliothèque a dit « Relish », le score reste élevé.
    FilterRAG a maintenu son compteur de vérité élevé même lorsque les questions étaient difficiles, prouvant qu'il utilisait réellement les faits trouvés, et non qu'il inventait des histoires.

Résumé

FilterRAG est comme donner à une IA une fiche de révision (un moteur de recherche) pendant un examen. Au lieu de se fier à sa propre mémoire défaillante pour deviner la réponse à une question complexe sur un hot-dog ou une moto, elle cherche la réponse dans une base de données fiable. Cela l'empêche de dire avec assurance des choses erronées, ce qui la rend plus sûre et plus fiable pour une utilisation dans le monde réel lorsqu'elle peut être confrontée à des choses qu'elle n'a jamais vues auparavant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →