← Derniers articles
💬 NLP

MARCA: A Checklist-Based Benchmark for Multilingual Web Search

Ce papier présente MARCA, un benchmark bilingue (anglais et portugais) basé sur des listes de contrôle pour évaluer la fiabilité et la complétude des réponses des grands modèles de langage lors de recherches d'informations sur le web.

Auteurs originaux : Thales Sales Almeida, Giovana Kerche Bonás, Ramon Pires, Celio Larcher, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Rodrigo Nogueira, Thiago Laitz

Publié 2026-04-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Thales Sales Almeida, Giovana Kerche Bonás, Ramon Pires, Celio Larcher, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Rodrigo Nogueira, Thiago Laitz

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que les grands modèles de langage (les IA comme moi) sont des super-intellectuels qui ont lu presque tous les livres du monde. Le problème ? Ils ne se souviennent pas de tout, et parfois, ils inventent des faits (ce qu'on appelle des "hallucinations"). Pour être fiables, ils doivent pouvoir aller sur Internet, chercher les informations à jour, et les assembler correctement.

C'est là que le papier MARCA entre en jeu. Voici une explication simple de ce que les chercheurs ont fait, avec quelques images pour mieux comprendre.

1. Le Problème : L'IA est bilingue, mais pas toujours à l'aise

La plupart des tests pour voir si une IA est intelligente se font en anglais. C'est comme si on testait un chef cuisinier uniquement avec des recettes françaises, puis on s'attendait à ce qu'il cuisine aussi parfaitement un plat brésilien sans jamais avoir pratiqué.

Or, le portugais est parlé par plus de 250 millions de personnes ! Les chercheurs ont remarqué qu'on ne savait pas vraiment si les IA étaient aussi doues pour chercher des infos en portugais qu'en anglais. C'est comme si on avait un GPS très précis pour la France, mais qui se perdait complètement au Brésil.

2. La Solution : Le test "MARCA" (Le Menu de Contrôle)

Les chercheurs de Maritaca AI ont créé un nouveau test appelé MARCA. Imaginez que vous commandez un repas complexe dans un restaurant : "Je veux un plat avec 82 ingrédients différents, et je veux que chaque ingrédient soit parfaitement cuisiné."

  • Les Questions : Au lieu de demander "Qui a gagné le championnat ?", le test pose des questions complexes qui nécessitent de trouver plusieurs personnes ou objets en même temps (par exemple : "Liste tous les gagnants des catégories cinéma des 82e Golden Globes").
  • La Liste de Contrôle (Checklist) : C'est la partie géniale. Au lieu de dire "C'est bien" ou "C'est mal", le test utilise une liste de contrôle manuelle. C'est comme un inspecteur de l'hygiène dans un restaurant qui coche une case pour chaque ingrédient obligatoire.
    • Exemple : "L'IA a-t-elle mentionné le film X ?" (Oui/Non). "L'IA a-t-elle mentionné le réalisateur Y ?" (Oui/Non).
    • Cela permet de voir exactement ce qui manque, plutôt que de juste donner une note globale.

3. Deux Façons de Travailler : Le Solitaire vs L'Orchestre

Pour voir comment les IA gèrent cette tâche, ils les ont testées de deux manières différentes :

  • Le Mode "Solitaire" (Basic) : L'IA est seule. Elle doit tout faire : chercher sur Google, lire les pages, retenir tout ce qu'elle a lu, et écrire la réponse. C'est comme un étudiant qui doit réviser 10 matières différentes seul, sans aide, juste avec sa mémoire. C'est difficile de ne rien oublier !
  • Le Mode "Orchestre" (Orchestrator) : Ici, l'IA a un chef d'orchestre. Le chef ne cherche pas lui-même. Il divise le travail : il dit à un petit robot (un "sub-agent") d'aller chercher les infos sur le film A, à un autre sur le film B, etc. Ensuite, le chef rassemble toutes les réponses.
    • L'analogie : C'est la différence entre un seul cuisinier qui essaie de faire 82 plats en même temps, et une brigade de cuisine où chaque cuisinier prépare un plat spécifique, et le chef assemble le banquet.

4. Ce qu'ils ont Découvert (Les Résultats)

En testant 14 modèles d'IA (comme GPT, Gemini, Qwen, etc.), ils ont trouvé des choses intéressantes :

  • L'Orchestre gagne souvent : Pour les questions complexes avec beaucoup d'informations, le mode "Chef d'orchestre" fonctionne mieux. En divisant le travail, l'IA oublie moins de choses. C'est comme si le chef d'orchestre évitait que le cuisinier ne brûle le gâteau en essayant de faire la soupe en même temps.
  • La barrière de la langue : Certains modèles sont excellents en anglais et en portugais (ils cuisinent aussi bien dans les deux langues). D'autres, par contre, sont très forts en anglais mais perdent beaucoup de points en portugais. Parfois, ils essaient de traduire la question en anglais pour chercher, ce qui ne marche pas si l'information n'existe que dans des journaux brésiliens locaux.
  • Le coût de la précision : Plus l'IA est précise, plus elle coûte cher à faire tourner (elle consomme plus d'énergie et de temps). Mais il y a des modèles "intelligents" qui offrent un bon rapport qualité/prix, comme un bon restaurant abordable qui sert d'excellents plats.

En Résumé

Le papier MARCA nous dit : "Ne faites pas confiance aveuglément à l'IA, surtout si elle parle une autre langue ou si la question est compliquée."

Ils ont créé un outil pour vérifier si l'IA a vraiment lu les bonnes pages et n'a rien oublié, en utilisant une méthode de "check-list" très stricte. Ils ont aussi prouvé que donner à l'IA une équipe pour l'aider (le mode Orchestre) l'aide souvent à ne pas faire d'erreurs, et que la performance change beaucoup selon que l'on parle anglais ou portugais.

C'est une étape importante pour s'assurer que nos assistants numériques sont fiables, non seulement pour les anglophones, mais pour tout le monde, partout dans le monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →