← Derniers articles
💬 NLP

When Tables Go Crazy: Evaluating Multimodal Models on French Financial Documents

Ce papier présente Multimodal Finance Eval, le premier benchmark multimodal pour l'évaluation de la compréhension des documents financiers français, révélant que bien que les modèles vision-langage excellent dans l'extraction de texte et de tableaux, ils peinent à interpréter les graphiques et deviennent rapidement incohérents lors de dialogues interactifs complexes.

Auteurs originaux : Virginie Mouilleron, Théo Lasnier, Anna Mosolova, Djamé Seddah

Publié 2026-03-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Virginie Mouilleron, Théo Lasnier, Anna Mosolova, Djamé Seddah

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

📄 Quand les Tableaux Deviennent Fous : Le Test de Vérité des IA sur les Documents Financiers Français

Imaginez que vous êtes un conseiller financier. Vous avez devant vous des centaines de pages de documents complexes : des prospectus d'investissement, des tableaux de chiffres, des graphiques colorés et du texte juridique dense. Votre client vous demande : "Combien je vais payer de frais si j'investis 10 000 € ?" ou "Ce graphique montre-t-il que le fonds va bien ?".

Aujourd'hui, on utilise des Intelligences Artificielles (IA) pour nous aider à lire ces documents. Mais est-ce qu'elles sont vraiment fiables ? C'est exactement ce que les auteurs de cet article ont voulu tester.

Voici ce qu'ils ont fait, expliqué simplement :

1. Le Problème : Les IA sont des "Super-Lecteurs" mais des "Mauvais Dessinateurs"

Les chercheurs ont créé un nouveau test (un "examen") spécial pour les IA, appelé MULTIMODAL FINANCE EVAL.

  • Le contexte : Ils ont pris de vrais documents financiers français (pas de l'anglais, car c'est souvent là que ça coince).
  • Le défi : Ces documents sont un mélange bizarre de texte, de tableaux Excel et de graphiques. C'est comme si on demandait à un étudiant de faire un examen où il doit lire un roman, résoudre un problème de maths sur un tableau blanc et interpréter un dessin en même temps.

2. L'Expérience : On a mis 6 IA à l'épreuve

Ils ont pris 6 IA de différentes tailles (de la "petite" à la "géante") et leur ont posé 1 204 questions.

  • Les questions : Certaines étaient simples ("Quel est le nom du fonds ?"), d'autres demandaient de lire un tableau ("Quel est le taux d'intérêt en 2023 ?"), et d'autres encore de regarder un graphique ("La courbe monte-t-elle ?").
  • La conversation : Le plus intéressant, c'est qu'ils ont aussi fait jouer des IA à un jeu de rôle : "Je te pose une question, tu réponds, puis je te pose une deuxième question basée sur ta réponse".

3. Les Résultats : Une histoire de deux visages

✅ Le Super-Héros (Texte et Tableaux)
Quand il s'agit de lire du texte ou de chercher un chiffre dans un tableau bien rangé, les IA sont incroyables. Elles réussissent 85 à 90 % des questions. C'est comme un bibliothécaire qui trouverait le livre exact en une seconde.

❌ Le Super-Méchant (Les Graphiques)
Dès qu'il faut regarder un graphique (une courbe, un camembert), les IA deviennent très mauvaises. Elles réussissent à peine 34 à 62 % des questions.

  • L'analogie : C'est comme si vous donniez une carte routière à quelqu'un qui sait lire les mots, mais qui ne comprend pas les symboles. Il voit les noms des villes, mais ne comprend pas que la ligne rouge signifie "route fermée". Les IA ont du mal à "voir" la tendance dans un dessin.

💥 Le Catastrophe Silencieuse (La Conversation)
C'est ici que ça devient vraiment inquiétant.
Quand on pose une question simple, l'IA répond bien. Mais si on lui pose une deuxième question basée sur sa première réponse, et une troisième basée sur la deuxième... tout s'effondre.

  • L'analogie : Imaginez un jeu du "téléphone arabe". Si la première personne dit "Je vais à la plage" et que l'IA entend "Je vais à la plage", tout va bien. Mais si l'IA fait une petite erreur au début (elle dit "Je vais à la plage" alors qu'elle voulait dire "Je vais à la montagne"), et que vous lui demandez "Quel est le prix du billet pour la montagne ?", elle va continuer à inventer des réponses sur la montagne, même si vous lui montrez un document qui parle de la plage.
  • Le résultat : Peu importe la taille de l'IA (même les plus grosses), dès qu'elles font une erreur au début d'une conversation, elles s'enferrent et leur score chute à environ 50 % (comme si elles devinaient à pile ou face).

4. Pourquoi est-ce important ?

Dans la finance, une erreur n'est pas juste une mauvaise note.

  • Si un conseiller utilise une IA pour dire à un client combien il va gagner, et que l'IA a "halluciné" un chiffre à cause d'une erreur précédente, le client peut perdre de l'argent.
  • L'article nous dit : "Attention ! Ces IA sont excellentes pour copier-coller des infos, mais elles sont fragiles quand il faut raisonner étape par étape."

En résumé

Les chercheurs ont créé un examen difficile pour les IA sur des documents français.

  • Ce qu'elles savent faire : Lire et chercher des infos (Top niveau !).
  • Ce qu'elles ne savent pas faire : Comprendre les graphiques et ne pas se tromper en discutant longuement (Niveau catastrophique).

La leçon : On ne peut pas encore faire confiance aveuglément à une IA pour gérer des conversations financières complexes. Il faut toujours un humain pour vérifier, surtout si la conversation dure plus de deux minutes !

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →