TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs
L'article introduit TABVERSE, un benchmark multimodal contrôlé qui isole l'impact des formats de représentation de tableaux (tels que HTML, Markdown, LaTeX et les images) sur la performance des modèles, révélant que le texte structuré surpasse généralement les images mais que le choix de la représentation influence de manière significative les résultats à travers différentes tâches et modèles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez un tableur très important contenant des données sur la météo, les ventes ou des scores sportifs. Maintenant, imaginez que vous puissiez présenter ce même tableur à un ordinateur de quatre manières différentes :
- Sous forme d'image (comme une capture d'écran prise avec votre téléphone).
- Sous forme de code HTML (le langage utilisé par les sites web pour construire des tableaux).
- Sous forme de code LaTeX (un langage utilisé par les scientifiques pour rédiger des documents complexes).
- Sous forme de Markdown (un format de texte simple utilisé dans les applications de chat et de notes).
Le papier « TABVERSE » pose une question simple mais délicate : Est-ce que la manière dont nous présentons ce tableau à l'IA importe ?
La plupart des tests précédents donnaient à l'IA des tableaux différents et des formats différents en même temps. C'était comme demander : « Peux-tu résoudre ce problème de mathématiques ? » mais en donnant parfois le problème sur une feuille de papier, parfois sur un tableau blanc, et parfois en le chuchotant. Vous ne sauriez pas si l'IA a échoué parce que les mathématiques étaient difficiles ou parce que le tableau blanc était mal effacé.
TABVERSE corrige cela en prenant un seul et même tableau et en le présentant à l'IA sous les quatre formats simultanément. Cela permet aux chercheurs de voir exactement quel format aide l'IA à mieux réfléchir et lequel la confond.
Voici ce qu'ils ont trouvé, expliqué avec des analogies de la vie quotidienne :
1. Le test « Lire vs Regarder » (Réponse à des questions)
Les chercheurs ont posé des questions à l'IA comme : « Qui a vendu le plus ? » ou « Quel est le prix moyen ? »
- Le résultat : Généralement, l'IA est meilleure pour lire le code textuel (comme le HTML ou le Markdown) que pour regarder une image.
- L'analogie : Imaginez que vous essayiez de trouver un nom spécifique dans un annuaire.
- Format Texte : C'est comme avoir l'annuaire ouvert devant vous. Vous pouvez scanner les lettres et trouver le nom facilement.
- Format Image : C'est comme regarder une photo floue de la page de l'annuaire. Vous pouvez encore voir les mots, mais vos yeux doivent travailler plus dur pour se concentrer, et vous pourriez manquer une lettre.
- Le vainqueur : Le HTML était le format « annuaire » le plus fiable. L'IA s'y est rarement trompée. Le LaTeX était un peu plus complexe, comme un annuaire écrit avec une police de caractères très sophistiquée et stricte qui fait parfois trébucher le lecteur.
2. Le test « Lecture de carte » (Compréhension structurelle)
Ensuite, ils ont demandé à l'IA d'agir comme un cartographe. Ils ont posé des questions telles que : « Combien y a-t-il de lignes ? » ou « Que se trouve-t-il à la 3ème ligne et 2e colonne ? »
- Le résultat : L'IA est étonnamment mauvaise pour compter les lignes et trouver des emplacements spécifiques, même lorsqu'elle peut lire le texte parfaitement.
- L'analogie : Pensez à l'IA comme à un touriste avec une carte.
- Colonnes : L'IA est très douée pour compter les « rues » qui courent du nord au sud (colonnes). Il est facile de voir les lignes verticales.
- Lignes : L'IA se perd en essayant de compter les « avenues » qui courent d'est en ouest (lignes). Elle oublie souvent que le « Titre » en haut n'est pas une rue, ou elle se confond sur l'endroit où commence la première rue.
- Le rebondissement : Lorsque les chercheurs ont donné à l'IA une liste textuelle des lignes au lieu d'une image, elle s'est beaucoup mieux débrouillée pour compter. Mais même dans ce cas, elle éprouvait toujours plus de difficultés avec le concept de « ligne » qu'avec celui de « colonne ».
3. Le test « Imitation » (Reconstruction)
Enfin, ils ont montré à l'IA une image d'un tableau et lui ont demandé de reconstruire le tableau en code (HTML, LaTeX ou Markdown).
- Le résultat : L'IA est très douée pour copier la forme du tableau (les cases et les lignes) mais très mauvaise pour copier parfaitement le contenu, surtout en LaTeX.
- L'analogie : Imaginez demander à un enfant de copier le dessin d'une maison.
- Topologie (Forme) : L'enfant dessine un carré pour la maison et un triangle pour le toit. Il a bien saisi la forme ! (C'est ce que l'article appelle la « Topologie »).
- Contenu (Détails) : Mais l'enfant fait une faute d'orthographe sur le mot « GARAGE » ou dessine la porte au mauvais endroit.
- Le problème LaTeX : Demander à l'IA de reconstruire le tableau en LaTeX, c'est comme demander à l'enfant de dessiner la maison en utilisant uniquement un ensemble de règles très strictes et compliquées. Si l'enfant commet une seule petite erreur dans les règles, tout le dessin s'effondre et ne fonctionne plus. Le papier a constaté que de nombreux modèles d'IA produisaient du code LaTeX « cassé » que les ordinateurs ne pouvaient pas lire, même si le dessin semblait correct.
La conclusion principale
Le papier conclut que la manière dont vous fournissez les données à une IA est aussi importante que les données elles-mêmes.
- Ne supposez pas : Vous ne pouvez pas supposer qu'une IA comprend un tableau simplement parce qu'elle a donné la bonne réponse à partir d'une image.
- Le format compte : Si vous voulez qu'une IA effectue des calculs complexes ou trouve des lignes spécifiques, lui donner un fichier texte propre (comme le HTML) est généralement préférable à lui montrer une capture d'écran.
- L'angle mort des « Lignes » : Même les modèles d'IA les plus intelligents ont encore du mal à garder une trace de quelle ligne est laquelle, se confondant souvent avec les en-têtes ou comptant mal les lignes.
En résumé, TABVERSE est comme un nouveau permis de conduire pour l'IA. Au lieu de simplement vérifier si la voiture peut conduire, il teste si la voiture conduit mieux sur une autoroute lisse (HTML), sur une route de terre cahoteuse (LaTeX) ou en regardant une carte plutôt que la route (Images). Les résultats montrent que la « route » sur laquelle l'IA circule change ses performances.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.