Résumé Technique : SciFigQual-Bench
Énoncé du Problème
Les paradigmes existants d'évaluation de la qualité d'image (IQA) sont principalement conçus pour les photographies naturelles ou le contenu généré par IA, s'appuyant sur des statistiques de bas niveau ou des métriques perceptuelles (ex. : PSNR, SSIM, NIQE) qui évaluent la clarté visuelle de manière isolée. Ces méthodes ne parviennent pas à répondre aux exigences uniques des figures scientifiques, dont la valeur évaluative découle de leur intégration dans l'intégralité du manuscrit académique.
Les références académiques actuelles pour les graphiques et les diagrammes sont limitées par plusieurs facteurs :
- Isolement : Elles évaluent souvent les figures comme des extractions isolées, déconnectées des légendes et des paragraphes citants.
- Focus de Surface : Elles privilégient les comparaisons de surface visuelle ou la précision du questionnement visuel (VQA) plutôt qu'une évaluation qualitative holistique.
- Absence de Contexte : Elles ne parviennent pas à vérifier l'alignement avec la légende, la pertinence de la citation, ou le risque de tromperie visuelle (ex. : troncature d'axes, absence de lignes de base) qui ne peut être détecté qu'en recoupant la figure avec le texte.
La qualité d'une figure scientifique est intrinsèquement tri-modale, dépendant du contenu visuel, de la légende de la figure et des affirmations faites dans les paragraphes citants du manuscrit. Les approches à modalité unique ou faiblement couplées existantes ne peuvent pas évaluer efficacement ces interdépendances.
Méthodologie
1. Construction du Jeu de Données SciFigQual-Bench
Les auteurs proposent SciFigQual-Bench, un benchmark conçu pour évaluer les images scientifiques dans le contexte complet de leur manuscrit.
- Source de Données : Le jeu de données comprend 7 609 figures curatées, extraites de 1 144 articles qualifiés provenant de conférences de premier plan en informatique (ACL, EMNLP, ICML, NeurIPS) publiés entre 2020 et 2025.
- Liaison de Contexte : Contrairement aux jeux de données précédents, chaque instance de figure est strictement liée à son PDF source. Le pipeline extrait l'image de la figure (I), sa légende (c), et les paragraphes citants spécifiques (T) du corps du texte en utilisant une résolution pilotée par index (correspondance des indices de figures dans le PDF).
- Annotation : 6 308 instances ont été scorées de manière indépendante par plusieurs experts du domaine sur une échelle unifiée de 1 à 10 selon cinq dimensions orthogonales :
- Clarté Visuelle (VC) : Lisibilité du texte, des marques et du codage.
- Structure et Mise en Page (SL) : Composition, organisation des panneaux et évitement du « chartjunk ».
- Cohérence de la Légende (CC) : Alignement entre la légende et le contenu visible.
- Cohérence du Contexte (CTX) : Alignement entre les affirmations dans le texte citant et ce que la figure soutient.
- Risque de Tromperie (MR) : Probabilité de mauvaise interprétation par le lecteur (ex. : axes tronqués).
- Mécanisme de Verrouillage (Gating) : Pour éviter de pénaliser l'absence de métadonnées, le benchmark utilise une stratégie de verrouillage de preuve L1. Si une légende ou un texte citant est absent, la dimension correspondante (CC ou CTX) est marquée comme nulle et exclue du calcul du score global.
2. SFQ-Agent : Évaluation Cross-Modale par Étapes
Pour permettre une évaluation automatisée qui imite le raisonnement d'un expert humain, les auteurs introduisent le SFQ-Agent, un juge cross-modal par étapes conçu pour être auditable et fondé sur des preuves. Il évite la nature « boîte noire » des modèles de langage visuels (VLM) monolithiques en séparant la collecte de preuves de la fusion.
L'agent opère en quatre étapes :
- Étape 0 (Verrouillage) : Détermine quelles dimensions sont évaluables en fonction de la présence de I, c et T.
- Étape 1 (Preuve Visuelle) : Un module de vision (utilisant PaddleOCR-VL et des descripteurs de vision classique) extrait les faits visuels (régions de texte, mise en page, unités d'axes) pour scorer VC et SL. Crucialement, le module de langage n'accède pas aux pixels à ce stade.
- Étape 2 (Preuve Linguistique) : Un LLM analyse uniquement la légende et le texte citant (sans entrée de pixels) pour extraire les affirmations textuelles et les violations de règles afin de soutenir le scoring CC et CTX. Cela empêche la génération de rationalisations plausibles mais infidèles.
- Étape 3 (Fusion Cross-Modale) : Un juge fusionne les preuves structurées des Étapes 1 et 2 pour scorer CC, CTX et MR. Il recherche spécifiquement les conflits (ex. : une figure montrant une tendance à la hausse alors que le texte décrit une dégradation).
- Étape 4 (Exécuteur) : Un post-processeur déterministe verrouille les scores VC et SL aux sorties de la vision, applique des plafonds basés sur des règles pour MR, et agrège les scores finaux.
Le papier évalue trois protocoles sur un sous-ensemble de test fixe (eval1200) :
- Direct : Un seul prompt VLM de bout en bout.
- Sidecar : Un seul prompt augmenté par des caractéristiques latérales d'OCR/CV.
- SFQ-Agent : Le pipeline complet par étapes décrit ci-dessus.
Résultats Clés
Les expériences ont été menées sur eval1200 (1 200 instances stratifiées) en utilisant 11 backends VLM de pointe.
- Performance : Le SFQ-Agent équipé de GPT-5.6-Sol a obtenu la meilleure performance globale :
- Erreur Absolue Moyenne (MAE) : 0,418 (la plus basse parmi toutes les configurations).
- Cohérence à ±1 (Within-1) : 93,4 % (taux le plus élevé de prédictions à ±1 point des étiquettes d'or humaines).
- Corrélation de Spearman : 0,598.
- Comparaison des Protocoles :
- SFQ-Agent a systématiquement surpassé les protocoles Direct et Sidecar sur tous les backends.
- Le protocole Sidecar (ajout de caractéristiques OCR à un prompt unique) a montré des améliorations modestes par rapport au mode Direct, particulièrement pour les encodeurs faibles, mais n'a pas réussi à égaler la fusion par étapes de l'Agent.
- Les résultats indiquent que les gains sont portés par l'alignement protocole-preuve (séparation de la vérification visuelle et textuelle) plutôt que par la simple échelle du modèle.
- Analyse d'Échec :
- La Cohérence de la Légende (CC) et la Cohérence du Contexte (CTX) ont été identifiées comme les axes dominants de désaccord entre humains et modèles.
- Les juges monolithiques ont souvent confondu la perception visuelle avec la vérification textuelle, menant à des rationalisations hallucinées. L'approche par étapes a réussi à atténuer cela en imposant la séparation des modalités.
- Qwen-VL-Max a montré un écart significatif entre la calibration (W-1) et le classement (Spearman) en mode Direct, ce qui s'est amélioré avec le staging mais a toujours peiné sur la vérification de la légende.
Signification et Revendications
Le papier revendique les contributions et significations suivantes :
- Premier Benchmark de Manuscrit Complet : SciFigQual-Bench est le premier benchmark qui lie les figures scientifiques à leurs légendes et paragraphes citants issus du PDF source, dépassant l'évaluation visuelle isolée pour une évaluation fondée sur des preuves et en contexte complet.
- Cadre d'Évaluation Auditable : En proposant le SFQ-Agent, les auteurs démontent que l'évaluation cross-modale par étapes est supérieure au prompting VLM monolithique pour les tâches scientifiques. La conception garantit que chaque score est traçable à une preuve spécifique (faits visuels ou affirmations textuelles), répondant au problème de « fidélité » dans les paradigmes de LLM-as-judge.
- Capacité Diagnostique : Le benchmark sert de test de résistance pour la littératie scientifique tri-modale. Il révèle que les modèles actuels peinent le plus à vérifier la cohérence entre les figures et les affirmations narratives du texte (CC et CTX), une lacune que les benchmarks de QA de graphes ou de textes n'ont pas traitée conjointement.
- Utilité Pratique : Le cadre fournit un banc d'essai reproductible pour élever l'inspection assistée par IA des figures, passant d'un simple QA visuel à un raisonnement scientifique conscient du contexte, ce qui est crucial pour la révision par les pairs et le contrôle qualité dans l'édition scientifique.
Les auteurs positionnent ce travail non pas comme une solution à tous les problèmes d'images scientifiques, mais comme une étape nécessaire vers une évaluation de la qualité rigoureuse et sensible au contexte, qui respecte la nature tri-modale de la communication scientifique.