← Derniers articles
🤖 machine learning

SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

Cet article présente SciMIF, un nouveau benchmark doté d'une taxonomie complète et d'un pipeline de données de haute fidélité pour évaluer les grands modèles de langage multimodaux sur des instructions scientifiques complexes, révélant des disparités de performance significatives entre les disciplines et soulignant les limitations actuelles en matière de respect de contraintes fines malgré l'augmentation de l'échelle des modèles.

Auteurs originaux : Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai

Publié 2026-08-27
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai

Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : SciMIF

Énoncé du Problème

L'application des modèles de langage de grande taille multimodaux (MLLM) dans les domaines scientifiques est passée de la simple réponse à des questions à des paradigmes complexes tels que les agents scientifiques autonomes. Cependant, les méthodes d'évaluation actuelles se concentrent principalement sur la correction scientifique (si la réponse finale est factuellement exacte) plutôt que sur l'adhérence aux instructions (si le modèle satisfait des contraintes opérationnelles explicites).

Les benchmarks d'instruction existants à usage général (ex. : IF-Eval, FollowBench) évaluent les contraintes de format, de longueur et de style, mais manquent de contraintes scientifiques spécifiques au domaine. À l'inverse, les benchmarks scientifiques existants (ex. : SciBench, MMMU) évaluent le raisonnement et les connaissances, mais ne testent pas systématiquement la capacité d'un modèle à suivre des instructions opérationnelles complexes et multi-étapes. Cette lacune occulte deux capacités distinctes : un modèle peut produire une réponse scientifiquement correcte tout en violant les unités ou les formats demandés, ou il peut suivre strictement un format tout en s'appuyant sur un raisonnement scientifique invalide. De plus, le suivi d'instructions scientifiques est particulièrement difficile en raison de sa dépendance vis-à-vis des connaissances spécifiques au domaine, des variations sémantiques interdisciplinaires et d'un recours fréquent à des entrées multimodales (ex. : structures moléculaires, images de microscopie).

Méthodologie

1. Taxonomie des Contraintes Scientifiques

Les auteurs introduisent SciMIF (Scientific Multimodal Instruction Following), un benchmark conçu pour évaluer les MLLM à travers cinq disciplines scientifiques : la Chimie, la Géographie, la Biologie, la Science des Matériaux et la Physique.

Sur la base d'une analyse de 22 tâches distinctes dans ces disciplines, les auteurs ont construit une taxonomie hiérarchique comprenant :

  • 10 Groupes de Contraintes Fonctionnelles : Ils capturent les exigences partagées entre les domaines, incluant la Procédure, le Nombre, la Méthode, l'Unité, le Format, la Terminologie, la Précision, la Lettre, la Structure et la Sélection.
  • Instanciations Spécifiques à la Discipline : Bien que les groupes fonctionnels soient partagés, leurs significations concrètes varient. Par exemple, une contrainte de « Terminologie » exige une nomenclature moléculaire valide en Chimie, des adresses hiérarchiques en Géographie et des techniques de caractérisation en Science des Matériaux.
  • Inventaire des Contraintes : Le benchmark final comprend 42 contraintes distinctes dérivées des 10 groupes, adaptées aux conventions de chaque discipline.

2. Pipeline de Construction des Données

SciMIF est construit en augmentant systématiquement 13 ensembles de données scientifiques existants (totalisant 2 527 échantillons) via un pipeline en quatre étapes :

  1. Préparation des Graines (Seeds) : Sélection d'échantillons avec une question (qq), une entrée visuelle optionnelle (II), une réponse de référence (aa) et un type de tâche (tt).
  2. Reconnaissance des Contraintes : Identification des contraintes déjà implicites dans la requête originale afin d'éviter la redondance.
  3. Injection de Contraintes :
    • Contraintes Scientifiques : Injection de contraintes spécifiques au domaine compatibles avec le type de tâche.
    • Contraintes Générales : Injection de contraintes opérationnelles générales (ex. : format de sortie, capitalisation) sans altérer la correction scientifique de la réponse de référence.
    • Validation : Une double vérification automatique garantit que la contrainte injectée est présente dans la requête et que la réponse de vérité terrain reste valide.
  4. Vérification Humaine : Deux annotateurs examinent les échantillons pour la cohérence logique, la fluidité et la fidélité aux contraintes. Les échantillons problématiques sont révisés ou écartés.

3. Métriques d'Évaluation

Le benchmark utilise trois métriques pour évaluer la performance :

  • Taux de Satisfaction des Contraintes (CSR - Constraint Satisfaction Rate) : La proportion moyenne de contraintes satisfaites à travers toutes les instructions.
  • Taux de Satisfaction des Instructions (ISR - Instruction Satisfaction Rate) : La proportion d'instructions où toutes les contraintes associées sont complètement satisfaites.
  • Ratio de Suivi des Exigences Décomposées (DRFR - Decomposed Requirements Following Ratio) : Mesure la conformité au niveau des exigences individuelles décomposées par rapport au nombre total de contraintes.

La vérification utilise des méthodes basées sur des scripts (pour les vérifications déterministes comme le format et les unités) et des protocoles de type « LLM-as-a-Judge » (pour les vérifications sémantiques comme les étapes de raisonnement).

Résultats Clés

1. Disparités de Performance entre Disciplines

L'évaluation des modèles de pointe à code source fermé (ex. : GPT-5.2, Claude-Sonnet-4.6) et à code source ouvert (ex. : Qwen3.5, InternVL3.5) révèle des variations significatives :

  • La Chimie représente le plus grand défi, le modèle le plus performant (GPT-5.2) n'atteignant qu'un ISR de 46,33 %.
  • La Biologie et la Science des Matériaux affichent des performances plus élevées (ISR ~72–78 %).
  • La Géographie présente également des difficultés importantes en raison des hiérarchies spatiales.
  • La Physique produit généralement les scores DRFR les plus élevés (moyenne de 92,2 %).

2. Échelle du Modèle et Architecture

  • Paradoxe de l'Échelle (Scaling Paradox) : L'augmentation des paramètres du modèle ne produit pas d'améliorations linéaires de l'adhérence aux instructions. Par exemple, dans la série Qwen3.5, le modèle 122B a légèrement moins bien performé (50,41 % d'ISR) que le modèle 27B (51,37 %).
  • Open Source vs Closed Source : Les modèles à code source fermé surpassent systématiquement leurs homologues à code source ouvert dans toutes les disciplines, suggérant des avantages en termes de qualité de données et de stratégies d'alignement.

3. Analyse des Domaines de Contraintes

  • Contraintes Générales vs Scientifiques : Les modèles performent nettement mieux sur les contraintes scientifiques (sémantiquement liées à la tâche) que sur les contraintes générales (formatage/structure). Pour GPT-5.2, le DRFR sur les contraintes scientifiques était de 88,74 % contre 74,65 % pour les contraintes générales.
  • Défis de Granularité : Les modèles éprouvent le plus de difficultés avec les contraintes de Lettre et de Nombre, qui nécessitent un traitement symbolique précis et une reconnaissance d'entités spécifiques au domaine (ex. : compter les liaisons chimiques vs compter les caractères).

4. Correction vs Adhérence

Une conclusion critique est le faible couplage entre la correction scientifique et l'adhérence aux instructions :

  • Seuls environ 30 % des échantillons ont atteint à la fois la correction scientifique et la pleine adhérence aux instructions (Correct and Followed).
  • Environ 20 % des échantillons étaient scientifiquement corrects mais violaient les contraintes (Correct but Violated).
  • Plus de 30 % des échantillons suivaient les instructions mais produisaient des réponses scientifiques incorrectes (Incorrect but Followed).
  • L'analyse statistique (test χ2\chi^2 de Pearson) confirme que si la correction et l'adhérence sont positivement associées, la force de cette association est modeste (coefficients ϕ\phi allant de 0,06 à 0,20), indiquant qu'elles sont des capacités distinctes.

Signification et Contributions

Le papier revendique trois contributions principales :

  1. Taxonomie Dérivée d'Experts : L'établissement d'une taxonomie complète des contraintes scientifiques couvrant cinq disciplines et dix groupes fonctionnels, capturant à la fois les capacités partagées et les exigences spécifiques au domaine.
  2. Cadre Scalable : Une méthodologie pour transformer les tâches scientifiques existantes en évaluations de suivi d'instructions en reconnaissant les contraintes implicites et en injectant des contraintes compatibles sans altérer les réponses de référence.
  3. Benchmark et Évaluation : La construction de SciMIF et l'évaluation de MLLM représentatifs, ce qui révèle :
    • Des variations disciplinaires substantielles de performance.
    • Des difficultés sévères avec les contraintes de granularité fine.
    • Un fossé clair entre la correction scientifique et l'adhérence aux instructions.

Les auteurs concluent que les MLLM actuels ne sont pas encore fiables pour des applications scientifiques rigoureuses exigeant des contraintes opérationnelles strictes. Ils suggèrent que les recherches futures devraient se concentrer sur l'alignement des instructions sensibles au domaine, l'intégration d'outils externes (ex. : moteurs symboliques) pour les contraintes de granularité fine, et l'optimisation pour l'atteinte conjointe de la correction et de l'adhérence plutôt que de les traiter de manière isolée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →