← Derniers articles
💻 computer science

Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports

Cette étude évalue les modèles vision-langage pour l'extraction de données structurées à partir de rapports de laboratoire hétérogènes de plusieurs pages, concluant que si le traitement du document complet offre une vitesse supérieure, un flux de travail page par page utilisant Qwen2.5-VL atteint la précision et la stabilité les plus élevées à travers diverses longueurs de documents.

Auteurs originaux : Ashish Katyal, Ashwani Bhatnagar

Publié 2026-09-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ashish Katyal, Ashwani Bhatnagar

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les hôpitaux génèrent chaque jour un océan de dossiers papier et numériques, allant des notes narratives rédigées par les médecins aux résultats de tests de laboratoire denses et tabulaires. Pour que l'informatique puisse aider les médecins à prendre de meilleures décisions ou aider les chercheurs à trouver des schémas dans les maladies, ces informations doivent être converties d'images et de textes en données propres et organisées que les machines peuvent lire. Ce processus, connu sous le nom d'extraction d'informations, a longtemps été un obstacle car les documents médicaux sont désordonnés. Ils présentent des formes, des tailles et des formats différents ; certains sont des fichiers numériques nets, tandis que d'autres sont des scans granuleux de vieux papiers. De plus, l'information est souvent éparpillée sur plusieurs pages, avec des noms de tests, des chiffres et des unités disposés dans des tableaux complexes qui diffèrent d'un hôpital à l'autre.

Ces dernières années, un nouveau type d'intelligence artificielle appelé modèle vision-langage est apparu pour relever ce défi. Contrairement aux anciens systèmes qui ne pouvaient que lire du texte ou seulement voir des images, ces modèles peuvent regarder une image d'un document et comprendre simultanément à la fois la disposition visuelle et les mots qu'elle contient. Ils peuvent voir qu'un nombre appartient à un test spécifique en raison de sa position sur la page, et pas seulement parce qu'il suit un mot spécifique. Cependant, bien que ces modèles soient puissants, les scientifiques ne comprenaient pas pleinement la meilleure façon de leur fournir ces documents complexes et multipages. Devaient-ils examiner un rapport entier de dix pages d'un seul coup, ou devaient-ils examiner les pages une par une ? La réponse à cette question détermine si l'ordinateur manque des détails importants ou perd du temps, une distinction qui compte profondément lorsque les données sont utilisées pour guider les soins aux patients.

Une équipe de chercheurs s'est donné pour mission de trouver la réponse en menant une expérience contrôlée avec des rapports de laboratoire réels. Ils ont rassemblé des résultats de tests anonymisés provenant de deux prestataires majeurs, Lal PathLabs et Thyrocare, et ont créé des versions de ces rapports sous formats numérique et scanné. Pour garantir un test équitable, ils ont préparé trois longueurs de documents différentes : un rapport court d'une seule page, un rapport moyen de cinq à six pages, et un rapport long s'étendant sur dix pages. Ils ont ensuite testé trois méthodes différentes de traitement de ces documents en utilisant deux modèles d'intelligence artificielle de pointe, Qwen2.5-VL et Llama 3.2 Vision. La première approche demandait au modèle de considérer l'ensemble du rapport comme une image unique. La deuxième approche demandait au modèle d'examiner chaque page individuellement, puis de combiner les résultats. La troisième approche utilisait un modèle différent pour examiner les pages individuellement.

Les résultats ont révélé que la stratégie utilisée pour présenter le document était tout aussi importante que le modèle lui-même. Lorsque les chercheurs ont demandé au modèle Qwen2.5-VL de traiter les rapports page par page, il a atteint le plus haut niveau de précision, identifiant et enregistrant correctement près de 99 pour cent des résultats de tests attendus. Cette méthode s'est avérée particulièrement robuste pour les documents les plus longs ; même avec dix pages de données, l'approche page par page maintenait une précision de plus de 98 pour cent. En revanche, lorsque ce même modèle était sollicité pour visualiser l'ensemble du rapport de dix pages d'un seul coup, sa précision chutait considérablement pour atteindre environ 91 pour cent. Le modèle avait tendance à manquer des tests apparaissant sur les pages ultérieures lorsque le document était trop long pour être visualisé d'un seul bloc.

Le compromis pour cette précision accrue était le temps. La méthode page par page prenait environ deux fois plus de temps pour traiter un rapport que la méthode qui visualisait le document complet. Bien que l'approche du document complet soit plus rapide et extrêmement précise lorsqu'elle trouvait un test, elle échouait simplement à voir de nombreux tests cachés dans les rapports plus longs. Le troisième flux de travail, qui utilisait le modèle Llama 3.2 Vision pour examiner les pages une par une, a donné les moins bons résultats. Il a été le plus long à se terminer, avec une moyenne de plus de 108 secondes par rapport, et a fréquemment généré des enregistrements incorrects ou a manqué des données, atteignant une précision globale de moins de 88 pour cent. Cela suggérait que le simple fait de diviser un document en morceaux ne suffisait pas ; l'intelligence spécifique du modèle importait tout autant que la méthode de présentation.

L'étude a également examiné comment la qualité du document affectait les résultats. Que le rapport soit un fichier numérique propre ou une image scannée d'un document papier, cela ne faisait que peu de différence pour la performance du meilleur flux de travail. L'approche page par page avec le modèle Qwen2.5-VL maintenait une précision parfaite dans les conditions de scan évaluées, incluant les rapports courts et de longueur moyenne. Cette conclusion suggère que la qualité physique du scan est moins critique que la stratégie utilisée pour fournir l'information à l'ordinateur. Les chercheurs ont noté que la mise en page spécifique du rapport de l'hôpital jouait également un rôle, le rapport d'un prestataire étant légèrement plus facile à traiter que celui de l'autre, mais la tendance générale restait vraie pour les deux sources.

En fin de compte, la recherche démontre qu'il n'existe pas de « meilleure » façon unique d'extraire des données de rapports médicaux. Le choix dépend entièrement de ce dont l'utilisateur a besoin. Si un système hospitalier doit traiter des milliers de rapports rapidement et peut tolérer l'omission de quelques détails qui pourront être rattrapés plus tard, l'approche plus rapide du document complet pourrait convenir. Cependant, si l'objectif est de construire un dossier complet et fiable de chaque résultat de test, en particulier pour des documents longs et complexes, la méthode plus lente, page par page, est le choix supérieur. L'étude conclut que la manière dont un document est présenté à un système d'intelligence artificielle est une décision de conception critique qui impacte directement la fiabilité des données médicales qu'il produit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →