← Derniers articles
💬 NLP

PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation

Cet article présente PeruMedQA, un ensemble de données de 8 380 questions d'examens médicaux péruviens en espagnol, et démontre que si le modèle MedGemma de 27 milliards de paramètres atteint la précision de base la plus élevée, l'ajustement fin du modèle MedGemma plus petit de 4 milliards de paramètres via LoRA améliore considérablement ses performances pour rivaliser avec des modèles beaucoup plus grands, offrant ainsi une solution rentable pour l'IA médicale dans les contextes hispanophones d'Amérique latine.

Auteurs originaux : Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

Publié 2026-06-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : Un défi d'examen médical au Pérou

Imaginez une immense bibliothèque de questions médicales utilisées au Pérou pour tester les médecins qui souhaitent devenir spécialistes (comme les neurochirurgiens ou les pédiatres). Ces questions sont rédigées en espagnol et couvrent tout, des maladies tropicales rares aux pathologies chroniques courantes.

Les auteurs de cet article voulaient voir si l'Intelligence Artificielle (IA) pouvait réussir ces examens. Ils n'ont pas seulement interrogé une seule IA ; ils ont rassemblé une « classe » de dix modèles d'IA différents (allant de modèles légers et compacts à des modèles massifs et puissants) et leur ont demandé de passer le test.

La configuration : Construction du jeu de données « PeruMedQA »

Avant que l'IA ne puisse passer le test, les chercheurs ont dû construire le test lui-même.

  • La source : Ils ont téléchargé les PDF officiels des examens du Conseil National de la Résidence Médicale du Pérou (CONAREME) couvrant la période de 2018 à 2025.
  • Le nettoyage : Ils ont utilisé du code informatique pour transformer ces PDF en une liste numérique de 8 380 questions. Ils ont même fait vérifier les réponses par un humain pour s'assurer que l'ordinateur ne commette pas d'erreurs (il n'en a commis que 16 sur 8 380, ce qui est incroyablement précis).
  • La standardisation : Certaines années comportaient 4 choix de réponses (A, B, C, D), et d'autres 5 (A, B, C, D, E). Pour que la course soit équitable, ils ont ajouté une option « Aucune des réponses ci-dessus » aux questions à 4 choix afin que chaque question possède exactement 5 options.
  • Le résultat : Ils ont créé un nouveau jeu de données en accès libre appelé PeruMedQA. Considérez cela comme un « examen du conseil médical péruvien » standardisé pour l'IA.

La course : Petits modèles d'IA contre grands modèles d'IA

Les chercheurs ont soumis les dix modèles d'IA à ce jeu de données. Voici comment les différents « athlètes » ont performé :

  1. Les poids lourds (Les grands modèles) :

    • La star : Le modèle medgemma-27b (un modèle de 27 milliards de paramètres) a été le grand champion. Il a obtenu les scores les plus élevés dans presque toutes les spécialités, atteignant près de 90 % de précision en psychiatrie. C'était comme le médaillé d'or olympique.
    • Le géant : Le Llama3-OpenBioLLM-70B (un modèle de 70 milliards de paramètres) était énorme et puissant, mais il n'a pas toujours battu le modèle légèrement plus petit de 27 milliards. Il a prouvé que « plus gros n'est pas toujours mieux » si les données d'entraînement ne sont pas tout à fait adéquates.
    • Le spécialiste : L'OctoMed-7B (un modèle de 7 milliards) s'est révélé étonnamment fort. Dans deux domaines spécifiques — la neurochirurgie et la radiologie — il a même battu le géant de 27 milliards. C'était comme un sprinteur qui bat le coureur de marathon lors d'un sprint court.
  2. Les poids légers (Les petits modèles) :

    • La plupart des modèles possédant moins de 10 milliards de paramètres ont eu des difficultés. Ils ont souvent obtenu des scores inférieurs à 50 %, ce qui est à peine meilleur que le hasard.
    • Le problème d'hallucination : Certains de ces petits modèles étaient si confus qu'ils ne respectaient même pas les règles. Au lieu de dire « A, B, C, D ou E », ils inventaient de nouvelles lettres (comme « K ») ou écrivaient de longs essais au lieu de choisir une réponse. C'est ce qu'on appelle une « hallucination ». Le modèle meditron-7b a été le pire coupable, échouant à donner une réponse valide 66 % du temps !

L'arme secrète : Le Fine-Tuning (Ajustement fin)

Les chercheurs ont pris le plus petit modèle, le plus économe en ressources (medgemma-4b-it), et lui ont donné une session d'entraînement spéciale. Ce processus est appelé Fine-Tuning (plus précisément la technique LoRA).

  • L'analogie : Imaginez un étudiant intelligent qui connaît la médecine générale mais qui n'a jamais vu d'examen péruvien. Les chercheurs ont pris cet étudiant et lui ont donné un cours intensif utilisant uniquement les 8 000 questions péruviennes passées (en excluant le test de 2025).
  • Le résultat : Cette version « entraînée » du petit modèle (medgemma-4b-it-FT) est devenue un super-héros.
    • Elle a complètement cessé d'halluciner.
    • Elle a surpassé tous les autres petits modèles.
    • Elle a même battu le modèle massif de 70 milliards de paramètres dans plusieurs tests.
    • Elle était le seul modèle capable de résoudre de manière unique des questions auxquelles aucun autre IA ne pouvait répondre.

Les points clés à retenir

  • Le contexte compte : Les modèles d'IA entraînés principalement sur des données américaines ou anglaises ont du mal avec le mélange spécifique de maladies et de styles médicaux présents au Pérou.
  • La taille n'est pas tout : Un modèle massif de 70 milliards de paramètres n'a pas automatiquement gagné. Un modèle de 27 milliards avec de meilleures données d'entraînement, ou un minuscule modèle de 4 milliards spécifiquement « ajusté » sur des données locales, a mieux performé.
  • Le vainqueur : Pour toute personne au Pérou ou dans des pays similaires de langue espagnole ayant besoin d'une IA médicale, l'article recommande d'utiliser medgemma-27b-text-it pour la meilleure performance globale. Cependant, si vous avez besoin de quelque chose qui fonctionne sur de plus petits ordinateurs, le medgemma-4b-it ajusté (fine-tuned) est une alternative fantastique et efficace qui rivalise avec les géants.

Ce que l'article ne dit PAS

L'article évalue strictement la capacité de ces IA à répondre à des questions à choix multiples. Il ne prétend pas que ces IA sont prêtes à diagnostiquer de vrais patients, à remplacer les médecins ou à être utilisées dans les hôpitaux pour le moment. C'est un test de référence (benchmark), pas le lancement d'un outil médical. Les auteurs soulignent qu'avant d'utiliser ces modèles dans le monde réel, ils doivent être testés avec soin pour garantir qu'ils ne commettent pas d'erreurs dangereuses.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →