← Derniers articles
💻 computer science

VozConsultAI: A Provider-Agnostic Architecture and a Clinically Grounded Evaluation of Open-Weight Large Language Models for SOAP Note Extraction in Brazilian Portuguese Telehealth

Cet article présente VozConsultAI, une architecture de microservices agnostique vis-à-vis des fournisseurs pour la génération automatisée de notes SOAP en portugais brésilien pour la télésanté, et présente le premier benchmark comparatif de modèles de langage à poids ouverts utilisant une nouvelle métrique d'évaluation cliniquement fondée qui priorise la sécurité et pénalise les hallucinations.

Auteurs originaux : Nilton Gomes Furtado, Julia Vasconcelos Furtado

Publié 2026-07-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nilton Gomes Furtado, Julia Vasconcelos Furtado

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un médecin brésilien débordé essayant d'aider un patient lors d'un appel vidéo. Tout en écoutant et en parlant, il essaie aussi frénétiquement de rédiger un rapport médical. Ce rapport, appelé note SOAP, est comme une recette standardisée pour les dossiers médicaux : il doit lister ce que le patient a dit (Subjectif), ce que le médecin a observé (Objectif), ce que le médecin pense être le problème (Assessment/Évaluation) et quel est le plan (Plan).

Dans le vaste système de santé publique du Brésil, cette paperasse est un fardeau énorme, menant à l'épuisement professionnel. La plupart des outils existants qui automatisent cela sont comme des « boîtes noires » venant des États-Unis : ils ne parlent que l'anglais, coûtent une fortune par visite et envoient des données sensibles de patients vers des clouds étrangers, ce qui enfreint les lois brésiliennes sur la protection de la vie privée.

VozConsultAI est un nouveau projet conçu pour réparer cela. Voyez cela comme un scribe numérique intelligent, flexible et local, construit spécifiquement pour le Brésil. Voici comment cela fonctionne, décomposé en parties simples :

1. L'architecture du « Traducteur Universel »

Imaginez la cuisine d'un restaurant très fréquenté. Habituellement, vous devez commander à un chef spécifique (une entreprise d'IA spécifique). Si ce chef est occupé ou si le menu change, vous êtes coincé.

VozConsultAI construit un système de commande intelligent (appelé « Broker » ou courtier) qui se situe entre le médecin et la cuisine.

  • Indépendant des fournisseurs (Provider-Agnostic) : Le médecin n'a pas besoin de savoir quel chef cuisine. Le système peut diriger la commande vers un chef dans le cloud, un chef de cuisine locale ou un chef open-source gratuit, selon ce qui est disponible et ce que les règles stipulent.
  • Fiabilité : Si un chef casse une assiette (plante), le système le remarque, récupère la commande et la donne à un autre chef sans que le client (le médecin) ne sache qu'il y a eu un problème.
  • La priorité à la confidentialité : Parce que la loi brésilienne (LGPD) stipule que les données des patients doivent rester sous le contrôle du pays, ce système peut fonctionner entièrement sur les propres serveurs de l'hôpital en utilisant des modèles à « poids ouverts » (des cerveaux d'IA dont le code est libre de téléchargement et de fonctionnement local), garantissant qu'aucune donnée ne quitte le bâtiment.

2. Le « Juge Strict » (Évaluation)

Le plus grand danger avec les médecins IA est l'hallucination — quand l'IA invente des faits qui semblent plausibles mais qui ne se sont jamais produits (par exemple, inventer un symptôme que le patient n'a jamais mentionné).

Les auteurs n'ont pas seulement demandé : « L'IA a-t-elle écrit une bonne phrase ? ». Ils ont créé un test de sécurité en trois parties :

  1. Exactitude : A-t-elle mis les bons faits dans la bonne section ? (Par exemple, a-t-elle mis le diagnostic dans la section « Évaluation » et non dans le « Plan » ?)
  2. Couverture : A-t-elle oublié quelque chose d'important ? (Par exemple, a-t-elle oublié de mentionner l'allergie du patient ?)
  3. Ancrage (Le filet de sécurité) : C'est la partie la plus importante. Pour chaque fait que l'IA écrit, elle doit pointer l'endroit exact dans la conversation où le médecin ou le patient l'a dit. Si l'IA invente un fait, elle reçoit une note de zéro.

Ils ont combiné ces éléments en un score unique appelé Indice de Qualité de la Documentation Clinique (CDQI), qui pénalise lourdement l'invention de faits.

3. Le « Test de Goût » (Les Résultats)

L'équipe a testé cinq modèles d'IA open-source différents (les « chefs ») en utilisant 30 conversations médicales brésiliennes fictives mais réalistes. Ils voulaient voir quel modèle pouvait écrire les meilleures notes SOAP sans halluciner.

  • Le Gagnant : DeepSeek V3.2 est arrivé en tête. Il a obtenu le score de sécurité global le plus élevé (0,87) et a été le meilleur pour s'en tenir aux faits (score d'ancrage de 0,96).
  • Le Challenger : Llama 3.3 était très proche en termes de qualité, mais nécessitait moins de puissance de calcul.
  • La Surprise : Plus grand n'est pas toujours mieux. Bien que le plus gros modèle ait gagné, un modèle légèrement plus petit (Llama) a presque aussi bien performé, prouvant que la manière dont le modèle est entraîné compte plus que sa simple taille.
  • Le Point Faible : Tous les modèles ont le plus de difficultés avec les sections Évaluation et Plan. Cela est logique car ces parties nécessitent que l'IA infère ou devine les prochaines étapes, ce qui est l'endroit où elle est la plus susceptible d'inventer des choses. L'article note que ces sections nécessiteront toujours qu'un médecin humain les vérifie.

L'essentiel à retenir

VozConsultAI prouve que le Brésil n'a pas besoin de dépendre d'outils d'IA étrangers, coûteux et uniquement anglophones pour automatiser la paperasse médicale. Ils peuvent construire leur propre système qui :

  • Respecte les lois locales sur la confidentialité en fonctionnant sur des serveurs locaux.
  • Bascule facilement entre différents moteurs d'IA.
  • Utilise un système de notation strict axé sur la sécurité pour s'assurer que l'IA n'invente pas de faits médicaux.

L'article conclut que, bien que ces modèles d'IA ouverts soient désormais assez bons pour être utiles, les parties « Évaluation » et « Plan » des notes nécessitent toujours la révision d'un médecin humain avant d'être finalisées. L'objectif est de réduire la charge de frappe du médecin, et non de remplacer son jugement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →