← Derniers articles
📄 health informatics

HemOncAgent: an artificial intelligence system for retrieving structured and narrative oncology knowledge

Le document présente HemOncAgent, un système d'IA qui intègre des graphes de connaissances structurés et des parcours de soins narratifs pour fournir une récupération hybride de haute fidélité des connaissances en oncologie, surmontant ainsi les limites des systèmes à source unique.

Auteurs originaux : Yang, A. J., Zaki, H. A., Seto, A., Kim, T., Riaz, I. B., Srisuwananukorn, A., Cowan, A. J., Yang, P. C., Warner, J. L.

Publié 2026-09-11
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yang, A. J., Zaki, H. A., Seto, A., Kim, T., Riaz, I. B., Srisuwananukorn, A., Cowan, A. J., Yang, P. C., Warner, J. L.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Dans le monde complexe du traitement du cancer, les médecins doivent naviguer entre deux types de données très différents. L'un est rigide et précis, tel un catalogue d'ingrédients qui énumère exactement quels médicaments appartiennent à une combinaison spécifique ou quels codes médicaux décrivent une maladie particulière. L'autre est fluide et descriptif, se trouvant dans les notes écrites des spécialistes qui expliquent comment séquencer les traitements au fil du temps, décidant quand commencer une nouvelle thérapie ou comment gérer un patient après une récidive. Pendant des décennies, les systèmes informatiques conçus pour aider les médecins ont eu du mal à gérer les deux simultanément. Certains excellent dans la recherche de faits exacts mais échouent à comprendre l'histoire d'un plan de traitement, tandis que d'autres sont doués pour lire du texte mais manquent les connexions critiques entre des médicaments spécifiques. Ce fossé est important car un médecin posant une question sur les soins oncologiques peut avoir besoin d'une liste de médicaments précise un instant, et d'une explication narrative des parcours de traitement l'instant d'après.

Une équipe de chercheurs a construit un nouvel assistant numérique appelé HemOncAgent pour combler ce fossé. Au lieu de forcer une seule méthode à faire tout le travail, ce système agit comme un bibliothécaire attentionné qui sait quand consulter une base de données structurée et quand lire un manuel détaillé. Les chercheurs ont testé cet outil contre des systèmes informatiques standards en utilisant des centaines de questions sur les connaissances en oncologie. Ils ont découvert qu'en laissant l'ordinateur choisir la bonne source pour chaque question spécifique, le nouveau système pouvait répondre tant aux requêtes factuelles qu'aux scénarios de traitement complexes avec une grande précision. Les résultats suggèrent que pour les connaissances médicales qui sont à la fois des données brutes et de l'expérience humaine, une approche hybride est bien plus fiable que de s'appuyer sur un seul type de recherche.

Le défi en oncologie est que la connaissance existe sous deux formes distinctes. D'une part, il existe des bases de données organisées qui stockent des faits structurés, tels que quels médicaments composent un régime spécifique ou quels codes médicaux standards s'appliquent à une affection. Ce sont comme les règles rigides d'un jeu, où chaque élément a une place définie. D'autre part, il existe des ressources écrites par des cliniciens qui décrivent comment les traitements sont réellement utilisés en pratique, détaillant l'ordre dans lequel les thérapies sont administrées pour différents stades d'une maladie. Ces récits capturent la nuance de la prise de décision que les bases de données rigides omettent souvent. Bien que les modèles de langage étendu — des programmes informatiques entraînés sur de vastes quantités de texte — puissent répondre à des questions, ils font souvent des hallucinations ou des suppositions lorsqu'ils n'ont pas accès à ces sources externes spécifiques. Pour résoudre cela, les chercheurs ont développé un système capable de solliciter ces deux types de ressources, en sélectionnant la plus appropriée en fonction de la demande de l'utilisateur.

Les chercheurs ont créé HemOncAgent pour agir comme un hub central connecté à deux sources de connaissances spécifiques. La première est un graphe de connaissances structuré, un réseau massif de plus de 126 000 concepts et 424 000 relations reliant médicaments, régimes et maladies. Cette source est excellente pour répondre à des questions sur des compositions exactes ou des approbations réglementaires. La seconde source est un site web narratif contenant des milliers de pages de texte écrit par des experts, qui décrit les parcours de traitement et les séquences de soins. Lorsqu'une question est posée, l'agent analyse la requête et décide s'il doit interroger le graphe structuré, rechercher le texte narratif, ou utiliser les deux. Il extrait ensuite l'information pertinente et synthétise une réponse finale. Pour voir si cette approche fonctionnait, l'équipe a comparé HemOncAgent à trois autres systèmes : un modèle de langage standard sans connaissance extérieure, un système qui ne cherchait que le texte narratif, et un système qui interrogeait uniquement le graphe structuré.

Les tests ont porté sur 600 questions divisées en deux groupes. Le premier groupe se concentrait sur des faits structurés, comme identifier les médicaments d'un régime ou trouver un code médical spécifique. Le second groupe se concentrait sur des détails narratifs, comme déterminer l'ordre des traitements pour un contexte de maladie spécifique. Les résultats ont montré un schéma clair. Le système qui ne cherchait que le texte narratif a bien performé sur les séquences de traitement mais a échoué lamentablement à trouver des codes exacts ou des listes de médicaments. Inversement, le système qui utilisait uniquement le graphe structuré était excellent pour les faits mais peinait à trouver les parcours de traitement décrits dans le texte. Le modèle de langage standard, sans aucune aide externe, a mal performé sur les deux aspects. HemOncAgent, cependant, a obtenu le score global le plus élevé. Il a égalé la performance du système spécialisé en graphe pour les questions factuelles et a surpassé le système de texte seul pour les questions narratives, combinant avec succès les forces des deux approches.

Lorsque les chercheurs ont examiné de plus près les types de questions, les avantages du système hybride sont devenus encore plus évidents. Pour les questions nécessitant des correspondances exactes, comme trouver la classification d'un médicament ou un numéro d'essai clinique, l'agent s'est appuyé presque entièrement sur la base de données structurée, atteignant une précision quasi parfaite. Pour les questions concernant les contextes de traitement, telles que ce qui se passe après l'échec d'une thérapie de première ligne, l'agent a principalement recherché dans les pages narratives. Dans ces cas, il a nettement surpassé le système basé uniquement sur le graphe, qui ne pouvait pas trouver les réponses cachées dans la prose. L'agent a également démontré qu'il pouvait intelligemment mélanger les sources si nécessaire, utilisant à la fois le graphe et le texte pour environ un quart des questions narratives afin de garantir une réponse complète. Cette flexibilité lui a permis de maintenir une grande précision sur toute la gamme des connaissances en oncologie.

L'étude a également testé la robustesse de ces résultats en changeant le modèle informatique sous-jacent qui générait les réponses. Même lorsque les chercheurs ont remplacé le moteur principal par un autre type d'intelligence artificielle, le système hybride a continué à surpasser les alternatives à source unique. Bien que les scores absolus aient légèrement changé, le schéma est resté le même : avoir accès à la fois à des sources structurées et narratives offrait un avantage constant. Les chercheurs ont noté que le système de notation automatisé utilisé pour évaluer les réponses concordait avec un second système de notation indépendant sur près de 94 % des réponses, ce qui donne confiance dans le fait que les résultats ne sont pas le fruit d'une méthode d'évaluation spécifique.

Malgré ces succès, les auteurs veillent à préciser les limites de leurs conclusions. Les questions utilisées pour les tests ont été générées directement à partir des mêmes ressources que celles consultées par le système, ce qui signifie que le test mesurait la capacité du système à extraire l'information de ces sources spécifiques plutôt que sa capacité à raisonner sur de nouveaux scénarios clinaux inédits. L'étude ne prétend pas que ce système est prêt à remplacer les médecins ou qu'il peut répondre à toutes les questions sur les soins du cancer, d'autant plus que les directives médicales évoluent rapidement et que la base de connaissances représente un instantané dans le temps. Cependant, les résultats suggèrent fortement que pour les ressources de connaissances cliniques qui englobent à la fois des données brutes et un récit humain, une stratégie de recherche unique est insuffisante. En permettant à un agent d'intelligence artificielle de choisir le bon outil pour la tâche, les chercheurs ont démontré une manière pratique de rendre l'information médicale plus accessible et plus fiable.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →