← Derniers articles
💬 NLP

FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts

Ce papier présente une approche utilisant des modèles de langage de grande taille, notamment le prompting few-shot de GPT-4.1, pour extraire et classer les mentions de toxicomanie dans des textes cliniques espagnols, atteignant un score F1 de 0,65 lors de la tâche partagée ToxHabits.

Auteurs originaux : Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva

Publié 2026-04-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🕵️‍♂️ Le Grand Détective des Habitudes Toxiques

Imaginez que vous êtes un détective privé chargé de fouiller dans des milliers de dossiers médicaux écrits en espagnol. Ces dossiers sont comme des carnets de notes de médecins : parfois très clairs, mais souvent un peu en désordre, avec des phrases longues et des détails cachés.

Votre mission ? Repérer les indices qui parlent d'habitudes toxiques : la cigarette, l'alcool, le cannabis ou les drogues illicites. Le problème ? Ces indices sont souvent noyés dans le texte. Parfois, le médecin écrit "le patient fume beaucoup", et parfois il écrit juste "tabagisme". Votre but est de trouver le mot exact et de le classer dans la bonne catégorie (comme trier des pièces de monnaie dans des boîtes différentes).

C'est exactement ce que l'équipe FMI@SU (des chercheurs de Sofia, en Bulgarie) a tenté de faire lors d'un concours appelé ToxHabits.

🤖 Le Super-Héros : L'Intelligence Artificielle (LLM)

Pour aider à cette tâche, les chercheurs n'ont pas utilisé de simples logiciels de recherche de mots. Ils ont fait appel à un Super-Héros de l'Intelligence Artificielle appelé GPT-4.1.

Imaginez ce GPT-4.1 comme un traducteur et analyste surhumain qui a lu presque tous les livres du monde. Il ne faut pas le programmer avec des règles strictes (comme "si le mot est 'cigare', alors c'est du tabac"). Au lieu de cela, on lui donne un entraînement rapide (ce qu'on appelle le "few-shot prompting").

L'analogie du "Cahier d'exemples" :
C'est comme si vous donniez à un nouvel employé un cahier avec 5 exemples de ce que vous cherchez :

Exemple 1 : "Il boit un verre de vin" -> Catégorie : Alcool.
Exemple 2 : "Elle fume des joints" -> Catégorie : Cannabis.

Ensuite, vous lui donnez un nouveau dossier médical et vous lui dites : "Fais pareil !". C'est ce qu'on appelle l'apprentissage par le contexte.

🧪 L'Expérience : Comment ils ont joué

Les chercheurs ont testé plusieurs façons de parler à ce Super-Héros :

  1. Sans aide (Zero-shot) : Ils lui ont juste demandé de faire le travail sans lui montrer d'exemples. (Résultat : un peu perdu).
  2. Avec des exemples (Few-shot) : Ils lui ont montré 3, 5 ou 7 exemples avant de lui donner le texte. (Résultat : beaucoup mieux !).
  3. L'optimisation : Ils ont utilisé des outils automatiques pour trouver les meilleurs exemples et les meilleures phrases pour donner les instructions.

Le verdict ? La meilleure stratégie a été de donner 5 exemples au Super-Héros et de lui expliquer très clairement la tâche. Cela lui a permis d'atteindre un score de réussite de 65% (sur une échelle de 0 à 100), ce qui est un très bon résultat pour un texte médical complexe en espagnol.

⚠️ Les Petits Problèmes (Les "Bugs" du Super-Héros)

Même si le Super-Héros est fort, il a quelques défauts amusants :

  • Il est trop bavard : Parfois, le médecin écrit "Il fume activement". Le Super-Héros repère "Il fume activement" comme un seul bloc. Mais le vrai indice est juste "fume". Il ajoute trop de contexte, comme un élève qui écrit tout ce qu'il pense au lieu de juste répondre à la question.
  • Il confond les détails : Il repère parfois des médicaments prescrits (comme des calmants) comme s'ils étaient des drogues illicites, car il ne comprend pas toujours le contexte médical (c'est une ordonnance, pas une addiction).
  • Il rate les négations : Si le texte dit "Il ne fume pas", le Super-Héros repère parfois "fume" et oublie le "ne... pas". C'est comme si vous cherchiez des pommes et que vous en trouviez une, mais vous aviez oublié de vérifier si elle était pourrie !

🏆 Ce que ça nous apprend

Ce papier nous dit deux choses importantes :

  1. L'IA est prometteuse : Même sans être entraînée spécifiquement sur des milliers de dossiers médicaux espagnols, un modèle d'IA généraliste peut très bien comprendre le contexte et trouver les informations. C'est comme si un expert en littérature pouvait lire un dossier médical et comprendre le fond du problème sans être médecin.
  2. Il faut encore peaufiner : Pour que ce soit parfait, il faut ajouter une étape de "correction" après l'IA, un peu comme un éditeur qui relit le texte pour enlever les mots inutiles et corriger les erreurs de contexte.

En résumé : Les chercheurs ont prouvé qu'on peut utiliser un "génie" de l'IA pour trier les habitudes dangereuses dans des dossiers médicaux espagnols. Ce n'est pas encore parfait (l'IA a besoin d'un peu de "carnet d'exemples" et d'un peu de correction humaine), mais c'est un pas de géant pour aider les médecins et les chercheurs à mieux comprendre les problèmes de santé publique liés aux drogues et à l'alcool.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →