← Derniers articles
💬 NLP

CodeNER: Code Prompting for Named Entity Recognition

Le papier CodeNER propose une méthode novatrice de reconnaissance d'entités nommées (NER) utilisant l'inférence par code pour structurer les instructions de balisage, surpassant ainsi les approches textuelles classiques sur dix benchmarks multilingues.

Auteurs originaux : Sungwoo Han, Hyeyeon Kim, Jingun Kwon, Hidetaka Kamigaito, Manabu Okumura

Publié 2026-03-27
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Sungwoo Han, Hyeyeon Kim, Jingun Kwon, Hidetaka Kamigaito, Manabu Okumura

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un super-intelligent (une intelligence artificielle) comment repérer les noms propres dans une phrase, comme les noms de personnes, de villes ou d'organisations. C'est ce qu'on appelle la Reconnaissance d'Entités Nommées (NER).

Jusqu'à récemment, on parlait à cette IA en langage naturel, comme si on lui donnait des instructions à un humain. Mais l'IA avait du mal : elle se perdait parfois, confondait les limites des mots, ou mettait des étiquettes au mauvais endroit. C'est un peu comme si vous demandiez à quelqu'un de découper un gâteau en parts égales, mais vous lui disiez juste "Coupe-le bien" sans lui donner de règles précises.

Voici comment les auteurs de cette nouvelle étude, CodeNER, ont résolu le problème avec une idée brillante : parler le langage des ordinateurs (le code) plutôt que celui des humains.

1. Le Problème : L'IA est perdue dans le texte

Quand on donne une phrase à une IA classique (comme ChatGPT) en lui disant "Trouve-moi les noms de personnes", elle utilise son "bon sens". Mais pour une tâche précise comme celle-ci, le "bon sens" ne suffit pas.

  • L'analogie : Imaginez que vous demandez à un chef d'orchestre de jouer une partition. Si vous lui dites juste "Fais de la belle musique", il va improviser. Mais si vous lui donnez la partition écrite avec des notes précises, il jouera exactement ce qu'il faut. Le texte naturel est une instruction vague ; le code, c'est la partition précise.

2. La Solution : CodeNER, le "Chef d'Orchestre" en Code

Les chercheurs ont créé une méthode appelée CodeNER. Au lieu d'écrire une instruction en français ou en anglais, ils écrivent une petite programme informatique (en Python, par exemple) dans la demande faite à l'IA.

Voici comment ça marche, étape par étape :

  • La Structure (Le Code) : Au lieu de dire "Trouve les noms", on écrit un script qui dit : "Pour chaque mot de la phrase, vérifie s'il commence une entité (B), s'il continue une entité (I), ou s'il n'en fait pas partie (O)."
  • L'Analogie du Tapis Roulant : Imaginez que la phrase est un tapis roulant qui défile. Le code donne à l'IA un petit robot qui passe sur chaque mot un par un. Le robot a un manuel strict : "Si tu vois 'Paris', colle une étiquette 'Ville'. Si tu vois 'et', colle une étiquette 'Rien'".
  • Pourquoi ça marche ? Les IA sont formées sur des millions de lignes de code. Elles comprennent parfaitement la logique stricte des boucles (for, while) et des règles. En utilisant le code, on force l'IA à suivre une logique séquentielle (mot par mot) au lieu de deviner globalement.

3. Les Résultats : Plus précis, moins d'erreurs

Les chercheurs ont testé cette méthode sur 10 langues différentes (anglais, arabe, finnois, etc.) et sur 10 bases de données différentes.

  • Le résultat : CodeNER bat largement les méthodes classiques basées sur le texte.
  • L'analogie : C'est comme comparer un détective amateur qui regarde une photo et devine qui est le coupable, à un détective équipé d'une loupe et d'une checklist rigoureuse. Le détective avec la checklist (CodeNER) ne rate aucun détail, même les petits noms cachés dans des phrases longues.

4. Les Cas Spéciaux : Quand le code sauve la mise

L'article montre des exemples concrets où les méthodes classiques échouent :

  • Les URLs : Une méthode classique peut couper un lien internet en plusieurs morceaux. CodeNER, grâce à son code, comprend que tout le lien est une seule entité.
  • Les répétitions : Si le mot "Banque" apparaît deux fois dans un texte, la méthode classique peut oublier de l'étiqueter la deuxième fois. Le code, lui, passe sur chaque mot systématiquement et ne rate rien.

5. Les Limites : Ce n'est pas magique

Toutefois, les auteurs sont honnêtes : cette méthode n'est pas parfaite partout.

  • L'analogie du gros gâteau : Parfois, dans des textes très longs (comme des résumés de films), on doit étiqueter de très grandes parties de phrases d'un coup. Là, la méthode rigide du code (qui regarde mot par mot) peut être trop stricte et manquer la vue d'ensemble. Dans ce cas, la méthode classique (qui "sent" le contexte) peut parfois être meilleure.

En résumé

CodeNER, c'est comme donner à l'IA une règle du jeu très précise (un programme informatique) au lieu de lui donner un conseil vague (une phrase en langage courant).

En utilisant le langage des machines pour enseigner aux machines comment lire, les chercheurs ont réussi à rendre l'IA beaucoup plus précise pour repérer les noms, les lieux et les organisations, peu importe la langue parlée. C'est une preuve que parfois, pour mieux comprendre le monde, il faut parler le langage de la logique pure !

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →