← Derniers articles
💬 NLP

A System for Name and Address Parsing with Large Language Models

Cet article présente un cadre fondé sur le prompt et centré sur la validation qui exploite les grands modèles de langage sans ajustement fin pour transformer de manière fiable des textes non structurés de noms et d'adresses en un schéma cohérent à 17 champs, en intégrant la normalisation des entrées, le décodage contraint et une validation stricte basée sur des règles.

Auteurs originaux : Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

Publié 2026-01-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Adeeba Tarannum, Muzakkiruddin Ahmed Mohammed, Mert Can Cakmak, Shames Al Mandalawi, John Talburt

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez une pile géante et désordonnée de lettres manuscrites. Certaines sont écrites en anglais, d'autres en espagnol, certaines ont de l'encre estompée, et d'autres n'ont pas de virgules ou comportent des fautes de frappe comme « 123 Main St Apt 4B » écrit sous la forme « 123MainStApt4B ». Votre objectif est de transformer cette pile chaotique en un tableur propre et organisé où chaque information (Nom, Rue, Code Postal) possède sa propre colonne spécifique.

Ce document décrit une nouvelle façon de réaliser ce travail en utilisant un cerveau informatique très intelligent (appelé Modèle de Langage Étendu, ou LLM), mais avec une nuance : au lieu d'enseigner une nouvelle langue à ce cerveau informatique (ce qui revient à embaucher un nouvel employé et à le former pendant des mois), les auteurs ont construit un système strict de « liste de contrôle et de supervision » autour de celui-ci.

Voici comment leur système fonctionne, décomposé en étapes simples :

1. Le « Chef de Préparation » (Normalisation des Entrées)

Avant même que le cerveau informatique intelligent ne regarde les données, un « Chef de Préparation » les nettoie.

  • Le Problème : Les données brutes sont désordonnées. Une personne a écrit « Ave. » et une autre a écrit « Avenue. ». Une autre a écrit « N.E. » et une autre « NE. ».
  • La Solution : Le système standardise automatiquement tout. Il transforme toutes les abréviations en mots complets, corrige la capitalisation et supprime les symboles bizarres. C'est comme un chef qui coupe tous les légumes exactement à la même taille avant de cuisiner, pour que la recette fonctionne parfaitement à chaque fois.

2. La « Recette Stricte » (Assemblage du Prompt)

Au lieu de laisser le cerveau informatique deviner ce qu'il doit faire, les auteurs lui donnent une fiche de recette très spécifique et immuable.

  • Le Problète : Si vous demandez simplement à un ordinateur intelligent : « Voici une adresse, donne-moi ses parties », il pourrait inventer des faits ou formater sa réponse différemment à chaque fois.
  • La Solution : La fiche de recette dit : « Tu es un analyseur expert. Tu dois produire exactement 17 champs dans cet ordre précis. Si tu ne sais pas quelque chose, laisse le champ vide. N'invente pas de données. » C'est comme donner à un robot un manuel d'assemblage strict : « Place la vis ici, le boulon là. Pas d'improvisation. »

3. La « Chaîne de Montage » (Inférence Contrainte)

L'ordinateur traite les données par petits groupes fixes (lots de 16), tout comme une chaîne de montage qui déplace 16 voitures à la fois.

  • Le But : Cela garantit que l'ordinateur ne devient pas « créatif » ou fatigué. Cela maintient les paramètres verrouillés afin que si vous lancez le même travail deux fois, vous obteniez exactement le même résultat. C'est comme une machine d'usine qui ne change jamais de vitesse ou de réglages.

4. L'« Inspecteur de Contrôle Qualité » (Validation)

C'est la partie la plus importante. Une fois que l'ordinateur a terminé son travail, un strict « Inspecteur de Contrôle Qualité » vérifie chaque ligne.

  • Les Règles :
    • Le code postal correspond-il à l'État ? (par exemple, un code postal de Californie ne peut pas être à New York).
    • L'ordinateur a-t-il inventé un nom de rue qui n'existe pas ?
    • Y a-t-il exactement 17 champs ?
  • Le Résultat : Si l'ordinateur commet une erreur, l'Inspecteur la détecte immédiatement. Si l'ordinateur est incertain, le système le signale pour qu'un humain puisse l'examiner plus tard. Cela garantit que le tableur final est presque parfait.

Qu'ont-ils découvert ?

Les auteurs ont testé ce système sur 1 500 dossiers d'adresses différents, incluant des dossiers désordonnés provenant des États-Unis, de Porto Rico et d'autres pays.

  • Le Score : Le système a réussi 99,8 % du temps.
  • La Comparaison : Il a fait légèrement mieux que les anciens systèmes basés sur des règles (qui sont comme des manuels d'instructions rigides) et n'a pas eu besoin d'être « réentraîné » ou de recevoir de nouvelles connaissances pour fonctionner.
  • La Confiance : Le système vous indiquait également son degré de certitude concernant sa réponse. Lorsqu'il affirmait être sûr à plus de 90 %, il avait presque toujours raison.

La Grande Conclusion

Le papier soutient que vous n'avez pas besoin d'entraîner des modèles d'IA coûteux et personnalisés pour corriger des données désordonnées. Au lieu de cela, vous pouvez utiliser un modèle d'IA puissant et standard, en l'entourant d'un filet de sécurité strict basé sur des règles.

Considérez cela comme l'embauche d'un écrivain brillant et créatif (l'IA) pour remplir un formulaire fiscal. Si vous le laissez simplement écrire, il pourrait inventer des chiffres. Mais si vous lui donnez un formulaire avec des cases strictes, une liste de contrôle de règles et un superviseur qui vérifie chaque case avant la soumission, vous obtenez un formulaire fiscal parfait, sans avoir besoin d'apprendre à l'écrivain comment faire la comptabilité de zéro.

Cette approche permet de transformer du texte désordonné du monde réel en données propres et fiables, rapidement et à moindre coût, sans avoir besoin de réentraîner l'IA pour chaque nouveau pays ou chaque nouvelle langue.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →