← Derniers articles
💬 NLP

Malaysian English News Decoded: A Linguistic Resource for Named Entity and Relation Extraction

Cet article présente l'ensemble de données Malaysian English News (MEN), une ressource annotée manuellement contenant 6 061 entités et 3 268 relations issues de 200 articles de presse, qui pallie le manque de données adaptées à l'anglais malaisien et améliore considérablement les performances de la reconnaissance d'entités nommées lorsqu'il est utilisé pour affiner les modèles de traitement automatique des langues.

Auteurs originaux : Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un bibliothécaire très intelligent et érudit nommé SpaCy. Ce bibliothécaire a passé des années à lire des millions de livres écrits en « anglais standard » (le genre que l'on trouve dans les manuels britanniques ou américains). De ce fait, SpaCy est excellent pour trouver les noms de personnes, de lieux et d'organisations dans ces livres standards.

Cependant, les chercheurs de cet article ont découvert un problème : SpaCy est confus lorsqu'il lit l'« anglais malaisien ».

Le Problème : La confusion de la « saveur locale »

L'anglais malaisien est comme un ragoût délicieux et unique. Il est composé d'une base d'anglais standard, mais il est assaisonné avec des ingrédients locaux issus des cultures malaise, chinoise et tamoule. Il possède des mots spéciaux (comme nasi lemak ou ang pow) et des structures de phrases uniques.

Lorsque les chercheurs ont demandé à SpaCy de lire des articles de presse malaisiens, il a eu du mal. C'était comme demander à un bibliothécaire qui ne sait que classer des livres de bibliothèque d'organiser une collection de recettes de cuisine de rue. Le bibliothécaire passait à côté d'ingrédients importants.

Dans un test portant sur seulement 30 phrases, SpaCy et d'autres outils similaires n'ont trouvé qu'environ 58 % des noms et des lieux correctement. Ils ont manqué des éléments comme les titres locaux (par exemple, Datuk ou Tan Sri) et des organisations malaisiennes spécifiques. Les chercheurs ont réalisé que personne n'avait jamais construit de « manuel de formation » spécifiquement pour l'anglais malaisien, donc l'IA devait deviner, et elle se trompait.

La Solution : Construire un Manuel de Formation Personnalisé

Pour corriger cela, l'équipe a décidé de construire son propre « manuel de formation », qu'ils appellent le MEN Dataset (Malaysian English News Dataset).

Considérez ce processus comme la formation d'un nouvel apprenti :

  1. Collecter le matériel : Ils ont collecté 14 320 articles de presse provenant de grands sites d'actualités malaisiens.
  2. La touche humaine : Ils n'ont pas simplement utilisé un ordinateur pour les trier. Ils ont engagé quatre experts humains, fluents à la fois en anglais malaisien et dans la langue locale (Bahasa Malaysia).
  3. L'annotation : Ces humains ont lu 200 articles et ont mis en évidence manuellement chaque personne, lieu, organisation et la relation entre eux. Ils ont même créé des catégories spéciales pour des choses locales, comme TITLE (pour les titres royaux ou honorifiques) et ROLE (pour des postes de travail spécifiques courants en Malaisie).
  4. Contrôle qualité : Pour s'assurer que les humains étaient d'accord entre eux, ils ont vérifié leur travail les uns par rapport aux autres. En cas de désaccord, un expert senior agissait en tant que arbitre pour rendre la décision finale.

Le résultat ? Un ensemble de données massif et de haute qualité contenant 6 061 entités nommées et 3 268 relations (comme « Personne X travaille pour l'Organisation Y »).

L'Expérience : Apprendre un nouveau tour au Bibliothécaire

Une fois qu'ils ont eu ce manuel personnalisé, ils sont retournés voir le bibliothécaire (SpaCy) et lui ont dit : « Tiens, lis ce manuel et apprends à repérer les noms malaisiens. »

Ils ont pris le modèle SpaCy standard et l'ont affiné (fine-tuned) en utilisant leur nouveau jeu de données malaisien. C'est comme donner au bibliothécaire un cours intensif sur la culture malaisienne avant de lui demander de nouveau de trier les recettes.

Les Résultats : Une Amélioration Spectaculaire

La différence était du jour au la nuit :

  • Avant l'entraînement : Le modèle standard était comme un touriste essayant de naviguer dans un marché local ; il se perdait et manquait la plupart des étals.
  • Après l'entraînement : Le modèle affiné est devenu un expert local.
    • Les chercheurs ont constaté que l'entraînement d'un modèle à partir de zéro en utilisant leurs nouvelles données (spacy-blank) a atteint un score de précision de 94 %.
    • Même les modèles qui étaient déjà intelligents mais qui ont simplement été « rafraîchis » avec les nouvelles données ont amélioré leurs performances de plus de 200 % par rapport à leurs tentatives précédentes.

À Retenir

L'article conclut que vous ne pouvez pas simplement prendre un outil conçu pour l'anglais standard et vous attendre à ce qu'il fonctionne parfaitement sur l'anglais malaisien. Tout comme vous n'utiliseriez pas une carte de Londres pour naviguer à Kuala Lumpur, vous avez besoin d'une carte (jeu de données) construite spécifiquement pour le terrain.

En créant ce MEN Dataset et en montrant comment il améliore de manière spectaculaire les performances de l'IA, les chercheurs ont remis à la communauté du NLP (Traitement du Langage Naturel) un nouvel outil essentiel. Ils ont publié ce jeu de données et les règles qu'ils ont utilisées pour le créer sur GitHub, afin que d'autres chercheurs puissent l'utiliser pour construire une meilleure IA qui comprenne véritablement la voix malaisienne.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →