← Derniers articles
💻 computer science

Sentiment and Emotion Classification of Indonesian E-Commerce Reviews via Multi-Task BiLSTM and AutoML Benchmarking

Ce papier présente un pipeline de classification des sentiments et des émotions en deux voies pour les avis de commerce électronique indonésiens, utilisant le jeu de données PRDECT-ID, en comparant une approche AutoML PyCaret à un réseau BiLSTM personnalisé intégrant un prétraitement spécialisé de l'argot et obtenant des résultats de référence déployés via des applications Gradio.

Auteurs originaux : Hermawan Manurung, Ibrahim Al-Kahfi, Ahmad Rizqi, Martin Clinton Tosima Manullang

Publié 2026-04-28
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hermawan Manurung, Ibrahim Al-Kahfi, Ahmad Rizqi, Martin Clinton Tosima Manullang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous gérez un immense marché en ligne en Indonésie, comme une version numérique d'une gigantesque bourse. Chaque jour, des milliers de clients laissent des avis sur des produits. Mais voici le hic : ces avis ne sont pas rédigés dans un indonésien formel, tel qu'on le trouve dans les manuels. Ils sont un mélange chaotique et coloré d'argot, de dialectes régionaux, d'abréviations (comme « 50k » pour 50 000) et d'émojis.

Lire ces avis un par un pour comprendre si un client est heureux ou en colère est impossible pour les humains. C'est comme essayer de boire à un tuyau d'incendie. Cet article porte sur la création d'un « traducteur » et d'un « lecteur d'humeur » intelligents capables de gérer ce langage désordonné du monde réel.

Voici comment les auteurs ont abordé le problème, décomposé en concepts simples :

1. Le Problème : La « Soupe d'Argot »

Les auteurs expliquent que les outils informatiques standards pour lire les sentiments (analyse de sentiments) échouent souvent ici. Pourquoi ? Parce qu'un avis comme « mantep paten joss, fast delivery » est un casse-tête. Il contient des mots d'argot, des phrases en anglais et des abréviations, le tout dans une seule phrase. Si l'ordinateur ne sait pas que « mantep » signifie « génial », il se perd.

2. La Solution : Deux Équipes Différentes

Pour résoudre ce problème, l'équipe a construit deux « équipes » d'algorithmes différentes pour lire les avis et deviner deux choses à la fois :

  1. Sentiment : L'avis est-il Positif ou Négatif ? (Un simple Oui/Non).
  2. Émotion : Le client est-il Heureux, Triste, Effrayé, Amoureux ou en Colère ? (Un choix à cinq options).

Équipe A : Le Détective « Respectueux des Règles » (AutoML)

Cette équipe utilise une approche traditionnelle. D'abord, ils nettoient le texte (en corrigeant les fautes de frappe, en traduisant l'argot en mots normaux grâce à un dictionnaire spécial qu'ils ont construit). Ensuite, ils transforment les mots en une liste de nombres (TF-IDF) qui représente l'importance de chaque mot.

  • L'Analogie : Imaginez cette équipe comme un bibliothécaire qui trie les livres en comptant le nombre de fois où des mots spécifiques apparaissent. Ils utilisent un outil appelé PyCaret (un système « AutoML ») qui teste automatiquement des dizaines de méthodes de tri différentes pour trouver la meilleure.
  • Le Résultat : Cette équipe était incroyablement bonne pour repérer les sentiments simples « Heureux vs Triste » (Positif vs Négatif). Elle a obtenu environ 96 % de précision. C'est comme un détective très affûté qui excelle à repérer les indices évidents.

Équipe B : Le « Penseur Profond » (Réseau de Neurones BiLSTM & TextCNN)

Cette équipe utilise l'Apprentissage Profond, ce qui revient à entraîner un cerveau à comprendre le contexte et le flux, et non pas seulement les comptes de mots.

  • L'Architecture : Ils ont construit un BiLSTM Multi-Tâche.
    • BiLSTM : Imaginez lire une phrase deux fois — une fois de gauche à droite et une fois de droite à gauche — pour comprendre le contexte complet.
    • Multi-Tâche : Au lieu d'avoir deux cerveaux séparés, ils ont construit un seul cerveau avec deux « têtes ». Une tête devine le sentiment, et l'autre devine l'émotion, en partageant les mêmes connaissances.
  • Les Variations : Ils ont testé quatre tailles différentes de ce « cerveau » :
    1. Base : Un petit cerveau simple.
    2. Amélioré : Un cerveau légèrement plus grand avec une meilleure organisation.
    3. Grand : Un cerveau massif avec beaucoup de mémoire.
    4. TextCNN : Un type de cerveau différent qui cherche des modèles locaux courts (comme repérer des phrases spécifiques) plutôt que de lire tout le flux de la phrase.
  • Le Résultat : Ces « Penseurs Profonds » étaient meilleurs pour le travail plus difficile : déterminer l'Émotion spécifique (Heureux vs En Colère vs Effrayé). Le modèle TextCNN a remporté cette catégorie, obtenant environ 54 % de précision. Bien que cela semble faible, les auteurs expliquent que distinguer entre des émotions similaires (comme « Triste » et « Peur ») dans un texte court et désordonné est incroyablement difficile, donc c'était en réalité une performance solide.

3. L'« Équipe de Nettoyage » (Prétraitement)

Avant que ces équipes ne puissent travailler, les auteurs ont dû nettoyer les données. Ils ont mis en place un processus de nettoyage en 14 étapes.

  • L'Analogie : Imaginez recevoir une lettre écrite au crayon de couleur, tachée de café et aux bords déchirés. Avant de pouvoir la lire, vous devez lisser le papier, traduire les griffonnages au crayon et réparer les parties déchirées.
  • Ils ont créé un dictionnaire spécial contenant 140 mots d'argot (comme « joss » ou « mantep ») et ont enseigné à l'ordinateur comment gérer les émojis et les abréviations. Sans cette étape, l'ordinateur serait perdu.

4. Le Tableau de Score Final

L'article compare les deux équipes :

  • Pour l'Humeur Simple (Positif/Négatif) : Le « Détective Respectueux des Règles » (AutoML) a gagné facilement. Il est rapide, efficace et très précis pour les tâches simples.
  • Pour les Émotions Complexes (Heureux, Triste, En Colère, etc.) : Le « Penseur Profond » (Réseaux de Neurones) a gagné. Le cerveau complexe était meilleur pour comprendre les nuances subtiles entre les émotions, même s'il n'était pas parfait.

5. Ce Qu'ils Ont Construit

Les auteurs n'ont pas seulement écrit un rapport ; ils ont construit des outils fonctionnels :

  • Ils ont rendu le code public sur GitHub.
  • Ils ont créé deux sites web en direct (sur Hugging Face) où n'importe qui peut taper un avis, et le système leur dira si le client est heureux ou en colère, et quelle émotion spécifique il ressent.

Résumé

En bref, cet article porte sur l'enseignement aux ordinateurs de comprendre le langage désordonné et rempli d'argot des acheteurs en ligne indonésiens. Ils ont constaté que pour de simples jugements « bon/mauvais », les méthodes traditionnelles de comptage fonctionnent le mieux. Mais pour comprendre la nuance des émotions humaines (comme la différence entre avoir « peur » et être « triste »), un cerveau d'apprentissage profond qui lit dans les deux sens et cherche des modèles est l'outil supérieur. Ils ont réussi à construire un système qui gère le chaos de l'argot réel d'Internet pour nous offrir une image plus claire des sentiments des clients.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →