← Derniers articles
💻 computer science

Machine Learning versus Deep Learning for Public Financial Report Classification and Popularity Prediction: A Feasibility Study on Ghana's Controller and Accountant-General's Department

Cette étude de faisabilité évalue la performance des modèles d'apprentissage automatique classique et d'apprentissage profond sur les rapports financiers du Département du Contrôleur et du Comptable général du Ghana, révélant que si l'algorithme XGBoost affiné a atteint une classification parfaite des catégories, l'étude d'ablation subséquente a démontré que les caractéristiques de mots-clés ont considérablement gonflé ces résultats, soulignant le besoin critique d'une validation rigoureuse des caractéristiques avant de déployer de tels outils dans les contextes du secteur public.

Auteurs originaux : Emmanuel Osei-Dwomoh, Gabriel Osei Forkuo

Publié 2026-08-27
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Emmanuel Osei-Dwomoh, Gabriel Osei Forkuo

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les gouvernements du monde entier mettent de plus en plus leurs dossiers financiers en ligne. Ce changement vise à apporter de la transparence, permettant aux citoyens et aux auditeurs de voir comment l'argent public est dépensé sans avoir besoin de se rendre dans un bureau physique. Cependant, à mesure que ces archives numériques s'accumulent, elles deviennent difficiles à gérer. Un seul département gouvernemental peut publier des centaines de documents sur quelques années, allant des déclarations budgétaires annuelles aux circulaires sur la paie. Trier ces fichiers à la main est lent et sujet aux erreurs, tandis que déterminer quels rapports les gens veulent réellement lire est encore plus difficile. Pour résoudre ce problème, les agences se tournent vers les ordinateurs pour effectuer le tri et les prédictions à leur place. C'est là qu'intervient l'apprentissage automatique (machine learning). Il s'agit de programmes informatiques qui apprennent à reconnaître des modèles dans les données, tels que les mots dans le titre d'un document, pour prendre des décisions comme « ceci est un rapport de paie » ou « ce rapport sera souvent téléchargé ». Mais il y a un piège : ces programmes ont généralement besoin de milliers d'exemples pour bien apprendre. Lorsqu'un département gouvernemental ne possède que quelques centaines de documents, il n'est pas clair si ces outils intelligents peuvent réellement fonctionner, ou s'ils ne font que deviner en s'appuyant sur des raccourcis chanceux.

Au Ghana, le département du Contrôleur et du Comptable Général détient une vaste collection de rapports financiers publics. Deux chercheurs, Emmanuel Osei-Dwomoh et Gabriel Osei Forkuo, ont décidé de tester si des outils automatisés pouvaient organiser cette collection spécifique et prédire sa popularité. Ils ont rassemblé 131 rapports officiels publiés entre 2019 et 2024. Ces documents comprenaient tout, des éditions de plans comptables aux matériels de normes comptables internationales. Les chercheurs ont entrepris de construire deux types différents de modèles informatiques pour accomplir ce travail. Le premier type reposait sur l'apprentissage automatique « classique », où un analyste humain crée soigneusement une liste d'indices spécifiques, comme compter combien de fois le mot « budget » apparaît ou noter la longueur du fichier. Le second type utilisait l'« apprentissage profond » (deep learning), une approche plus complexe où l'ordinateur lit le texte brut des titres et des descriptions caractère par caractère, tentant de trouver des modèles par lui-même sans l'aide de l'humain. Ils ont testé ces modèles sur trois tâches spécifiques : trier les rapports dans la bonne catégorie, deviner si un rapport serait téléchargé plus que la moyenne, et prédire le nombre exact de téléchargements.

Les résultats ont été surprenants et ont révélé un piège caché dans la manière dont ces systèmes apprennent. Lorsque les chercheurs ont lancé les tests pour la première fois, le modèle d'apprentissage automatique classique semblait parfait. Il a correctement classé chaque rapport du groupe de test dans sa bonne catégorie, atteignant un score sans faute. Le modèle d'apprentissage profond a également très bien performé sur cette tâche. Cependant, les chercheurs soupçonnaient que ce score parfait n'était pas dû au fait que les ordinateurs comprenaient réellement le contenu des rapports. Ils ont remarqué que les indices qu'ils avaient donnés au modèle classique comprenaient des mots-clés spécifiques qui étaient presque identiques aux noms des catégories. Par exemple, si un rapport était intitulé « Circulaire de paie 2024 », le modèle recevait un indicateur disant « le mot paie est présent ». Puisque la catégorie était « Paie », le modèle se voyait essentiellement donner la réponse avant même d'avoir commencé.

Pour prouver cela, les chercheurs ont supprimé ces indices de mots-clés spécifiques et ont relancé le test. Le score parfait a disparu. La précision du modèle a considérablement chuté, se stabilisant à un niveau qui restait très bon mais loin d'être parfait. Cela a confirmé que le succès initial était largement dû à un raccourci : les rapports contenaient souvent leurs propres noms de catégorie dans leurs titres. Les modèles d'apprentissage profond, qui lisent le texte directement, ont également trouvé ce raccourci et ont obtenu des scores élevés similaires, prouvant que le texte brut contenait la réponse, et non nécessairement une compréhension profonde de la structure du document. Lorsque les chercheurs ont examiné les autres tâches, la situation a changé. Prédire quels rapports seraient populaires était beaucoup plus difficile. Les modèles classiques ont performé de manière raisonnable, identifiant correctement les rapports populaires environ trois quarts du temps, tandis que les modèles d'apprentissage profond ont davantage éprouvé de difficultés. Les modèles d'apprentissage profond ont également montré un comportement étrange : lorsque les chercheurs ont tenté de les « affiner » (fine-tuning) en leur donnant plus de temps d'entraînement, leurs performances se sont en réalité dégradées. Cela suggère qu'avec une collection aussi petite de documents, les modèles complexes d'apprentissage profond étaient trop sensibles et commençaient à mémoriser les données d'entraînement plutôt qu'à apprendre des règles générales.

L'étude conclut que pour les petites archives gouvernementales comme celle-ci, les outils d'apprentissage automatique classiques et simples sont un meilleur point de départ que les systèmes d'apprentissage profond plus complexes. Ces outils plus simples sont plus faciles à comprendre et moins susceptibles de tomber en panne lorsque les données sont limitées. Cependant, les chercheurs avertissent que toute personne utilisant ces outils doit être prudente pour ne pas se fier à des raccourcis. Si un modèle est entraîné à reconnaître une catégorie parce que le mot « Paie » apparaît dans le titre, il pourrait échouer complètement lorsqu'un nouveau rapport utilise une formulation différente. La conclusion la plus honnête de ce travail est que, bien que les ordinateurs puissent aider à organiser ces dossiers financiers, ils ne sont pas encore magiques. Ils fonctionnent mieux lorsque les données sont claires et les indices authentiques, mais sur des ensembles de données petits et imparfaits, leurs scores impressionnants peuvent parfois masquer un manque de véritable compréhension. Les chercheurs suggèrent qu'avant qu'un portail gouvernemental ne déploie un tel système, il doit être testé rigoureusement pour s'assurer qu'il apprend les bonnes choses, et non qu'il se contente de copier les étiquettes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →