← Derniers articles
💬 NLP

Swiss Parliaments Corpus Re-Imagined (SPC_R): Enhanced Transcription with RAG-based Correction and Predicted BLEU

Ce papier présente le corpus SPC_R, une nouvelle version étendue des débats du parlement suisse qui combine la transcription par Whisper Large-v3, une correction en deux étapes par GPT-4o et un filtrage basé sur le BLEU prédit pour produire 555 heures de données audio-texte de haute qualité, surpassant la version originale de 6 points de BLEU.

Auteurs originaux : Vincenzo Timmel, Manfred Vogel, Daniel Perruchoud, Reza Kakooee

Publié 2026-03-13
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Vincenzo Timmel, Manfred Vogel, Daniel Perruchoud, Reza Kakooee

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🎙️ Le Projet : Transformer le "Brouhaha" en Livre d'Or

Imaginez que vous avez une immense bibliothèque remplie d'enregistrements audio de débats parlementaires en Suisse-Allemand (une langue très locale, un peu comme un patois riche et complexe). Le problème ? Ces enregistrements durent des heures, et personne n'a le temps de les transcrire mot à mot en Allemand Standard (la langue officielle des livres et des journaux) pour créer un manuel d'apprentissage.

Les chercheurs de l'Université FHNW ont créé un projet appelé SPC_R. Leur but ? Transformer ces heures de "brouhaha" en un texte parfait, propre et utilisable pour entraîner des intelligences artificielles à comprendre la Suisse.

Voici comment ils ont fait, étape par étape, avec des analogies simples :


1. Le Premier Pass : Le Scribe Rapide (Whisper)

Imaginez un scribe très rapide, nommé Whisper, qui écoute les débats et écrit tout ce qu'il entend.

  • Le problème : Ce scribe est rapide, mais il n'est pas parfait. Il entend parfois "Alba Rutschi" au lieu de "Alberucci" (une erreur sur un nom propre) ou il se trompe sur les conjugaisons. C'est comme si un traducteur automatique écoutait un accent suisse très fort et se trompait sur les noms des villages.
  • La solution : Ils ont utilisé une version très puissante de ce scribe (Whisper Large-v3) avec beaucoup de puissance de calcul pour obtenir une première ébauche de texte.

2. Le Détective et le Contexte (La Correction par IA)

Une fois le texte brut obtenu, ils ne l'ont pas laissé tel quel. Ils ont fait appel à un détective ultra-intelligent (une IA appelée GPT-4o).

  • L'astuce du détective : Ce détective ne travaille pas seul. Il a accès à un "livre de référence" officiel (les comptes-rendus réels du parlement). C'est ce qu'on appelle le RAG (Retrieval-Augmented Generation).
  • L'analogie : Imaginez que le scribe écrit : "Le député a parlé de la pomme." Le détective, en regardant le livre de référence, se dit : "Attends, dans ce débat, on parlait de la 'pomme de terre' (un terme politique local), pas d'une pomme !" Il corrige alors l'erreur.
  • Le résultat : Les noms des personnes, des partis politiques et des lieux sont devenus 100 % corrects.

3. Le Jury de Contrôle (L'Évaluation)

Avant de valider le texte, il faut s'assurer qu'il est vraiment bon. Ils ont utilisé un jury (une autre IA, GPT-4o-mini) pour noter chaque phrase.

  • Le système de notation :
    • Note 3 : Parfait. Tout est juste.
    • Note 2 : Presque parfait, une petite faute de grammaire sans importance.
    • Note 1 : Il y a une erreur grave (un nom mal écrit).
    • Note 0 : Inutilisable.
  • Le filtre magique : Ils ont aussi inventé une façon de prédire la qualité sans avoir à tout relire à la main. Ils utilisent un "thermomètre de confiance" (basé sur les probabilités de l'IA) pour deviner si le texte sera bon ou non. C'est comme si le scribe disait : "Je suis à 90 % sûr de ce que j'ai écrit". Si la confiance est basse, on jette le texte.

4. Le Résultat Final : Un Trésor de Données

Au départ, ils avaient 801 heures d'enregistrements.

  • Après avoir éliminé les parties floues, mal transcrites ou trop incertaines (comme on trie les pommes pourries du panier), il reste 555 heures de qualité exceptionnelle.
  • C'est un énorme trésor pour les chercheurs : c'est du Suisse-Allemand (très rare dans les données informatiques) aligné parfaitement avec de l'Allemand Standard.

Pourquoi est-ce important ?

Avant ce projet, les ordinateurs avaient du mal à comprendre le suisse-allemand car ils manquaient de "livres" pour apprendre.

  • Avant : C'était comme essayer d'apprendre à nager sans jamais avoir vu d'eau.
  • Maintenant : Grâce à ce corpus (SPC_R), les nouvelles intelligences artificielles peuvent "lire" ces 555 heures de débats. Elles vont apprendre à comprendre les accents, les noms locaux et les expressions suisses, ce qui les rendra beaucoup plus intelligentes pour nous aider au quotidien (assistants vocaux, sous-titrage en direct, etc.).

En résumé : C'est une chaîne de montage intelligente où une IA rapide fait le gros du travail, une IA experte corrige les erreurs grâce à des documents officiels, et un jury filtre le tout pour ne garder que le meilleur. Le résultat est un manuel d'apprentissage géant pour les robots qui veulent parler comme un vrai Suisse.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →