← Derniers articles
⚡ electrical engineering

Pisets: A Robust Speech Recognition System for Lectures and Interviews

Cet article présente « Pisets », un système robuste de reconnaissance vocale russe conçu pour les conférences et les entretiens, qui améliore la précision de la transcription et réduit les hallucinations par rapport aux modèles Whisper standards en employant une architecture à trois composants combinant Wav2Vec2, l'Audio Spectrogram Transformer et Whisper avec un apprentissage par curriculum et une modélisation avancée de l'incertitude.

Auteurs originaux : Ivan Bondarenko, Daniil Grebenkin, Oleg Sedukhin, Mikhail Klementev, Roman Derunets, Lyudmila Budneva

Publié 2026-01-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ivan Bondarenko, Daniil Grebenkin, Oleg Sedukhin, Mikhail Klementev, Roman Derunets, Lyudmila Budneva

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de transcrire un long et complexe cours donné par un professeur qui parle vite, marmonne parfois, et est entouré par les bruits de la craie frappant un tableau noir. Si vous demandez à un assistant IA standard d'écrire cela, il pourrait noter les mots correctement mais inventer des faits qui ne se sont jamais produits (une « hallucination »), ou bien omettre des phrases entières parce qu'il a été perturbé par le bruit.

Les auteurs de cet article ont construit un système appelé « Pisets » (ce qui signifie « scribe » en russe) pour résoudre ce problème. Considérez Pisets non pas comme un robot unique, mais comme une équipe éditoriale de trois personnes travaillant ensemble pour produire une transcription parfaite.

Voici comment leur « équipe » fonctionne, en utilisant des analogies simples :

1. Le premier éditeur : L'« oreille super-sensible » (Wav2Vec2)

Dans une configuration normale, l'ordinateur essaie d'écouter tout le fichier audio d'un coup. Pisets commence par un spécialiste appelé Wav2Vec2.

  • L'analogie : Imaginez un détective qui est incroyablement doué pour repérer quand quelqu'un parle et quand il y a du silence. Contrairement aux outils standards qui se contentent de deviner en fonction du volume (comme un simple détecteur de mouvement), ce détective utilise le « contexte » pour savoir exactement où une phrase commence et où elle finit.
  • L'astuce : L'équipe a entraîné ce détective en utilisant une méthode appelée Apprentissage par Curriculum (Curriculum Learning). Au lieu de jeter immédiatement les conférences les plus difficiles et les plus bruyantes sur le détective, ils ont commencé par des enregistrements clairs et calmes, puis ont ajouté progressivement du bruit et des accents. C'est comme un étudiant qui apprend à conduire : d'abord dans un parking vide, puis dans des rues calmes, et enfin dans un trafic dense. Cela a rendu le détective bien meilleur pour trouver la parole dans des environnements désordonnés.

2. Le deuxième éditeur : Le « filtre à bruit » (AST)

Une fois que le premier éditeur a découpé l'audio en segments, le second spécialiste, l'Audio Spectrogram Transformer (AST), entre en scène.

  • L'analogie : Parfois, le premier éditeur s'excite et pense qu'un éternuement ou le grincement d'une chaise est une personne qui parle. Ce deuxième éditeur agit comme un inspecteur de contrôle qualité strict. Il examine les ondes sonores et dit : « Attendez, c'est juste un bruit de fond, pas une voix humaine. »
  • Le résultat : Il filtre les « fausses alertes » avant que la transcription finale ne se produise, garantissant que l'étape suivante ne perde pas de temps à essayer d'écrire des inepties.

3. Le troisième éditeur : Le « Maître Scribe » (Whisper)

Enfin, l'audio nettoyé est transmis au modèle Whisper, qui est célèbre pour être très bon pour transformer la parole en texte.

  • L'analogie : C'est le maître écrivain qui tape réellement les mots. Parce que les deux éditeurs précédents ont fait leur travail, l'écrivain n'est pas distrait par le bruit ou le silence.
  • Le filet de sécurité : L'équipe a également ajouté une « vérification de cohérence ». Ils comparent ce que le Maître Scribe a écrit avec ce que le Premier Éditeur (le détective) a entendu. S'ils ne sont pas d'accord de manière significative, le système signale que cela est potentiellement erroné. Ils utilisent également une astuce mathématique spéciale (BIRM) pour s'assurer que l'écrivain reste précis, même lorsque l'audio est difficile.

Pourquoi est-ce meilleur que la concurrence ?

L'article compare Pisets à d'autres systèmes comme WhisperX.

  • WhisperX est comme un dactylo rapide qui utilise un détecteur de mouvement standard pour trouver la parole. Il est bon, mais il peut être confus par le bruit.
  • Pisets est comme ce même dactylographe, mais il travaille avec une équipe de spécialistes qui nettoient l'audio et vérifient le travail au préalable.
  • Le résultat : Dans des tests avec de longs cours (20 à 40 minutes) contenant du bruit (comme des sons de craie ou de la musique), Pisets a commis moins d'erreurs et a inventé moins de faux faits que les systèmes standards.

La fonctionnalité « Incertitude » : Le « Surligneur Jaune »

L'une des parties les plus intéressantes de Pisets est sa capacité à dire : « Je ne suis pas sûr de cette partie. »

  • L'analogie : Imaginez un correcteur qui ne se contente pas de corriger les erreurs, mais qui surligne les phrases dont il n'est pas sûr en jaune.
  • Comment ça marche : Le système calcule un « score de confiance » pour chaque mot. Si le système est incertain (peut-être parce que l'audio était très fort ou que l'orateur a marmonné), il marque ce mot.
  • Le bénéfice : L'article montre qu'en surlignant seulement 5 % des mots (ceux dont le système est le moins sûr), ils peuvent attraper 35 % de toutes les erreurs. Cela permet à un humain de parcourir rapidement la transcription et de ne vérifier que les parties surlignées, plutôt que de lire l'intégralité du texte du début à la fin.

Résumé

Le système « Pisets » est un outil robuste conçu pour les scientifiques et les journalists qui ont besoin de transformer de longs enregistrements bruyants de conférences et d'entretiens en un texte précis. En décomposant le travail en un détective (trouver la parole), un filtre (éliminer le bruit) et un scribe (écrire le texte), et en ajoutant un surligneur pour les parties incertaines, ils ont créé un système plus fiable et moins enclin à inventer des faits que les modèles d'IA précédents.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →