← Derniers articles
💬 NLP

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

Ce papier présente un nouveau jeu de données de référence et un cadre d'évaluation pour cinq systèmes commerciaux de reconnaissance automatique de la parole sur la parole en code-switching couvrant les paires de langues arabe, persane et allemande, démontrant que ElevenLabs Scribe v2 obtient les meilleures performances tout en soulignant la supériorité de BERTScore par rapport au taux d'erreur mot traditionnel pour gérer la variance de translittération et en révélant des écarts de performance grâce à une analyse stratifiée par difficulté.

Auteurs originaux : Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad

Publié 2026-05-20
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un groupe de traducteurs comment gérer une situation très spécifique et délicate : des personnes qui parlent deux langues dans la même phrase. Dans le monde réel, cela arrive tout le temps. Un ingénieur logiciel au Caire pourrait dire : « The deadline is tomorrow, we need to ship the update », mélangeant des mots techniques anglais avec une grammaire arabe. Un développeur à Téhéran pourrait dire : « This new feature has a lot of bugs », mélangeant le farsi et l'anglais.

Ce papier est comme un bulletin scolaire pour cinq systèmes commerciaux différents de « parole vers texte » (ceux que vous pourriez utiliser sur votre téléphone ou dans une application de réunion) afin de voir comment ils gèrent ce défi spécifique de « changement de code ».

Voici le détail de ce qu'ils ont fait et de ce qu'ils ont découvert, en utilisant des analogies simples :

1. Le Problème : La « Chambre Propre » vs Le « Marché Animé »

La plupart des entreprises testent leurs systèmes de reconnaissance vocale dans une « chambre propre ». Elles leur font écouter un audio clair et monolingue (comme un présentateur de nouvelles lisant un script) et leur attribuent une note basée sur le nombre de mots correctement reconnus.

  • L'Argument du Papier : C'est comme tester une voiture uniquement sur un circuit de course lisse et vide. Cela ne vous dit rien sur la façon dont la voiture gère une rue de marché cahoteuse et bondée où les gens crient dans différentes langues en même temps.
  • La Réalité : Les conversations réelles sont désordonnées. Les gens changent de langue au milieu d'une phrase, souvent sans y penser. Le papier soutient que les anciens tests de « chambre propre » sont trompeurs pour ces scénarios du monde réel.

2. La Construction du Test : Le Pipeline du « Repéreur de Talents »

Pour créer un test équitable, les chercheurs n'ont pas simplement pris des enregistrements au hasard. Ils ont construit un système de « Repéreur de Talents » en deux étapes pour trouver les exemples les plus difficiles et les plus intéressants parmi des milliers de candidats :

  • Étape 1 (Le Filtre Rapide) : Ils ont utilisé une règle informatique simple pour repérer les phrases qui semblaient mélanger deux écritures (comme des lettres arabes et des lettres anglaises). C'est comme un videur vérifiant les pièces d'identité à la porte.
  • Étape 2 (Le Jury d'Experts) : Les candidats restants ont été envoyés à deux « juges » d'IA super-intelligents (GPT-4o et Gemini 1.5 Pro). Ces juges ont lu les phrases et les ont notées sur six facteurs différents de « difficulté », tels que la fréquence des changements de langue, la complexité de l'argot et le degré de confusion des sons.
  • Le Résultat : Ils se sont retrouvés avec 1 200 phrases difficiles (300 pour chaque paire de langues : arabe-anglais, persan-anglais et allemand-anglais). Ce processus leur a permis d'économiser une somme d'argent massive (environ 91 %) par rapport à demander aux juges d'IA de lire chaque phrase individuelle.

3. La Notation : La « Règle » vs Le « Traducteur »

C'est la découverte la plus importante du papier. Ils ont utilisé deux méthodes différentes pour noter les systèmes :

  • La Règle (Taux d'Erreur de Mots - WER) : C'est la méthode traditionnelle. Elle compte chaque lettre et chaque mot qui ne correspond pas. Si le locuteur a dit « feature » et que l'ordinateur a écrit le mot persan pour « feature » (qui signifie la même chose mais s'écrit différemment), la Règle dit : « Faux ! C'est une erreur. »
  • Le Traducteur (BERTScore) : C'est une méthode plus intelligente. Elle comprend le sens. Si le locuteur a dit « feature » et que l'ordinateur a écrit le mot persan pour « feature », le Traducteur dit : « Excellent travail ! Vous avez compris le sens, même si l'orthographe est différente. »
  • La Découverte : Pour des langues comme l'arabe et le persan, où les mots peuvent s'écrire de différentes manières tout en ayant le même sens, la « Règle » est trop sévère. Elle pénalise les systèmes pour leur créativité orthographique. Le « Traducteur » (BERTScore) donne une note beaucoup plus équitable.

4. Les Résultats de la Course

Ils ont testé cinq grands systèmes commerciaux. Voici comment ils se sont classés :

  • Le Vainqueur : ElevenLabs Scribe v2 était le champion clair. Il a obtenu le taux d'erreur le plus bas et le score de sens le plus élevé pour les quatre paires de langues. Il était particulièrement bon pour gérer les mélanges complexes d'arabe et de persan.
  • Le Peloton de Milieu : OpenAI et Google ont fait correctement, mais ils ont commis nettement plus d'erreurs que le vainqueur, en particulier sur les phrases les plus difficiles.
  • Le Lutteur : Azure (Microsoft) avait les taux d'erreur les plus élevés. Cependant, le papier note que si vous demandez à Azure de « continuer à vérifier » la langue constamment (au lieu de ne vérifier qu'une seule fois au début), il s'améliore un peu, mais il reste en retrait.
  • Le Cas Particulier : Deepgram n'a été testé que sur l'allemand-anglais car il ne prend pas officiellement en charge l'arabe ou le persan. Sur l'allemand, il s'est très bien débrouillé, mais on ne peut pas le comparer aux autres car le test était plus facile (les deux langues utilisent le même alphabet).

5. La Découverte du « Mode Difficile »

Les chercheurs ont décomposé le test par niveau de difficulté (Facile, Moyen, Difficile, Expert).

  • La Surprise : Sur les phrases « Faciles », tous les systèmes semblaient assez similaires. Mais sur les phrases « Expert » (les plus difficiles), l'écart a explosé.
  • L'Analogie : Imaginez une course où tout le monde court à la même vitesse sur une piste plate. Mais lorsque la piste se transforme en une montagne rocheuse et escarpée, un coureur (ElevenLabs) continue d'escalader régulièrement, tandis que les autres commencent à glisser et à tomber. La note moyenne cache cette énorme différence ; vous ne voyez le véritable écart que lorsque vous regardez les défis les plus difficiles.

6. La Preuve Visuelle

Pour prouver que le « sens » compte plus que l'« orthographe » pour ces langues, ils ont utilisé une carte visuelle (comme un GPS pour les mots).

  • Ils ont tracé les phrases « correctes » et les phrases « devinées par l'ordinateur » sur une carte.
  • Le Résultat : Même lorsque l'ordinateur utilisait une écriture différente (comme écrire un mot anglais en lettres persanes), les points sur la carte se trouvaient juste à côté les uns des autres. Cela prouve que l'ordinateur a compris le sens, même si la « Règle » (WER) disait que c'était faux.

La Conclusion

Si vous construisez un produit pour des personnes qui parlent plusieurs langues en un seul souffle, ne regardez pas uniquement le score standard de « Taux d'Erreur de Mots ». C'est comme juger un chef uniquement sur la perfection avec laquelle il hache les oignons, en ignorant si la soupe a bon goût.

  • Utilisez le « Score de Sens » (BERTScore) pour l'arabe et le persan.
  • Testez sur les phrases les plus « Difficiles », pas seulement sur les faciles.
  • ElevenLabs Scribe v2 est actuellement le meilleur pour cette tâche spécifique, mais le papier met en garde contre le fait que des facteurs réels comme la vitesse (latence) et le coût comptent également lors du choix d'un système pour une entreprise.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →