← Derniers articles
⚡ electrical engineering

Qwen3-ASR Technical Report

Ce rapport présente la famille Qwen3-ASR, comprenant deux modèles de reconnaissance vocale tout-en-un de haute performance (0,6B et 1,7B de paramètres) ainsi qu'un nouveau modèle d'alignement forcé non autorégressif, qui atteignent collectivement une précision et une efficacité de pointe dans 52 langues tout en étant publiés sous une licence Apache 2.0.

Auteurs originaux : Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

Publié 2026-02-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez le monde de la technologie de la parole comme une ville bouillonnante. Pendant des années, les « policiers » (les systèmes traditionnels de reconnaissance vocale) étaient très doués pour lire des panneaux écrits clairs dans une pièce calme. Mais si vous criiez dans un marché bondé, chantiez une chanson ou parliez avec un accent prononcé, ils s'embrouillaient souvent ou abandonnaient.

L'équipe Qwen3-ASR vient de lancer un nouvel ensemble de « super-policiers » et un « gardien du temps » qui changent la donne. Voici ce qu'ils ont construit, expliqué simplement :

1. Les deux super-policiers : Qwen3-ASR-1.7B et Qwen3-ASR-0.6B

Considérez ces deux modèles comme une paire de détectives ayant des forces différentes, tous deux formés par un « super-mentor » (un modèle de fondation appelé Qwen3-Omni) qui comprend profondément le monde.

  • Le Grand Détective (Qwen3-ASR-1.7B) : C'est le poids lourd. C'est comme un vétéran chevronné qui a tout entendu. Il peut écouter une conversation dans une usine bruyante, comprendre une chanson avec un groupe complet en arrière-plan, ou comprendre ce que quelqu'un dit même s'il parle un dialecte rare. Il est si bon qu'il rivalise avec les services les plus chers et fermés gérés par les géants de la technologie.
  • Le Détective Rapide (Qwen3-AS_R-0.6B) : C'est le partenaire léger et agile. Il est plus petit et plus rapide. Imaginez un détective capable de courir un marathon tout en résolvant un puzzle. Il est conçu pour être incroyablement efficace. L'article affirme qu'il peut écouter 2 000 secondes de parole en seulement 1 seconde lorsqu'il exécute de nombreuses tâches simultanément. Il est parfait pour être intégré dans votre téléphone ou un petit appareil car il n'a pas besoin d'un ordinateur massif pour fonctionner.

Qu'est-ce qui les rend spéciaux ?

  • Le chapeau de « Traducteur Universel » : Ils ne parlent pas seulement l'anglais ou le mandarin ; ils comprennent 52 langues et dialectes. Que vous parliez le chinois standard, un dialecte régional spécifique comme le sichuanais, ou une langue comme le vietnamien, ils peuvent changer de chapeau instantanément.
  • Les oreilles « Réducteurs de Bruit » : Ils ont été entraînés pour ignorer le chaos. Si vous chantez une chanson pendant qu'un tambour bat, ou si un enfant crie dans une rue animée, ces modèles peuvent toujours entendre les mots clairement.
  • Le badge « Identification de la Langue » : Avant même d'écrire les mots, ils savent exactement quelle langue vous parlez. Ils peuvent faire la différence entre des langues aux sonorités similaires (comme le malais et l'indonésien) avec une grande précision.

2. Le Gardien du Temps : Qwen3-ForcedAligner-0.6B

Autrefois, si vous vouliez savoir exactement quand un mot commençait et finissait dans un enregistrement (comme pour créer des sous-titres), vous deviez utiliser une machine lente et lourde qui faisait souvent des erreurs.

L'équipe a introduit un nouvel outil appelé Qwen3-ForcedAligner.

  • L'analogie : Imaginez que vous avez une transcription (les mots) et un enregistrement (le son). Les anciens outils étaient comme essayer de faire correspondre les mots au son en devinant. Ce nouveau modèle est comme un gardien du temps super-rapide et non-autorégressif.
  • Comment ça marche : Au lieu de deviner un mot à la fois (ce qui est lent), il regarde la phrase entière et attribue un horodatage à chaque mot ou caractère instantanément.
  • Le résultat : Il est incroyablement précis et rapide. Il peut gérer 11 langues et fonctionne même si l'orateur change de langue au milieu d'une phrase. Il est si rapide qu'il peut traiter une heure d'audio en quelques minutes seulement.

3. Comment ils ont appris (L'entraînement)

Vous vous demandez peut-être : « Comment sont-ils devenus aussi intelligents ? »

  • La Fondation : Ils ont commencé avec un modèle qui comprenait déjà l'audio, la vision et le texte (Qwen3-Omni).
  • La Pratique : Ils se sont entraînés sur une immense bibliothèque de 40 millions d'heures de parole enregistrée (principalement du chinois et de l'anglais).
  • L'exercice du « Monde Réel » : Ils ne se sont pas contentés de s'entraîner dans un studio calme. Ils ont été testés sur :
    • Les personnes âgées et les enfants : Différentes hauteurs de voix.
    • Les virelangues : Une parole rapide et difficile.
    • Le chant : Des mélodies qui étirent les mots.
    • Le bruit de fond : Musique forte et foules.
  • La leçon de « Renforcement » : Enfin, ils ont utilisé une méthode d'entraînement spéciale (Apprentissage par Renforcement) où ils étaient corrigés sur leurs erreurs les plus difficiles, ce qui les rend beaucoup plus robustes dans le chaos de la vie réelle.

4. Les Résultats : Pourquoi c'est important

L'article compare ces nouveaux modèles aux meilleurs concurrents (qu'ils soient gratuits et open-source ou payants et commerciaux).

  • Précision : Le grand modèle (1.7B) est souvent le modèle open-source le plus précis disponible, battant ou égalant les services payants les plus coûteux.
  • Vitesse : Le petit modèle (0.6B) est le plus rapide, offrant le meilleur équilibre entre vitesse et intelligence.
  • Polyvalence : Ils sont les premiers à combiner la reconnaissance vocale de haute qualité, l'identification de la langue et la reconnaissance du chant dans un seul pack qui fonctionne pour des dizaines de langues.

En résumé : La famille Qwen3-ASR est un ensemble d'outils qui permet aux ordinateurs de comprendre la parole humaine aussi bien qu'un humain le ferait, même dans des situations bruyantes, désordonnées ou musicales, et ce, dans de nombreuses langues différentes. Ils ont rendu ces outils gratuits pour que tout le monde puisse les utiliser, dans l'espoir d'aider les chercheurs et les développeurs à construire de meilleures technologies vocales pour l'avenir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →