← Derniers articles
⚡ electrical engineering

MOSS Transcribe Diarize Technical Report

MOSS Transcribe Diarize est un grand modèle de langage multimodal unifié qui atteint l'état de l'art en matière de transcription horodatée et attribuée aux locuteurs en exploitant une fenêtre de contexte de 128k et un entraînement de bout en bout sur des données réelles étendues pour surmonter les limitations des systèmes existants.

Auteurs originaux : MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong
Publié 2026-07-20
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong, Yuqian Zhang, Wenbo Zhang, Songlin Wang, Zhiyu Wu, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes assis dans un café bondé, essayant de noter exactement ce que trois amis différents se disent. Vous devez savoir non seulement les mots, mais aussi qui les a dits et exactement quand ils ont parlé. C'est le défi de la « Transcription avec Attribution de Locuteur et Horodatage » (SATS - Speaker-Attributed, Time-Stamped Transcription). C'est un superpouvoir pour les ordinateurs, transformant un enregistrement audio désordonné en un script propre et organisé où chaque phrase est étiquetée avec le nom du locuteur et un temps précis. C'est incroyablement utile pour des choses comme transcrire des réunions professionnelles, analyser des appels de service client ou aider les personnes malentendantes à suivre des conversations complexes.

Jusqu'à présent, les ordinateurs essayaient généralement de résoudre cela en deux étapes distinctes. D'abord, un robot de « reconnaissance vocale » écoutait et tapait les mots. Ensuite, un autre robot, le « détective de locuteurs », essayait de déterminer qui disait quoi. Le problème est que ces deux robots ne communiquent souvent pas entre eux. Si le premier robot fait une petite erreur, le second devient confus, et le script final devient un fouillis. C'est comme essayer d'assembler un puzzle dont la moitié des pièces proviennent d'une boîte différente. Ce nouvel article présente un nouveau type de cerveau informatique qui fait les deux tâches en même temps, en un seul mouvement fluide.

La solution du modèle unique

L'équipe derrière ce projet, OpenMOSS, a construit un nouveau modèle appelé MOSS Transcribe Diarize. Voyez ce modèle comme un chef d'orchestre super intelligent et multitâche. Au lieu d'engager un orchestre séparé pour les mots et un autre pour les voix, ce chef d'orchestre garde toute la partition dans sa tête et dirige l'ensemble de la performance en une seule fois.

Par le passé, les ordinateurs avaient du mal avec les longues conversations. Si une réunion durait une heure, les anciens systèmes devaient découper l'audio en petites tranches de 30 secondes, résoudre chaque tranche, puis essayer de les recoller. Cela entraînait souvent le fait que l'ordinateur oubliait qui était le « Locuteur A » après la pause, ou perdait le fil de la conversation. MOSS Transcribe Diarize change la donne en possédant une immense « fenêtre de mémoire » de 128k tokens. Pour donner un ordre d'idée, cela permet au modèle d'écouter et de comprendre jusqu'à 90 minutes d'audio en une seule passe ininterrompue. Il n'a pas besoin de découper l'audio ; il entend toute l'histoire du début à la fin, gardant une image mentale claire de qui est qui, même si quelqu'un n'a pas parlé depuis un certain temps.

Comment cela fonctionne (Le tour de magie)

Le modèle est un « grand modèle de langage multimodal », une façon sophistiquée de dire qu'il peut lire du texte et écouter de l'audio en même temps. Voici l'astuce :

  1. Les Oreilles : Il prend les ondes sonores brutes et les convertit en un format numérique.
  2. Le Traducteur : Il utilise une « projection » spéciale pour transformer ces ondes sonores en un langage que la partie du cerveau lisant le texte peut comprendre.
  3. La Sortie : Au lieu de simplement recracher des mots, il produit un script qui ressemble à ceci : [0.11] [S01] Bonjour ! [1.03] [S02] Bonjour, les gars !. Il vous indique l'ID du locuteur (S01, S02), l'heure exacte à laquelle ils ont commencé à parler, et les mots qu'ils ont dits, le tout en une seule passe directe.

Pour enseigner ce modèle, les chercheurs n'ont pas seulement utilisé des enregistrements de qualité studio très propres. Ils l'ont nourri d'une énorme quantité de données « réelles et sauvages » — des enregistrements provenant d'Internet qui incluent du bruit de fond, des voix qui se chevauchent, différents accents et des gens qui se coupent la parole. Ils ont également créé des conversations « simulées » où ils ont mélangé et associé différentes voix pour apprendre au modèle comment gérer les situations délicates, comme lorsque deux personnes parlent exactement en même temps.

Ce qu'ils ont découvert

L'équipe a testé son nouveau modèle contre certains des systèmes commerciaux les plus puissants et les plus coûteux actuellement disponibles (comme ceux de Doubao, ElevenLabs et divers modèles de Google). Ils ont utilisé trois types de tests différents :

  • AISHELL-4 : Enregistrements de réunions réelles et longues (jusqu'à environ 40 minutes).
  • Podcast : Interviews longues et de haute qualité avec plusieurs invités.
  • Films : Courts extraits avec des dialogues rapides et superposés.

Les résultats sont impressionnants. Dans presque tous les tests, MOSS Transcribe Diarize a commis moins d'erreurs que la concurrence.

  • Précision : Il a plus souvent raison sur les mots (taux d'erreur de caractères plus bas).
  • Identité : Il est bien meilleur pour garder une trace de qui disait quoi. Les chercheurs ont mesuré cela avec une métrique appelée Δcp (la différence entre les erreurs de mots et les erreurs de locuteurs). Un chiffre plus bas ici signifie que le modèle ne s s'est pas trompé sur l'identité du locuteur. MOSS Transcribe Diarize a obtenu les scores Δcp les plus bas, ce qui signifie qu'il a maintenu la cohérence des identités des locuteurs même dans des conversations longues et désordonnées.
  • Capacité sur le long format : Alors que certains modèles commerciaux célèbres (comme GPT-4o et Gemini 3 Pro) ont simplement échoué à traiter les fichiers audio longs ou n'ont pas pu produire le format correct pour eux, MOSS Transcribe Diarize a géré les entrées de 90 minutes sans sourciller.

Pourquoi cela importe

L'article suggère qu'en combinant la reconnaissance vocale et l'identification du locuteur en un système unifié doté d'une mémoire longue, nous pouvons obtenir des transcriptions plus fiables. Le modèle prouve qu'il n'est pas nécessaire de découper l'audio pour le comprendre ; on peut écouter toute la conversation à la fois et tout de même saisir les détails.

Les auteurs précisent avec prudence que, bien que leur modèle soit une étape importante, il n'est pas une baguette magique qui résout tout parfaitement. Ils voient encore des marges de progression, comme rendre le système capable de fonctionner en temps réel (streaming) et de gérer encore plus de langues. Mais pour l'instant, ils ont démontré qu'un cerveau unique et unifié peut faire le travail de deux robots distincts, et le faire mieux, surtout quand la conversation devient longue et complexe.

Le code et le modèle sont désormais ouverts à tous sur GitHub et Hugging Face, invitant d'autres personnes à voir si elles peuvent construire des outils encore meilleurs sur cette nouvelle base.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →