← Derniers articles
💬 NLP

HK-LegiCoST: Leveraging Non-Verbatim Transcripts for Speech Translation

Cet article présente HK-LegiCoST, un corpus parallèle tripartite à grande échelle composé d'audio en cantonais, de transcriptions en chinois traditionnel non verbatim et de traductions anglaises, conçu pour faire progresser la recherche en traduction automatique de la parole pour les langues où les formes parlées et écrites divergent de manière significative.

Auteurs originaux : Cihan Xiao, Henry Li Xinyuan, Jinyi Yang, Dongji Gao, Matthew Wiesner, Kevin Duh, Sanjeev Khudanpur

Publié 2026-06-16
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Cihan Xiao, Henry Li Xinyuan, Jinyi Yang, Dongji Gao, Matthew Wiesner, Kevin Duh, Sanjeev Khudanpur

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à comprendre un type de conversation très spécifique : les débats formels du Conseil législatif de Hong Kong. Mais il y a un hic : les personnes qui parlent utilisent le cantonais, un dialecte parlé riche, doté de son propre argot et de ses propres structures de phrases. Cependant, les comptes rendus officiels de ces réunions ne sont pas écrits en « pur » cantonais. Ils sont traduits en chinois standard, une langue écrite formelle qui semble d'ailleurs être un dialecte totalement différent.

C'est comme écouter un ami raconter une histoire avec un accent local très marqué, mais disposer pour cela de la transcription officielle écrite dans un style formel et rigide qui réorganise les mots et remplace l'argot par un vocabulaire poli.

C'est le défi que les chercheurs de l'université Johns Hopkins ont relevé en présentant un nouvel ensemble de données massif appelé HK-LegiCoST.

Le problème : La transcription « bruitée »

Habituellement, lorsque nous entraînons des ordinateurs à traduire la parole, nous supposons que le texte écrit correspond parfaitement aux mots prononcés. Mais dans le cas du cantonais, le compte rendu écrit est souvent une version « nettoyée » de ce qui a réellement été dit.

  • Oral : « Toi, va en premier ! » (style cantonais)
  • Écrit : « Vous allez en premier. » (style chinois standard)

Ce décalage est comparable à une tentative de faire correspondre une improvisation de jazz à une partition de musique classique. Les notes sont similaires, mais le rythme et l'ordre sont différents. Cela rend très difficile pour les ordinateurs d'apprendre à traduire directement la parole.

La solution : Construire un puzzle géant

Les chercheurs ont utilisé plus de 600 heures d'enregistrements vidéo des réunions du gouvernement de Hong Kong. Ils n'ont pas simplement fait un copier-coller des fichiers ; ils ont construit un « pipeline » complexe (une chaîne de montage étape par étape) pour transformer ces données brutes désordonnées en un ensemble d'entraînement propre et utilisable.

Voyez le processus de ces chercheurs comme celui d'un bibliothécaire de haute technologie organisant une bibliothèque chaotique :

  1. Découper la bande : Ils ont découpé les longues vidéos de réunions en clips audio digestes.
  2. L'appariement du traducteur : Ils ont utilisé une IA avancée pour faire correspondre l'audio au texte écrit. Comme le texte ne correspondait pas parfaitement mot pour mot, ils ont dû apprendre à l'IA à être flexible. C'est comme apprendre à un traducteur à ignorer le fait que le locuteur a dit « y'all » alors que le texte dit « vous tous », et à se concentrer plutôt sur le sens.
  3. Le bouton « Sauter » : Parfois, la transcription écrite incluait des notes ou des formalités qui n'avaient jamais été prononcées. Les chercheurs ont conçu un algorithme spécial qui agit comme un bouton « saut », permettant à l'ordinateur d'ignorer ces mots écrits supplémentaires et de se concentrer uniquement sur les parties qui ont réellement été dites.

Le résultat : Un nouveau terrain d'entraînement

Le produit final, HK-LegiCoST, est une bibliothèque massive de plus de 600 heures d'audio en cantonais appariées à leur transcription écrite « imparfaite » et à une traduction anglaise.

Les chercheurs ont testé leurs modèles informatiques sur ces nouvelles données et ont découvert des choses passionnantes :

  • Cela fonctionne : Même si les transcriptions étaient « bruitées » (ne correspondant pas parfaitement), les modèles informatiques ont appris à très bien traduire la parole.
  • C'est robuste : Lorsqu'ils ont testé leur modèle sur un autre ensemble de données plus petit de parole en cantonais (provenant du projet FLEURS de Google), il a obtenu des performances aussi bonnes que des modèles entraînés sur des données beaucoup plus vastes et coûteuses.
  • La magie du « Zero-Shot » : Un modèle entraîné uniquement sur ces nouvelles données de Hong Kong a été capable de gérer le jeu de données Google sans entraînement supplémentaire, prouvant que les données sont de haute qualité et généralisables.

Pourquoi cela importe

Ce document ne nous donne pas seulement un nouvel ensemble de données ; il prouve que nous pouvons construire des outils de parole puissants même lorsque les enregistrements écrits ne correspondent pas parfaitement aux paroles prononcées. C'est un modèle pour traiter les langues où les versions « parlées » et « écrites » sont souvent en contradiction, ce qui est courant dans de nombreux dialectes et vernaculaires à travers le monde.

En bref, les chercheurs ont pris un problème réel et désordonné (des réunions gouvernementales où le script ne correspond pas au discours) et l'ont transformé en un outil puissant et propre qui aide les ordinateurs à comprendre la véritable voix des gens, et non pas seulement les mots formels sur la page.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →