← Derniers articles
💬 NLP

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

Ce document présente une réimplémentation du pipeline de suivi d'instructions de NAVER LABS IWSLT 2025 pour la tâche partagée 2026, en l'adaptant avec les composants imposés SeamlessM4T-v2-large et Qwen3-4B-Instruct tout en introduisant 100 000 exemples d'entraînement synthétiques pour obtenir des performances solides sur les benchmarks de traduction automatique parlée et de réponse aux questions orales.

Auteurs originaux : Anand Kamble, Aniket Tathe

Publié 2026-07-08
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anand Kamble, Aniket Tathe

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un bibliothécaire très intelligent et érudit (le LLM, ou Grand Modèle de Langage) qui sait écrire et répondre aux questions parfaitement. Cependant, ce bibliothécaire est « sourd » : il ne peut pas entendre de fichiers audio, il ne peut que lire du texte.

D'un autre côté, vous avez un enregistreur audio spécialisé (l'Encodeur de Parole) qui est excellent pour écouter les sons et les transformer en une « carte sonore » numérique, mais il ne sait ni parler ni raisonner.

L'objectif de cet article est de construire un pont de traduction entre le bibliothécaire sourd et l'enregistreur audio afin qu'ils puissent travailler ensemble comme une seule équipe. Cette équipe est conçue pour suivre des instructions telles que « Traduisez ce discours », « Résumez cet audio » ou « Répondez à des questions sur ce que vous avez entendu ».

Voici comment les auteurs ont construit cette équipe, en utilisant des analogies simples :

1. Les membres de l'équipe

  • Le Bibliothécaire (Qwen3-4B) : Une IA puissante qui sait déjà suivre des instructions en texte.
  • L'Enregistreur (SeamlessM4T-v2-large) : Un outil de pointe qui convertit la parole humaine en données numériques.
  • Le Pont (Projecteur) : Un nouveau composant entraînable qui traduit la « carte sonore » de l'enregistreur en un langage que le bibliothécaire peut comprendre.

2. Le processus d'entraînement en trois étapes

Les auteurs ne se sont pas contentés de coller ces deux éléments ensemble ; ils les ont entraînés en trois étapes spécifiques, comme pour former un nouvel employé :

  • Étape 1 : Apprendre à écouter (Alignement du Projecteur)
    • Ce qui s'est passé : Le bibliothécaire et l'enregistreur étaient gelés (bloqués en place). Seul le « Pont » a été entraîné.
    • L'analogie : Imaginez le bibliothécaire assis dans une pièce insonorisée. Le Pont apprend à prendre les ondes sonores brutes de l'enregistreur et à les convertir en notes écrites que le bibliothécaire peut lire. Ils se sont exercés avec des milliers d'exemples de parole et de texte (comme des transcriptions de discours) afin que le Pont apprenne le bon « vocabulaire » pour décrire les sons.
  • Étape 2 : Le camp d'entraînement textuel du bibliothécaire (LoRA uniquement de texte)
    • Ce qui s'est passé : L'audio a été coupé. Le bibliothécaire a reçu une quantité massive de données textuelles pour s'exercer à répondre à des questions et à traduire des langues, mais cette fois, il était autorisé à effectuer de petits ajustements efficaces de son cerveau (en utilisant une technique appelée Lo-RA).
    • L'analogie : Le bibliothécaire est maintenant dans une bibliothèque calme, s'exerçant à ses compétences de traduction et de réponse aux questions sur papier. Il n'écoute pas encore d'audio ; il affine simplement sa logique et ses compétences linguistiques afin d'être prêt pour le monde réel. Les auteurs ont testé différentes « tailles d'ajustement » (rangs) pour voir laquelle rendait le bibliothécaire le plus intelligent sans briser sa mémoire.
  • Étape 3 : La répétition générale (Fusion Multimodale)
    • Ce qui s'est passé : L'audio a été rallumé. Maintenant, le Pont et le Bibliothécaire pratiquent ensemble.
    • L'analogie : Le bibliothécaire et l'enregistreur sont enfin dans la même pièce. Ils s'exercent à écouter un discours, à laisser le Pont traduire le son, puis le bibliothécaire répond. Pour s'assurer que le bibliothécaire n'oublie pas ses compétences textuelles en apprenant à écouter, ils alternent entre des exercices d'écoute et des exercices de texte uniquement. Cela garantit qu'il ne devient pas « confus » (un problème appelé oubli catastrophique).

3. Les données d'entraînement « fictives »

L'une des contributions uniques de l'article est la création de 100 000 exemples synthétiques.

  • L'analogie : Comme les données du monde réel pour chaque tâche possible (comme « décrire le ton de la voix du locuteur » ou « extraire des mots-clés ») étaient rares, les auteurs ont utilisé une autre IA (Gemma) pour inventer 10 000 scénarios de pratique fictifs pour 10 types de tâches différents.
  • Ils ont créé des transcriptions fictives et des descriptions audio fictives pour entraîner l'équipe sur des choses comme :
    • Extraction de mots-clés : Extraire les mots les plus importants.
    • Description de la voix : Décrire si un locuteur semble « confiant », « lent » ou « fort » juste en l'entendant.
    • Résumé : Condenser un long discours en une seule phrase.

4. Les résultats

Lorsqu'ils ont testé leur équipe finale sur l'« examen » officiel (le benchmark MCIF) :

  • Traduction : Ils sont devenus très bons pour traduire la parole de l'anglais vers le chinois, l'allemand et l'italien.
  • Réponse aux questions : Ils se sont considérablement améliorés pour répondre à des questions basées sur ce qu'ils ont entendu en anglais.
  • Le compromis : Curieusement, alors qu'ils sont devenus meilleurs pour comprendre le sens de la parole (traduction et questions), leur capacité à écrire les mots exacts entendus (transcription) a légèrement diminué par rapport à l'enregistreur brut. C'est un compromis courant lorsque l'on enseigne à un système à comprendre le « sens » plutôt que simplement les « sons ».

Résumé

Cet article est essentiellement un « guide pratique » pour construire un assistant IA multilingue et conscient de l'audio. Ils ont pris un expert en texte sourd et un enregistreur capable d'entendre mais dépourvu d'intelligence, ont construit un pont personnalisé entre eux, les ont entraînés en trois étapes méticuleuses et les ont nourris d'une énorme quantité de données d'entraînement (réelles et générées par IA). Le résultat est un système capable d'écouter de courts clips audio et de suivre des instructions complexes comme le ferait un humain.

Limites mentionnées :

  • Le système éprouve actuellement des difficultés avec les audios de plus de 15 secondes (il manque de « l'énergie mentale » ou de la mémoire).
  • Pour les questions non anglaises, ils ont dû utiliser des données d'entraînement traduites par machine, ce qui peut introduire du « bruit » ou des erreurs.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →