← Últimos artículos
💬 NLP

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

Este artículo presenta una reimplementación del flujo de trabajo de seguimiento de instrucciones de NAVER LABS IWSLT 2025 para la Tarea Compartida 2026, adaptándolo con los componentes obligatorios SeamlessM4T-v2-large y Qwen3-4B-Instruct e introduciendo 100k ejemplos de entrenamiento sintéticos para lograr un alto rendimiento en los puntos de referencia de traducción de voz y de respuesta a preguntas habladas.

Autores originales: Anand Kamble, Aniket Tathe

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anand Kamble, Aniket Tathe

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un bibliotecario muy inteligente y culto (el LLM, o Modelo de Lenguaje Grande) que sabe escribir y responder preguntas perfectamente. Sin embargo, este bibliotecario es "sordo": no puede escuchar archivos de audio, solo puede leer texto.

Por otro lado, tienes a un grabador de audio especializado (el Codificador de Voz) que es excelente escuchando sonidos y convirtiéndolos en un "mapa de sonido" digital, pero no sabe hablar ni razonar.

El objetivo de este artículo es construir un puente traductor entre el bibliotecario sordo y el grabador de audio para que puedan trabajar juntos como un solo equipo. Este equipo está diseñado para seguir instrucciones como "Traduce este discurso", "Resume este audio" o "Responde preguntas sobre lo que escuchaste".

Aquí es donde los autores construyeron este equipo, utilizando analogías sencillas:

1. Los miembros del equipo

  • El Bibliotecario (Qwen3-4B): Una IA poderosa que ya sabe cómo seguir instrucciones en texto.
  • El Grabador (SeamlessM4T-v2-large): Una herramienta de vanguardia que convierte la voz humana en datos digitales.
  • El Puente (Proyector): Un componente nuevo y entrenable que traduce el "mapa de sonido" del grabador a un lenguaje que el bibliotecario pueda entender.

2. El proceso de entrenamiento de tres etapas

Los autores no solo los pegaron; entrenaron a ambos en tres pasos específicos, como entrenar a un nuevo empleado:

  • Etapa 1: Aprender a escuchar (Alineación del Proyector)
    • Qué sucedió: El bibliotecario y el grabador fueron congelados (bloqueados en su lugar). Solo se entrenó el "Puente".
    • La analogía: Imagina que el bibliotecario está sentado en una habitación insonorizada. El Puente aprende a tomar las ondas sonoras puras del grabador y convertirlas en notas escritas que el bibliotecario pueda leer. Practicaron con miles de ejemplos de voz y texto (como transcripciones de discursos) para que el Puente aprenda el "vocabulario" adecuado para describir sonidos.
  • Etapa 2: El campamento de entrenamiento de texto del bibliotecario (LoRA de solo texto)
    • Qué sucedió: El audio se apagó. El bibliotecario recibió una enorme cantidad de datos de texto para practicar la respuesta a preguntas y la traducción de idiomas, pero esta vez, se le permitió realizar pequeños y eficientes ajustes en su cerebro (usando una técnica llamada LoRA).
    • La analogía: El bibliotecario ahora está en una biblioteca silenciosa, practicando sus habilidades de traducción y respuesta a preguntas sobre papel. Aún no está escuchando audio; solo está agudizando su lógica y sus habilidades lingüísticas para estar listo para el mundo real. Los autores probaron diferentes "tamaños de ajuste" (rangos) para ver cuál hacía al bibliotecario más inteligente sin romper su memoria.
  • Etapa 3: El ensayo general (Fusión Multimodal)
    • Qué sucedió: El audio se encendió de nuevo. Ahora, el Puente y el Bibliotecario practicaron juntos.
    • La analogía: El bibliotecario y el grabador finalmente están en la misma habitación. Practican escuchando un discurso, dejando que el Puente traduzca el sonido y que el bibliotecario responda. Para asegurar que el bibliotecario no olvide sus habilidades de texto mientras aprende a escuchar, alternan entre ejercicios de escucha y ejercicios de solo texto. Esto asegura que no se "confunda" (un problema llamado olvido catastrófico).

3. Los datos de práctica "falsos"

Una de las contribuciones únicas del artículo es la creación de 100,000 ejemplos sintéticos.

  • La analogía: Dado que los datos del mundo real para cada tarea posible (como "describir el tono de voz del hablante" o "extraer palabras clave") eran escasos, los autores usaron otra IA (Gemma) para inventar 10,000 escenarios de práctica falsos para 10 tipos diferentes de tareas.
  • Crearon transcripciones falsas y descripciones de audio falsas para entrenar al equipo en cosas como:
    • Extracción de palabras clave: Extraer las palabras más importantes.
    • Descripción de la voz: Describir si un hablante suena "seguro", "lento" o "fuerte" solo con escucharlo.
    • Resumen: Condensar un discurso largo en una sola oración.

4. Los resultados

Cuando probaron a su equipo final en el "examen" oficial (el benchmark MCIF):

  • Traducción: Se volvieron muy buenos traduciendo el habla de inglés a chino, alemán e italiano.
  • Respuesta a preguntas: Mejoraron significamente al responder preguntas basadas en lo que escucharon en inglés.
  • El intercambio: Curiosamente, mientras mejoraban en la comprensión del significado del habla (traducción y preguntas), su capacidad para escribir las palabras exactas escuchadas (transcripción) empeoró ligeramente en comparación con el grabador puro. Este es un intercambio común al enseñar a un sistema a entender el "significado" en lugar de solo los "sonidos".

Resumen

El artículo es esencialmente una guía de "cómo hacer" para construir un asistente de IA multilingüe y consciente del audio. Tomaron a un experto en texto sordo y un grabador con capacidad de oír pero sin inteligencia, construyeron un puente personalizado entre ellos, los entrenaron en tres etapas cuidadosas y los alimentaron con una enorme cantidad de datos de práctica (tanto reales como generados por IA). El resultado es un sistema que puede escuchar clips de audio cortos y seguir instrucciones complejas como lo haría un humano.

Limitaciones mencionadas:

  • El sistema actualmente tiene dificultades con audios de más de 15 segundos (se queda sin "energía mental" o memoria).
  • Para preguntas que no fueran en inglés, tuvieron que usar datos de práctica traducidos por máquinas, lo que podría introducir algo de "ruido" o errores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →