← Últimos artículos
⚡ electrical engineering

MOSS Transcribe Diarize Technical Report

MOSS Transcribe Diarize es un modelo de lenguaje grande multimodal unificado que logra una transcripción con marcas de tiempo y atribución de hablantes de vanguardia al aprovechar una ventana de contexto de 128k y un entrenamiento de extremo a extremo en extensos datos del mundo real para superar las limitaciones de los sistemas existentes.

Autores originales: MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong
Publicado 2026-07-20
📖 6 min de lectura🧠 Análisis profundo

Autores originales: MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong, Yuqian Zhang, Wenbo Zhang, Songlin Wang, Zhiyu Wu, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás sentado en una cafetería concurrida, tratando de escribir exactamente lo que tres amigos diferentes se dicen entre sí. Necesitas saber no solo las palabras, sino quién las dijo y exactamente cuándo habló. Este es el desafío de la "Transcripción con Atribución de Hablante y Marcas de Tiempo" (SATS, por sus siglas en inglés). Es un superpoder para las computadoras, que convierte una grabación de audio desordenada en un guion limpio y organizado donde cada frase está etiquetada con el nombre del hablante y un tiempo de reloj preciso. Esto es increíblemente útil para transcribir reuniones de negocios, analizar llamadas de servicio al cliente o ayudar a personas con discapacidades auditivas a seguir conversaciones complejas.

Hasta ahora, las computadoras solían intentar resolver esto en dos pasos separados. Primero, un robot de "voz a texto" escuchaba y escribía las palabras. Luego, un robot diferente, el "detective de hablantes", intentaba averiguar quién decía qué. El problema es que estos dos robots a menudo no se comunican entre sí. Si el primer robot comete un pequeño error, el segundo robot se confunde, y el guion final se convierte en un desastre jumbled. Es como intentar armar un rompecabezas donde la mitad de las piezas son de una caja diferente. Este nuevo artículo presenta un nuevo tipo de cerebro informático que hace ambos trabajos al mismo tiempo, en un solo movimiento fluido.

La solución de un solo cerebro

El equipo detrás de este proyecto, OpenMOSS, ha construido un nuevo modelo llamado MOSS Transcribe Diarize. Piensa en este modelo como un director de orquesta superinteligente y multitarea. En lugar de contratar una orquesta separada para las palabras y una orquesta separada para las voces, este director tiene toda la partitura en su cabeza y dirige toda la actuación de un solo golpe.

En el pasado, las computadoras tenían dificultades con las conversaciones largas. Si una reunión duraba una hora, los sistemas antiguos tenían que trocear el audio en pequeñas porciones de 30 segundos, resolver cada porción y luego intentar pegarlas de nuevo. Esto a menudo provocaba que la computadora olvidara quién era el "Hablante A" después de la pausa, o perdiera el rastro del flujo de la conversación. MOSS Transcribe Diarize cambia las reglas del juego al tener una enorme "ventana de memoria" de 128k tokens. Para ponerlo en perspectiva, esto permite al modelo escuchar y comprender hasta 90 minutos de audio en una sola pasada ininterrumpida. No necesita trocear el audio; escucha toda la historia de principio a fin, manteniendo una imagen mental clara de quién es quién, incluso si no han hablado en un rato.

Cómo funciona (El truco de magia)

El modelo es un "modelo de lenguaje de gran escala multimodal", una forma elegante de decir que puede leer texto y escuchar audio al mismo tiempo. Aquí está el truco:

  1. Los Oídos: Toma las ondas sonoras puras y las convierte en un formato digital.
  2. El Traductor: Utiliza una "proyección" especial para convertir esas ondas sonoras en un lenguaje que la parte del cerebro que lee texto pueda entender.
  3. La Salida: En lugar de solo escupir palabras, genera un guion que se ve así: [0.11] [S01] ¡Buenos días! [1.03] [S02] ¡Buenos días, chicos!. Te indica el ID del hablante (S01, S02), el momento exacto en que empezaron a hablar y las palabras que dijeron, todo en una sola pasada hacia adelante.

Para enseñar a este modelo, los investigadores no usaron solo grabaciones limpias de calidad de estudio. Le dieron una dieta masiva de datos "reales y salvajes": grabaciones de internet que incluyen ruido de fondo, voces superpuestas, diferentes acentos y personas hablando al mismo tiempo. También crearon conversaciones "simuladas" donde mezclaron y combinaron diferentes voces para enseñar al modelo cómo manejar situaciones complicadas, como cuando dos personas hablan exactamente al mismo tiempo.

Lo que encontraron

El equipo probó su nuevo modelo contra algunos de los sistemas comerciales más grandes y costosos disponibles actualmente (como los de Doubao, ElevenLabs y varios modelos de Google). Utilizaron tres tipos diferentes de pruebas:

  • AISHELL-4: Grabaciones de reuniones reales y largas (hasta ~40 minutos).
  • Podcast: Entrevistas largas de alta calidad con múltiples invitados.
  • Películas: Clips cortos con diálogos rápidos y superpuestos.

Los resultados fueron impresionantes. En casi todas las pruebas, MOSS Transcribe Diarize cometió menos errores que la competencia.

  • Precisión: Acertó las palabras con más frecuencia (menor Tasa de Error de Caracteres).
  • Identidad: Fue mucho mejor manteniendo el rastro de quién decía qué. Los investigadores midieron esto con una métrica llamada Δcp (la diferencia entre los errores de palabra y los errores de hablante). Un número más bajo aquí significa que el modelo no se confundió sobre quién estaba hablando. MOSS Transcribe Diarize tuvo las puntuaciones de Δcp más bajas, lo que significa que mantuvo las identidades de los hablantes consistentes incluso en conversaciones largas y desordenadas.
  • Capacidad de formato largo: Mientras que algunos de los modelos comerciales famosos (como GPT-4o y Gemini 3 Pro) simplemente fallaron al procesar los archivos de audio largos o no pudieron generar el formato correcto para ellos, MOSS Transcribe Diarize manejó las entradas completas de 90 minutos sin despeinarse.

Por qué esto es importante

El artículo sugiere que, al combinar el reconocimiento de voz y la identificación de hablantes en un sistema unificado con una memoria larga, podemos obtener transcripciones mucho más fiables. El modelo demuestra que no es necesario trocear el audio para entenderlo; puedes escuchar toda la conversación a la vez y aun así obtener los detalles correctamente.

Los autores advierten cuidadosamente que, aunque su modelo es un paso significativo, no es una varita mágica que lo soluciona todo perfectamente. Todavía ven margen de mejora, como hacer que el sistema funcione en tiempo real (streaming) y manejar aún más idiomas. Pero por ahora, han demostrado que un cerebro único y unificado puede hacer el trabajo de dos robots separados, y hacerlo mejor, especialmente cuando la conversación se vuelve larga y complicada.

El código y el modelo están ahora abiertos para que cualquiera los pruebe, disponibles en GitHub y Hugging Face, invitando a otros a ver si pueden construir herramientas aún mejores sobre este nuevo fundamento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →