← Últimos artigos
⚡ electrical engineering

MOSS Transcribe Diarize Technical Report

O MOSS Transcribe Diarize é um modelo de linguagem grande multimodal unificado que alcança o estado da arte em transcrição com atribuição de locutor e carimbo de tempo ao aproveitar uma janela de contexto de 128k e treinamento de ponta a ponta em extensos dados do mundo real para superar as limitações dos sistemas existentes.

Autores originais: MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong
Publicado 2026-07-20
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong, Yuqian Zhang, Wenbo Zhang, Songlin Wang, Zhiyu Wu, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está sentado em uma cafeteria lotada, tentando anotar exatamente o que três amigos diferentes estão dizendo uns aos outros. Você precisa saber não apenas as palavras, mas quem as disse e exatamente quando falaram. Este é o desafio da "Transcrição com Atribuição de Locutor e Carimbo de Tempo" (SATS - Speaker-Attributed, Time-Stamped Transcription). É um superpoder para computadores, transformando uma gravação de áudio bagunçada em um roteiro limpo e organizado onde cada frase é marcada com o nome de um locutor e um tempo preciso. Isso é incrivelmente útil para coisas como transcrever reuniões de negócios, analisar chamadas de atendimento ao cliente ou ajudar pessoas com deficiência auditiva a acompanhar conversas complexas.

Até agora, os computadores geralmente tentavam resolver isso em duas etapas separadas. Primeiro, um robô de "fala para texto" ouvia e digitava as palavras. Depois, um robô "detetive de locutores" diferente tentava descobrir quem disse o quê. O problema é que esses dois robôs muitas vezes não conversam entre si. Se o primeiro robô comete um pequeno erro, o segundo robô fica confuso, e o roteiro final torna-se uma bagunça desordenada. É como tentar montar um quebra-cabeça onde metade das peças é de uma caixa diferente. Este novo artigo apresenta um novo tipo de cérebro de computador que faz ambos os trabalhos ao mesmo tempo, em um único movimento fluido.

A Solução de Um Único Cérebro

A equipe por trás deste projeto, OpenMOSS, construiu um novo modelo chamado MOSS Transcribe Diarize. Pense neste modelo como um maestro superinteligente e multitarefa. Em vez de contratar uma orquestra separada para as palavras e uma orquestra separada para as vozes, este maestro mantém toda a partitura em sua cabeça e dirige toda a performance de uma só vez.

No passado, os computadores tinham dificuldade com conversas longas. Se uma reunião durasse uma hora, os sistemas antigos teriam que fatiar o áudio em pequenos pedaços de 30 segundos, resolver cada fatia e depois tentar colá-los de volta. Isso frequentemente fazia com que o computador esquecesse quem era o "Locutor A" após a pausa, ou perdesse o rastro do fluxo da conversa. O MOSS Transcribe Diarize muda o jogo ao possuir uma enorme "janela de memória" de 128k tokens. Para colocar em perspectiva, isso permite que o modelo ouça e entenda até 90 minutos de áudio em uma única passagem ininterrupta. Ele não precisa fatiar o áudio; ele ouve a história inteira do início ao fim, mantendo uma imagem mental clara de quem é quem, mesmo que eles não tenham falado há algum tempo.

Como Funciona (O Truque de Mágica)

O modelo é um "modelo de linguagem de grande escala multimodal", uma forma chique de dizer que ele pode ler texto e ouvir áudio ao mesmo tempo. Aqui está o truque:

  1. Os Ouvidos: Ele pega as ondas sonoras brutas e as converte em um formato digital.
  2. O Tradutor: Ele usa uma "projeção" especial para transformar essas ondas sonoras na linguagem que a parte do cérebro que lê texto entende.
  3. A Saída: Em vez de apenas cuspir palavras, ele gera um roteiro que se parece com isto: [0.11] [S01] Bom dia! [1.03] [S02] Bom dia, pessoal!. Ele informa o ID do locutor (S01, S02), o tempo exato em que começaram a falar e as palavras que disseram, tudo em uma única passagem direta.

Para ensinar este modelo, os pesquisadores não usaram apenas gravações limpas de estúdio. Eles o alimentaram com uma dieta massiva de dados "reais e selvagens" — gravações da internet que incluem ruído de fundo, vozes sobrepostas, diferentes sotaques e pessoas falando umas sobre as outras. Eles também criaram conversas "simuladas" onde misturavam e combinavam diferentes vozes para ensinar o modelo a lidar com situações complicadas, como quando duas pessoas falam exatamente ao mesmo tempo.

O Que Eles Descobriram

A equipe testou seu novo modelo contra alguns dos maiores e mais caros sistemas comerciais atualmente disponíveis (como os da Doubao, ElevenLabs e vários modelos do Google). Eles usaram três tipos diferentes de testes:

  • AISHELL-4: Gravações de reuniões reais e longas (até ~40 minutos).
  • Podcast: Entrevistas longas de alta qualidade com múltiplos convidados.
  • Filmes: Clipes curtos com diálogos rápidos e sobrepostos.

Os resultados foram impressionantes. Em quase todos os testes, o MOSS Transcribe Diarize cometeu menos erros do que a concorrência.

  • Precisão: Ele acertou as palavras com mais frequência (menor Taxa de Erro de Caracteres).
  • Identidade: Foi muito melhor em rastrear quem disse o quê. Os pesquisadores mediram isso com uma métrica chamada Δcp (a diferença entre erros de palavra e erros de locutor). Um número mais baixo aqui significa que o modelo não se confundiu sobre quem estava falando. O MOSS Transcribe Diarize teve as pontuações de Δcp mais baixas, o que significa que manteve as identidades dos locutores consistentes mesmo em conversas longas e bagunçadas.
  • Capacidade de Longa Duração: Enquanto alguns dos modelos comerciais famosos (como GPT-4o e Gemini 3 Pro) simplesmente falharam ao processar os arquivos de áudio longos ou não conseguiram gerar o formato correto para eles, o MOSS Transcribe Diarize lidou com as entradas completas de 90 minutos sem esforço.

Por Que Isso Importa

O artigo sugere que, ao combinar o reconhecimento de fala e a identificação de locutor em um sistema unificado com uma memória longa, podemos obter transcrições muito mais confiáveis. O modelo prova que você não precisa fatiar o áudio para entendê-lo; você pode ouvir a conversa inteira de uma vez e ainda assim obter os detalhes corretamente.

Os autores ressaltam cuidadosamente que, embora seu modelo seja um passo significativo à frente, ele não é uma varinha mágica que resolve todos os problemas perfeitamente. Eles ainda veem espaço para melhorias, como tornar o sistema capaz de funcionar em tempo real (streaming) e lidar com ainda mais idiomas. Mas, por enquanto, eles mostraram que um único cérebro unificado pode fazer o trabalho de dois robôs separados, e fazer melhor, especialmente quando a conversa se torna longa e complicada.

O código e o modelo estão agora abertos para qualquer pessoa testar, disponíveis no GitHub e no Hugging Face, convidando outros a ver se conseguem construir ferramentas ainda melhores sobre esta nova base.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →