MOSS Transcribe Diarize Technical Report
O MOSS Transcribe Diarize é um modelo de linguagem grande multimodal unificado que alcança o estado da arte em transcrição com atribuição de locutor e carimbo de tempo ao aproveitar uma janela de contexto de 128k e treinamento de ponta a ponta em extensos dados do mundo real para superar as limitações dos sistemas existentes.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está sentado em uma cafeteria lotada, tentando anotar exatamente o que três amigos diferentes estão dizendo uns aos outros. Você precisa saber não apenas as palavras, mas quem as disse e exatamente quando falaram. Este é o desafio da "Transcrição com Atribuição de Locutor e Carimbo de Tempo" (SATS - Speaker-Attributed, Time-Stamped Transcription). É um superpoder para computadores, transformando uma gravação de áudio bagunçada em um roteiro limpo e organizado onde cada frase é marcada com o nome de um locutor e um tempo preciso. Isso é incrivelmente útil para coisas como transcrever reuniões de negócios, analisar chamadas de atendimento ao cliente ou ajudar pessoas com deficiência auditiva a acompanhar conversas complexas.
Até agora, os computadores geralmente tentavam resolver isso em duas etapas separadas. Primeiro, um robô de "fala para texto" ouvia e digitava as palavras. Depois, um robô "detetive de locutores" diferente tentava descobrir quem disse o quê. O problema é que esses dois robôs muitas vezes não conversam entre si. Se o primeiro robô comete um pequeno erro, o segundo robô fica confuso, e o roteiro final torna-se uma bagunça desordenada. É como tentar montar um quebra-cabeça onde metade das peças é de uma caixa diferente. Este novo artigo apresenta um novo tipo de cérebro de computador que faz ambos os trabalhos ao mesmo tempo, em um único movimento fluido.
A Solução de Um Único Cérebro
A equipe por trás deste projeto, OpenMOSS, construiu um novo modelo chamado MOSS Transcribe Diarize. Pense neste modelo como um maestro superinteligente e multitarefa. Em vez de contratar uma orquestra separada para as palavras e uma orquestra separada para as vozes, este maestro mantém toda a partitura em sua cabeça e dirige toda a performance de uma só vez.
No passado, os computadores tinham dificuldade com conversas longas. Se uma reunião durasse uma hora, os sistemas antigos teriam que fatiar o áudio em pequenos pedaços de 30 segundos, resolver cada fatia e depois tentar colá-los de volta. Isso frequentemente fazia com que o computador esquecesse quem era o "Locutor A" após a pausa, ou perdesse o rastro do fluxo da conversa. O MOSS Transcribe Diarize muda o jogo ao possuir uma enorme "janela de memória" de 128k tokens. Para colocar em perspectiva, isso permite que o modelo ouça e entenda até 90 minutos de áudio em uma única passagem ininterrupta. Ele não precisa fatiar o áudio; ele ouve a história inteira do início ao fim, mantendo uma imagem mental clara de quem é quem, mesmo que eles não tenham falado há algum tempo.
Como Funciona (O Truque de Mágica)
O modelo é um "modelo de linguagem de grande escala multimodal", uma forma chique de dizer que ele pode ler texto e ouvir áudio ao mesmo tempo. Aqui está o truque:
- Os Ouvidos: Ele pega as ondas sonoras brutas e as converte em um formato digital.
- O Tradutor: Ele usa uma "projeção" especial para transformar essas ondas sonoras na linguagem que a parte do cérebro que lê texto entende.
- A Saída: Em vez de apenas cuspir palavras, ele gera um roteiro que se parece com isto:
[0.11] [S01] Bom dia! [1.03] [S02] Bom dia, pessoal!. Ele informa o ID do locutor (S01, S02), o tempo exato em que começaram a falar e as palavras que disseram, tudo em uma única passagem direta.
Para ensinar este modelo, os pesquisadores não usaram apenas gravações limpas de estúdio. Eles o alimentaram com uma dieta massiva de dados "reais e selvagens" — gravações da internet que incluem ruído de fundo, vozes sobrepostas, diferentes sotaques e pessoas falando umas sobre as outras. Eles também criaram conversas "simuladas" onde misturavam e combinavam diferentes vozes para ensinar o modelo a lidar com situações complicadas, como quando duas pessoas falam exatamente ao mesmo tempo.
O Que Eles Descobriram
A equipe testou seu novo modelo contra alguns dos maiores e mais caros sistemas comerciais atualmente disponíveis (como os da Doubao, ElevenLabs e vários modelos do Google). Eles usaram três tipos diferentes de testes:
- AISHELL-4: Gravações de reuniões reais e longas (até ~40 minutos).
- Podcast: Entrevistas longas de alta qualidade com múltiplos convidados.
- Filmes: Clipes curtos com diálogos rápidos e sobrepostos.
Os resultados foram impressionantes. Em quase todos os testes, o MOSS Transcribe Diarize cometeu menos erros do que a concorrência.
- Precisão: Ele acertou as palavras com mais frequência (menor Taxa de Erro de Caracteres).
- Identidade: Foi muito melhor em rastrear quem disse o quê. Os pesquisadores mediram isso com uma métrica chamada Δcp (a diferença entre erros de palavra e erros de locutor). Um número mais baixo aqui significa que o modelo não se confundiu sobre quem estava falando. O MOSS Transcribe Diarize teve as pontuações de Δcp mais baixas, o que significa que manteve as identidades dos locutores consistentes mesmo em conversas longas e bagunçadas.
- Capacidade de Longa Duração: Enquanto alguns dos modelos comerciais famosos (como GPT-4o e Gemini 3 Pro) simplesmente falharam ao processar os arquivos de áudio longos ou não conseguiram gerar o formato correto para eles, o MOSS Transcribe Diarize lidou com as entradas completas de 90 minutos sem esforço.
Por Que Isso Importa
O artigo sugere que, ao combinar o reconhecimento de fala e a identificação de locutor em um sistema unificado com uma memória longa, podemos obter transcrições muito mais confiáveis. O modelo prova que você não precisa fatiar o áudio para entendê-lo; você pode ouvir a conversa inteira de uma vez e ainda assim obter os detalhes corretamente.
Os autores ressaltam cuidadosamente que, embora seu modelo seja um passo significativo à frente, ele não é uma varinha mágica que resolve todos os problemas perfeitamente. Eles ainda veem espaço para melhorias, como tornar o sistema capaz de funcionar em tempo real (streaming) e lidar com ainda mais idiomas. Mas, por enquanto, eles mostraram que um único cérebro unificado pode fazer o trabalho de dois robôs separados, e fazer melhor, especialmente quando a conversa se torna longa e complicada.
O código e o modelo estão agora abertos para qualquer pessoa testar, disponíveis no GitHub e no Hugging Face, convidando outros a ver se conseguem construir ferramentas ainda melhores sobre esta nova base.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.