← Últimos artigos
💬 NLP

HK-LegiCoST: Leveraging Non-Verbatim Transcripts for Speech Translation

Este artigo apresenta o HK-LegiCoST, um corpus paralelo triplo de larga escala composto por áudio em cantonês, transcrições em chinês tradicional não literais e traduções para o inglês, concebido para avançar a investigação em tradução automática de fala para línguas onde as formas falada e escrita divergem significativamente.

Autores originais: Cihan Xiao, Henry Li Xinyuan, Jinyi Yang, Dongji Gao, Matthew Wiesner, Kevin Duh, Sanjeev Khudanpur

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Cihan Xiao, Henry Li Xinyuan, Jinyi Yang, Dongji Gao, Matthew Wiesner, Kevin Duh, Sanjeev Khudanpur

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando ensinar um robô a entender um tipo muito específico de conversa: os debates formais do Conselho Legislativo de Hong Kong. Mas há um detalhe: as pessoas que falam estão usando o cantonês, um dialeto falado rico, com sua própria gíria e estruturas de frases únicas. No entanto, os registros escritos oficiais dessas reuniões não são escritos em um cantonês "puro"; eles são traduzidos para o Chinês Padrão, uma linguagem escrita formal que soa como um dialeto completamente diferente.

É como ouvir um amigo contar uma história com um sotaque local carregado, mas o registro oficial que você tem para comparar está escrito em um estilo rígido e formal, que reorganiza as palavras e substitui as gírias por um vocabulário polido.

Este é o desafio que os pesquisadores da Universidade Johns Hopkins enfrentaram ao introduzir um novo e massivo conjunto de dados chamado HK-LegiCoST.

O Problema: A Transcrição "Ruidosa"

Normalmente, quando treinamos computadores para traduzir fala, assumimos que o texto escrito corresponde perfeitamente às palavras faladas. Mas, no caso do cantonês, o registro escrito é frequentemente uma versão "limpa" do que foi realmente dito.

  • Falado: "Você vai primeiro!" (Estilo cantonês)
  • Escrito: "Você primeiro vai." (Estilo chinês padrão)

Essa incompatibilidade é como tentar combinar uma improvisação de jazz com uma partitura de música clássica. As notas são semelhantes, mas o ritmo e a ordem são diferentes. Isso torna muito difícil para os computadores aprenderem a traduzir a fala diretamente.

A Solução: Construindo um Quebra-Cabeça Gigante

Os pesquisadores pegaram mais de 600 horas de gravações de vídeo das reuniões do governo de Hong Kong. Eles não apenas copiaram e colaram os arquivos; eles construíram um "pipeline" complexo (uma linha de montagem passo a passo) para transformar esses dados brutos desordenados em um conjunto de treinamento limpo e utilizável.

Pense no processo deles como um bibliotecário de alta tecnologia organizando uma biblioteca caótica:

  1. Cortando a Fita: Eles fatiaram os longos vídeos das reuniões em clipes de áudio de tamanho reduzido.
  2. O Combinação do Tradutor: Eles usaram IA avançada para combinar o áudio com o texto escrito. Como o texto não era uma correspondência perfeita palavra por palavra, eles tiveram que ensinar a IA a ser flexível. É como ensinar um tradutor a ignorar o fato de o falante ter dito "vcs" e o texto dizer "vocês todos", e em vez disso focar no significado.
  3. O Botão "Pular": Às vezes, a transcrição escrita incluía notas ou formalidades que nunca foram realmente faladas. Os pesquisadores construíram um algoritmo especial que atua como um "botão de pular", permitindo que o computador ignore essas palavras escritas extras e foque apenas nas partes que foram realmente ditas.

O Resultado: Um Novo Campo de Treinamento

O produto final, HK-LegiCoST, é uma biblioteca massiva de mais de 600 horas de áudio em cantonês pareadas com sua transcrição escrita "imperfeita" e uma tradução para o inglês.

Os pesquisadores testaram seus modelos de computador nesse novo conjunto de dados e descobriram coisas empolgantes:

  • Funciona: Mesmo que as transcrições fossem "ruidosas" (não uma correspondência perfeita), os modelos de computador aprenderam a traduzir a fala muito bem.
  • É Robusto: Quando testaram seu modelo em um conjunto de dados diferente e menor de fala em cantonês (do projeto FLEURS do Google), ele teve um desempenho tão bom quanto modelos treinados com dados muito maiores e mais caros.
  • A Magia do "Zero-Shot": Um modelo treinado apenas nesses novos dados de Hong Kong foi capaz de lidar com o conjunto de dados do Google sem nenhum treinamento adicional, provando que os dados são de alta qualidade e generalizáveis.

Por Que Isso Importa

Este artigo não nos dá apenas um novo conjunto de dados; ele prova que podemos construir ferramentas de fala poderosas mesmo quando os registros escritos não correspondem perfeitamente às palavras faladas. É um roteiro para lidar com línguas onde as versões "falada" e "escrita" são frequentemente divergentes, o que é comum em muitos dialetos e vernáculos ao redor do mundo.

Em resumo, os pesquisadores pegaram um problema real e bagunçado (reuniões governamentais onde o roteiro não coincide com a fala) e o transformaram em uma ferramenta limpa e poderosa que ajuda os computadores a entender a verdadeira voz das pessoas, não apenas as palavras formais na página.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →