← Últimos artigos
💻 computer science

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

O artigo apresenta o MultiSynt/MT, um corpus paralelo sintético aberto de 4,8 trilhões de tokens em 36 línguas europeias gerado através da tradução de dados de alta qualidade em inglês, o que permite que LLMs multilingues alcancem um desempenho superior com significativamente menos tokens de pré-treinamento em comparação com as linhas de base de dados nativos, ao mesmo tempo em que revela pontos cegos de avaliação específicos nos benchmarks atuais.

Autores originais: Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Gi
Publicado 2026-07-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Ginter, Matthias Lindemann, Tim Isbister, Birger Moell, Jonas Lindh, Jan Hajič, Jenia Jitsev, Andrey Kutuzov, Stephan Oepen, Gema Ramírez-Sánchez

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô gigante e superinteligente a falar e entender 36 idiomas diferentes. O problema é que o professor favorito do robô (a internet) fala majoritariamente inglês. Embora existam montanhas de livros, artigos e sites em inglês, existem apenas pequenos e empoeirados montes de textos de alta qualidade para idiomas como o maltês, o irlandês ou o islandês.

Os autores deste artigo, MultiSynt/MT, decidiram resolver isso construindo uma enorme "fábrica de tradução".

A Grande Ideia: A Fábrica de Tradução

Em vez de esperar que as pessoas escrevam 4,8 trilhões de novas palavras em 36 idiomas diferentes (o que levaria uma eternidade), eles pegaram 100 bilhões de documentos de alta qualidade em inglês (o conjunto de dados "Nemotron-CC") e os passaram por uma máquina de tradução superavançada.

Pense nisso como:

  • A Fonte: Uma biblioteca com a melhor escrita em inglês disponível.
  • Os Trabalhadores: Eles não usaram apenas um tradutor. Eles usaram uma equipe de diferentes tradutores de IA (alguns são como linguistas especializados, outros são robôs inteligentes de uso geral) para traduzir cada frase em inglês para 36 idiomas de destino.
  • O Resultado: Uma nova biblioteca contendo 4,8 trilhões de tokens (palavras e símbolos) nesses 36 idiomas. Para muitos idiomas europeus menores, esta nova biblioteca é 100 vezes maior do que qualquer outra biblioteca gratuita que existia antes.

O Experimento: A "Tradução" Funciona?

A equipe treinou um novo modelo de IA usando esta enorme biblioteca traduzida e o comparou com um modelo treinado em dados "nativos" (texto originalmente escrito por humanos nesses idiomas).

O Resultado Surpreendente:
O modelo treinado com os dados traduzidos teve um desempenho melhor do que o modelo nativo, mas chegou lá usando 72% menos tempo e dados de treinamento.

  • Analogia: Imagine dois estudantes fazendo uma prova. O Estudante A (Nativo) estudou um livro didático grosso. O Estudante B (Traduzido) estudou um resumo condensado e de alta qualidade. O Estudante B não apenas passou, mas obteve uma pontuação maior, e fez isso em menos da metade do tempo.

No entanto, o artigo alerta que isso não é uma solução mágica para tudo.

A Armadilha: O "Vale da Estranheza" da Linguagem

Embora os dados traduzidos sejam ótimos para conhecimento geral e lógica, eles possuem uma fraqueza específica: Cultura e Idiomatismos.

  • A Metáfora: Imagine um turista que estudou perfeitamente um guia de frases. Ele consegue pedir comida e pedir direções (tarefas gerais) sem falhas. Mas se você perguntar sobre uma piada local, uma referência histórica específica ou uma gíria que só os moradores usam, ele pode errar porque o guia de frases foi traduzido do inglês, não nasceu da cultura local.
  • A Descoberta: Quando a equipe testou a IA em tarefas norueguesas envolvendo expressões idiomáticas locais ou nuances culturais, o modelo treinado em escrita humana nativa ainda venceu. O modelo traduzido era fluente, mas carecia da "alma" da cultura local.

O "Ponto Cego" nos Testes

O artigo também descobriu uma falha engraçada na forma como costumamos testar a IA.

  • O Problema: A maioria dos testes são perguntas de múltipla escolha (como um exame padronizado). Esses testes são como um jogo de "preencher lacunas". Eles não conseguem distinguir entre uma frase que soa perfeitamente natural e uma que soa ligeiramente "estranha" ou robótica (um fenômeno chamado "translationese" ou linguagem de tradução).
  • A Descoberta: Quando os pesquisadores usaram um tipo diferente de teste — pedindo à IA para escrever uma história e fazendo com que outra IA julgasse o fluxo e a beleza da escrita — eles descobriram que os modelos traduzidos tinham, sim, diferenças sutis. Os testes padrão eram "cegos" para essas lacunas de qualidade, mas o "juiz de histórias" conseguia vê-las claramente.

A Conclusão

O artigo conclui que dados traduzidos são um suplemento poderoso, não um substituto perfeito.

  • Para idiomas pequenos: É um salvador de vidas. Fornece uma quantidade massiva de dados de alta qualidade onde antes não existia nada.
  • Para idiomas grandes: É uma ótima maneira de preencher as lacunas.
  • A Melhor Estratégia: Use os dados traduzidos para construir uma base sólida, mas mantenha os dados humanos nativos para ensinar à IA as nuances culturais, as piadas e o sabor local que as máquinas não podem inventar por conta própria.

Os autores liberaram esta enorme "biblioteca de tradução" gratuitamente, permitindo que outros pesquisadores experimentem como misturar melhor esses textos traduzidos com os nativos para construir a próxima geração de IA multilíngue.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →