← Últimos artigos
💬 NLP

Building Large-Scale English-Romanian Literary Translation Resources with Open Models

Este artigo apresenta o TinyFabulist Translation Framework (TF2), um pipeline unificado que aproveita dados sintéticos e um processo de ajuste fino de dois estágios para produzir um modelo aberto de 12 bilhões de parâmetros de baixo custo para tradução literária de inglês para romeno de alta qualidade, juntamente com o lançamento de conjuntos de dados de larga escala e ferramentas de avaliação.

Autores originais: Mihai Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

Publicado 2026-07-29
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Mihai Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde as histórias são a moeda da cultura, mas algumas línguas são como ilhas com pouquíssimas pontes conectando-as ao resto do mundo. Este é o desafio da tradução automática, um ramo da inteligência artificial que tenta ensinar computadores a falar diferentes idiomas. Normalmente, esses computadores aprendem lendo milhões de livros e artigos de notícias escritos por humanos. Mas para muitas línguas, especialmente aquelas faladas por menos pessoas, simplesmente não há livros suficientes para ensinar o computador. É como tentar aprender a cozinhar comida italiana sem nunca ter visto uma receita ou provado um tomate.

Para resolver isso, cientistas começaram a usar Modelos de Linguagem de Grande Escala (LLMs). Pense neles como chefs digitais superinteligentes que já provaram quase todos os pratos do mundo e conseguem adivinhar qual deve ser o sabor de uma nova receita. No entanto, ensinar esses chefs a cozinhar literatura — histórias com sentimentos, piadas e segredos culturais — é muito mais difícil do que traduzir um relatório de notícias. E fazer isso para uma língua como o romeno, que possui menos recursos digitais do que o inglês, é como tentar assar um bolo perfeito em uma cozinha com ingredientes muito limitados e um orçamento apertado. A grande questão que os pesquisadores estão fazendo é: podemos construir uma biblioteca de alta qualidade de histórias traduzidas sem gastar uma fortuna ou precisar de um supercomputador?


A História do Pequeno Fabulista

Neste artigo, uma equipe de pesquisadores da Romênia apresenta um novo projeto chamado TF2 (TinyFabulist Translation Framework). O objetivo deles era criar uma enorme biblioteca de fábulas traduzidas — histórias curtas com uma moral, como as fábulas de Esopo — do inglês para o romeno. Eles queriam ver se poderiam fazer isso usando modelos "abertos" (ferramentas de IA gratuitas e públicas) em vez de modelos privados caros, e se poderiam fazer isso com um orçamento baixíssimo.

A Receita: Construindo uma Biblioteca do Zero

Os pesquisadores sabiam que não poderiam simplesmente pedir a humanos para traduzir milhões de histórias; levaria muito tempo e custaria demais. Em vez disso, eles construíram uma linha de montagem de quatro etapas para criar os dados eles mesmos:

  1. O Teste de Sabor (Estágio 1): Primeiro, eles testaram 13 modelos de IA diferentes (alguns gratuitos, outros pagos) para ver qual era o melhor em traduzir algumas fábulas de amostra. Eles não olharam apenas se as palavras correspondiam; pediram à IA que avaliasse as traduções em cinco critérios: precisão, fluidez, lógica da história, estilo e adequação cultural. O vencedor foi um modelo poderoso chamado GPT-o3, que se tornou o seu "padrão ouro" para criar o restante da biblioteca.
  2. O Padrão Prata (Estágio 2): Usando esse modelo vencedor, eles traduziram 15.000 fábulas do inglês para o romeno. Embora tenham sido feitas por um robô, elas eram tão boas que os pesquisadores as trataram como um "padrão prata" (quase tão bom quanto o ouro) para treinar seus próprios modelos customizados.
  3. O Treinamento Especializado (Estágio 3): Esta é a parte mágica. Eles pegaram modelos de IA de código aberto (especificamente versões do Gemma, variando de modelos pequenos de 1 bilhão de parâmetros até um de 12 bilhões) e deram a eles uma "escola de especialização". Eles usaram uma técnica chamada LoRA (Low-Rank Adaptation), que é como dar a um chef de uso geral um livro de receitas específico para fábulas sem precisar reconstruir toda a cozinha. Eles treinaram esses modelos com as 15.000 histórias traduzidas.
  4. A Produção em Massa (Estágio 4): Finalmente, eles usaram seus novos modelos especializados e treinados para traduzir as 3 milhões de fábulas restantes da coleção original em inglês. O resultado é um novo conjunto de dados massivo chamado DS-TF2-EN-RO-3M, contendo três milhões de pares de fábulas em inglês e romeno.

Os Resultados: Modelos Pequenos, Grandes Surpresas

Os pesquisadores então colocaram seus novos modelos treinados à prova contra os grandes e caros modelos privados (como GPT-4 e DeepL) e contra os modelos abertos originais e não treinados.

  • A Lacuna Diminuiu: O seu melhor modelo aberto, o TF2-12B (a versão de 12 bilhões de parâmetros), teve um desempenho incrível. Ele obteve uma pontuação média de 4,83 de 5 na sua rubrica de qualidade, enquanto o principal modelo privado (GPT-o3) obteve 4,92. A diferença entre o modelo gratuito customizado e o gigante proprietário caro foi mínima — menos de 0,1 pontos.
  • A Diferença de Custo: É aqui que a história fica realmente emocionante. Traduzir todas as 3 milhões de fábulas usando as APIs privadas caras teria custado entre US$ 1.800 e US$ 32.400 (dependendo de qual modelo você escolhesse). Em contraste, o seu modelo de código aberto TF2 fez exatamente o mesmo trabalho por cerca de US$ 350. Isso representa uma economia de 97% a 99%.
  • Os Modelos Pequenos: Mesmo o seu modelo mais pequeno (1 bilhão de parâmetros), após o treinamento, saltou de 2,02 para 3,75. Não era perfeito, mas passou de "mal compreensível" para "bastante bom", provando que mesmo computadores pequenos e baratos podem aprender a contar histórias se forem ensinados da maneira certa.

O Que Eles Descobriram (e o Que Não Descobriram)

O artigo sugere que você não precisa ser um bilionário para construir ferramentas de tradução literária de alta qualidade. Ao usar um processo inteligente, passo a passo, e focar em um tipo específico de história (fábulas), eles mostraram que modelos abertos podem competir com os gigantes.

No entanto, os autores tomam cuidado ao notar alguns pontos:

  • Ainda não é perfeito: Embora os modelos abertos estejam próximos, os modelos privados (como o GPT-o3) ainda pontuaram ligeiramente mais alto, especialmente em estilo e nuance cultural. Os modelos abertos são uma ótima alternativa, mas não "resolveram" completamente o problema de igualar a qualidade de tradução de nível humano em todos os casos.
  • O "Padrão Ouro" é Prata: As traduções de referência que eles usaram para treinar os modelos foram feitas por outra IA, não por um humano. Isso significa que os modelos estão aprendendo a soar como outras IAs, não necessariamente como tradutores humanos. Os pesquisadores verificaram isso fazendo com que um especialista humano analisasse uma pequena amostra das histórias, e o humano concordou que as classificações da IA eram geralmente corretas, mas eles admitem que um estudo humano maior é necessário para ter 100% de certeza.
  • Fábulas são Especiais: As fábulas são curtas e possuem uma estrutura clara. Os pesquisadores sugerem que, embora este método funcione muito bem para fábulas, pode ser mais difícil aplicá-lo a romances complexos com metáforas profundas ou diálogos históricos.

A Conclusão

O projeto TF2 é como mostrar que você pode construir uma biblioteca magnífica usando materiais reciclados e um pouco de engenhosidade, em vez de precisar de um cofre de ouro. Eles provaram que, com os dados de treinamento certos e uma abordagem inteligente e econômica, a IA de código aberto pode traduzir conteúdo literário para línguas como o romeno por uma fração do custo habitual. Eles disponibilizaram todo o seu código, o seu conjunto de dados de 3 milhões de histórias e os seus modelos treinados para o público, convidando todos os outros a construir sobre o seu trabalho. É um passo em direção a um futuro onde a IA pode ajudar a preservar e compartilhar histórias de cada cultura, independentemente de quanta tecnologia aquela cultura tenha dinheiro para gastar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →