← Últimos artigos
💻 computer science

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

Este estudo demonstra que a reescrita sintética atua como um multiplicador de qualidade em vez de um substituto para a curadoria de dados no pré-treinamento contínuo em português, impulsionando significativamente o desempenho apenas quando aplicada a dados de origem de alta qualidade e principalmente em escalas de modelos maiores.

Autores originais: Thales Sales Almeida, Rodrigo Nogueira, Helio Pedrini

Publicado 2026-09-16
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Thales Sales Almeida, Rodrigo Nogueira, Helio Pedrini

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os modelos de linguagem de grande escala são os motores por trás de muitos dos sistemas de inteligência artificial mais avançados da atualidade, capazes de escrever textos, responder perguntas e resolver problemas com uma fluidez que frequentemente imita o pensamento humano. Esses sistemas aprendem ao ler quantidades massivas de texto da internet, absorvendo padrões de como as palavras são usadas e como as ideias se conectam. No entanto, esse processo de aprendizagem não é igualmente eficaz para todas as línguas. Enquanto o inglês possui uma biblioteca massiva de textos de alta qualidade disponível para treinamento, muitas outras línguas, como o português, possuem muito menos recursos. Para preencher essa lacuna, pesquisadores frequentemente pegam um modelo treinado primordialmente em inglês e continuam a ensiná-lo usando quantidades menores de texto na língua alvo. Uma questão crescente no campo é se podemos tornar esses dados limitados ainda mais poderosos usando inteligência artificial para reescrevê-los. A ideia é que, se um computador puder pegar uma frase desorganizada ou simples e reescrevê-la para ser mais clara, mais estruturada ou mais detalhada, o modelo poderá aprender melhor a partir da versão aprimorada. Mas uma incerteza crucial permanece: será que essa técnica de reescrita funciona igualmente bem em textos de baixa qualidade, ou ela apenas amplifica o valor de textos que já eram bons desde o início?

Uma equipe de pesquisadores da Universidade de Campinas, no Brasil, partiu para responder a essa pergunta realizando um experimento controlado com modelos de linguagem em português. Eles começaram com uma coleção massiva de documentos em português que já haviam sido classificados quanto à qualidade, variando de baixa a alta com base em quão bem foram escritos e quão útil era a informação. A partir dessa coleção, eles criaram três grupos distintos de dados: um grupo contendo apenas os documentos de mais alta qualidade, outro com os documentos de menor qualidade e um terceiro grupo que era uma mistura aleatória de tudo. Para cada um desses grupos, eles usaram um modelo de inteligência artificial separado para reescrever o texto em quatro estilos diferentes, tais como uma versão simplificada para facilitar a leitura, um estilo de enciclopédia formal, uma versão técnica e um formato de perguntas e respostas. Esse processo gerou uma enorme quantidade de novo texto sintético. Eles então treinaram dois modelos de computador diferentes — um menor e um maior — nesses conjuntos de dados reescritos para ver como a combinação de qualidade original e reescrita afetava os resultados finais.

As descobertas revelaram um padrão claro e surpreendente que desafia a esperança de que a reescrita poderia consertar dados ruins. Quando os pesquisadores usaram o modelo maior, a técnica de reescrita atuou como um multiplicador de qualidade, em vez de um consertador de falhas. O modelo treinado nos documentos de alta qualidade que haviam sido reescritos teve um desempenho significativamente superior ao mesmo modelo treinado no texto original e não modificado de alta qualidade. No entanto, quando aplicaram o mesmo processo de reescrita aos documentos de baixa qualidade, a melhoria foi quase imperceptível. O texto de baixa qualidade reescrito não alcançou o texto de alta qualidade reescrito; em vez disso, a lacuna entre eles permaneceu ampla. Isso sugere que o processo de reescrita é mais eficaz quando pega um material que já é excelente e o torna ainda melhor, em vez de tentar resgatar um material pobre. A mistura aleatória de documentos ficou exatamente no meio, mostrando que o benefício da reescrita cresce constantemente conforme a qualidade do texto de origem melhora.

Esse efeito, contudo, dependeu fortemente do tamanho do modelo sendo treinado. Quando os pesquisadores repetiram o experimento com um modelo muito menor, a distinção clara entre alta e baixa qualidade desapareceu. Nesse cenário menor, o texto de alta qualidade reescrito não superou o texto original de baixa qualidade de forma consistente. O modelo menor parecia incapaz de utilizar plenamente as mudanças estruturais complexas introduzidas pelo processo de reescrita ou, talvez, simplesmente aprendeu melhor com a variedade bruta dos dados não editados. Isso indica que o poder da reescrita sintética não é uma regra universal, mas um fenômeno que escala com o tamanho do sistema de inteligência artificial. Para modelos menores, a complexidade extra do texto reescrito pode não proporcionar um benefício, enquanto para modelos maiores e mais capazes, a reescrita de dados de alta qualidade torna-se uma ferramenta poderosa para impulsionar o desempenho.

O estudo também analisou tipos específicos de tarefas, como responder perguntas de exames ou compreender postagens de redes sociais, para ver onde a reescrita ajudou mais. As melhorias foram mais dramáticas em áreas que exigem conhecimento estruturado e compreensão cultural, como responder perguntas de exames ou raciocinar através de cenários complexos. Nessas áreas, o modelo treinado em dados de alta qualidade reescritos disparou à frente de todos os outros. Curiosamente, para tarefas envolvendo conhecimento geral, a reescrita às vezes tornou as coisas ligeiramente piores, sugerindo que o processo pode ocasionalmente introduzir ruído ou distorcer fatos. Para tarefas de redes sociais, os dados originais de baixa qualidade tiveram um desempenho surpreendentemente bom por conta própria, provavelmente porque a natureza desorganizada e informal do texto das redes sociais é naturalmente semelhante aos dados da web não editados nos quais os modelos foram originalmente treinados.

Em última análise, a pesquisa demonstra que, embora a reescrita sintética seja uma técnica poderosa, ela não é uma varinha mágica que pode transformar dados ruins em ouro. Em vez disso, ela funciona como um multiplicador de qualidade, amplificando as forças dos bons dados enquanto deixa as fraquezas dos dados ruins amplamente intocadas. Esse insight é vital para desenvolvedores que trabalham com línguas que possuem menos recursos do que o inglês. Sugere que a estratégia mais eficaz é selecionar cuidadosamente o melhor texto disponível primeiro e, em seguida, usar a reescrita para aprimorá-lo, em vez de confiar na reescrita para compensar a falta de qualidade. Os resultados também destacam que o tamanho do modelo importa; o que funciona para um sistema grande e sofisticado pode não funcionar para um menor. Ao esclarecer como a qualidade dos dados e a reescrita interagem, este trabalho oferece um caminho mais claro para a construção de melhores sistemas de inteligência artificial para o português e, potencialmente, para outras línguas que enfrentam limitações de recursos semelhantes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →