← Últimos artigos
💬 NLP

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

Este artigo propõe um pipeline para transferir conjuntos de dados anotados entre idiomas utilizando Grandes Modelos de Linguagem, demonstrando sua eficácia ao traduzir o corpus DEFT do inglês para o russo para criar um recurso de mineração de termos e definições raros que apoia a análise de tendências científicas e a tomada de decisão.

Autores originais: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Publicado 2026-07-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tenha uma biblioteca massiva e incrivelmente detalhada de livros em inglês onde cada palavra importante (como "fotossíntese" ou "inflação") está destacada e sua definição está escrita logo ao lado dela. Esta biblioteca é uma mina de ouro para computadores tentando aprender a entender ciência e tecnologia. No entanto, esta biblioteca só existe em inglês.

O problema? Não existe uma biblioteca equivalente em russo. Construir uma do zero seria como contratar uma equipe de milhares de pessoas para ler cada livro, encontrar as palavras e escrever suas definições à mão. Levaria uma eternidade e custaria uma fortuna.

A Grande Ideia: O Atalho do "Tradutor Inteligente"
Os autores deste artigo perguntaram: Podemos usar uma IA superinteligente (um Modelo de Linguagem de Grande Escala ou LLM) para agir como um tradutor que não apenas traduz as palavras, mas também transfere os destaques e as definições junto com elas?

Pense nisso da seguinte forma: Imagine que você tem o mapa de uma cidade com todos os pontos turísticos famosos circulados em vermelho. Você quer um mapa da mesma cidade, mas em um idioma diferente. Um tradutor comum apenas escreveria os nomes das ruas no novo idioma, deixando os círculos vermelhos flutuando nos lugares errados. Os autores queriam uma IA que pudesse dizer: "Ok, eu vejo o círculo vermelho ao redor de 'Eiffel Tower' em inglês. Em francês, isso é 'Tour Eiffel'. Eu vou mover o círculo vermelho para envolver 'Tour Eiffel' em vez disso."

Como Eles Testaram
Eles pegaram um conjunto de dados específico em inglês chamado DEFT (que é repleto de termos científicos e suas definições) e tentaram "transferi-lo" para o russo usando vários modelos de IA diferentes (como ChatGPT, Llama, DeepSeek e Qwen).

Eles testaram duas abordagens principais:

  1. A Abordagem da "Matemática": Eles disseram à IA: "A palavra começa no caractere 10 e termina no caractere 20. Traduza o texto e, depois, diga-me os novos números de caracteres para a palavra em russo."
    • Resultado: A IA se confundiu. É como pedir a alguém para contar os tijolos de uma parede enquanto essa pessoa reconstrói simultaneamente a parede em uma cor diferente. A IA continuava perdendo a conta ou errando os números.
  2. A Abordagem de "Identificar a Palavra": Eles mudaram as instruções. Em vez de pedir números, disseram: "Aqui está a frase em inglês com a palavra destacada. Aqui está a tradução para o russo. Por favor, destaque a palavra em russo que corresponde à palavra em inglês."
    • Resultado: Isso funcionou muito melhor! Foi como pedir à IA para simplesmente apontar para a imagem correspondente em vez de realizar cálculos complexos.

Os Resultados

  • O Melhor Tradutor: O modelo de IA DeepSeek fez o melhor trabalho ao mover os "destaques" (as anotações) corretamente. Ele acertou a resposta cerca de 94% das vezes.
  • A Qualidade: O conjunto de dados resultante em russo não é perfeito. Os autores o chamam de "grau prata" em vez de "grau ouro". Não é 100% preciso, mas é bom o suficiente para ser um ponto de partida sólido. É como ter o rascunho de um livro que está 90% concluído; você só precisa de um editor humano para corrigir os 10% de erros restantes, o que é muito mais rápido do que escrever o livro inteiro do zero.
  • Treinando Novos Modelos: Eles usaram este novo conjunto de dados traduzido por IA para treinar uma IA menor e mais simples (um modelo BERT). Esta nova IA russa aprendeu a identificar definições e termos razoavelmente bem, provando que os dados de "grau prata" eram úteis o suficiente para ensinar algo novo a um computador.

Por Que Isso Importa
Os autores explicam que este método é um divisor de águas para línguas "com poucos recursos" (idiomas que não possuem dados digitais suficientes). Em vez de esperar anos para construir um conjunto de dados do zero, os pesquisadores podem usar esses "tradutores inteligentes" para criar rapidamente um rascunho de conjunto de dados. Isso ajuda cientistas e tomadores de decisão na Rússia (e potencialmente em outros idiomas mais tarde) a analisar tendências em ciência e tecnologia muito mais rapidamente.

O Que Eles Não Fizeram
O artigo é muito específico sobre seus limites:

  • Eles testaram apenas Inglês-para-Russo.
  • Eles não testaram se a IA poderia fazer o trabalho melhor do que um tradutor humano (eles admitem que os tradutores humanos ainda são melhores).
  • Eles não testaram a IA na parte mais difícil da tarefa original (vincular termos a definições), deixando isso para trabalhos futuros.

Em resumo, o artigo mostra que, embora a IA ainda não seja perfeita, ela é uma ferramenta poderosa para "copiar e colar" conhecimento do inglês para o russo, economizando uma quantidade enorme de tempo e esforço dos pesquisadores.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →