← Últimos artigos
💻 computer science

GLeMM: A large-scale multilingual dataset for morphological research

O artigo apresenta o GLeMM, um conjunto de dados de morfologia derivacional de grande escala, totalmente automatizado e multilíngue, abrangendo sete línguas europeias, projetado para permitir a pesquisa orientada por dados e o teste computacional de relações forma-sentido na formação de palavras.

Autores originais: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Publicado 2026-09-25
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A linguagem é um sistema vivo onde as palavras evoluem constantemente, dividindo-se e fundindo-se para criar novos significados. Quando pegamos uma palavra como "feliz" e a transformamos em "felicidade", ou "ensinar" em "professor", estamos nos envolvendo em um processo chamado derivação. É assim que os seres humanos expandem seu vocabulário, criando ideias complexas a partir de raízes simples. Por décadas, linguistas tentaram mapear essas conexões, perguntando-se por que algumas palavras mudam de formas previsíveis enquanto outras parecem seguir suas próprias regras únicas. Eles se perguntaram se a maneira como uma língua constrói novas palavras é a mesma em diferentes culturas, ou se cada língua possui sua própria lógica secreta. Até recentemente, responder a essas perguntas significava depender da intuição de especialistas e de pequenas listas selecionadas à mão. Era um pouco como tentar entender o clima observando uma única nuvem; você poderia ter uma noção do padrão, mas perderia a tempestade.

Uma equipe de pesquisadores construiu agora uma biblioteca digital massiva para mudar a forma como estudamos esse processo. Eles criaram um recurso chamado GLeMM, que significa uma coleção multilíngue de grande escala de dados de formação de palavras. Em vez de depender de pequenas listas, eles reuniram informações sobre quase 1,2 milhão de pares de palavras relacionadas em sete línguas europeias: inglês, francês, alemão, italiano, polonês, russo e espanhol. O objetivo era ir além do palpite e deixar o volume colossal de dados revelar a verdadeira estrutura de como as línguas crescem. Ao automatizar o processo de encontrar essas conexões, os pesquisadores puderam ver padrões que eram anteriormente invisíveis, oferecendo uma imagem mais clara de como a forma e o significado interagem quando criamos novas palavras.

Os pesquisadores não se sentaram para escrever manualmente cada conexão de palavras. Em vez disso, eles recorreram ao Wiktionary, o dicionário online gratuito que qualquer pessoa pode editar. Eles perceberam que as definições que as pessoas escrevem para as palavras frequentemente contêm pistas sobre como essas palavras estão relacionadas. Por exemplo, se a definição de "vivacidade" diz que é "a propriedade de ser vivaz", a palavra "vivaz" está logo ali na explicação. A equipe desenvolveu um método computacional para escanear milhões dessas definições, procurando pares de palavras onde uma é definida usando a outra. Eles então verificaram se as duas palavras pareciam semelhantes o suficiente para serem relacionadas, como compartilhar uma raiz comum. Ao cruzar essas descobertas com outras listas de palavras relacionadas, eles filtraram correspondências aleatórias e mantiveram apenas os pares que mostravam um padrão consistente e repetitivo. Isso permitiu que construíssem uma vasta rede de famílias de palavras para cada uma das sete línguas, capturando tudo, desde sufixos simples como "-dade" até mudanças mais complexas envolvendo prefixos e múltiplos passos.

O que eles encontraram desafia algumas ideias de longa data sobre como a linguagem funciona. Por muito tempo, muitos linguistas acreditaram que as famílias de palavras eram como teias completas, onde cada palavra em uma família estava diretamente conectada a todas as outras palavras. Se você tivesse uma palavra para "viajar", uma palavra para "viajante" e uma palavra para "viajando", a teoria sugeria que todas estavam igualmente ligadas em um triângulo perfeito. No entanto, os dados do GLeMM sugerem que este raramente é o caso. No enorme conjunto de dados, a maioria das famílias de palavras não são teias perfeitas. Em vez disso, elas se parecem com um núcleo central com raios, onde novas palavras ramificam-se a partir de uma raiz principal, mas não necessariamente se conectam de volta umas às outras. Os pesquisadores descobriram que apenas uma pequena fração dos grupos de palavras forma esses triângulos perfeitos. De fato, para cada 100 pares de palavras que poderiam teoricamente formar um triângulo, apenas um punhado realmente o faz. Isso sugere que a maneira como construímos palavras é mais direcional e hierárquica do que se pensava anteriormente, com um fluxo claro de uma palavra base para seus derivados, em vez de uma teia caótica de conexões mútuas.

O estudo também lançou luz sobre como diferentes línguas lidam com os mesmos conceitos. Embora todas as sete línguas do estudo criem novas palavras, elas o fazem com ferramentas e frequências diferentes. Por exemplo, os pesquisadores observaram como as línguas expressam a ideia de "fazer algo novamente". No francês, eles encontraram um padrão específico onde um prefixo é adicionado a um verbo para reverter uma ação, criando uma família inteira de palavras que espelha a original. No inglês, padrões semelhantes existem, mas são menos uniformes. O conjunto de dados mostrou que, embora a lógica subjacente da formação de palavras seja compartilhada, as regras específicas variam significativamente. Uma língua pode preferir combinar duas palavras existentes para fazer uma nova, enquanto outra prefere adicionar um pequeno final a uma única palavra. Os pesquisadores também descobriram que algumas formações de palavras são "invertidas". Às vezes, uma palavra mais curta é, na verdade, derivada de uma mais longa, mesmo que pareça que a mais curta deveria ser a raiz. Os dados ajudaram a identificar esses padrões reversos ao mostrar que eles ocorrem com muito menos frequência do que a direção padrão, permitindo que os pesquisadores identificassem essas exceções à regra.

Apesar da escala massiva do projeto, os pesquisadores tomam o cuidado de notar que seu recurso não é perfeito. Como os dados foram coletados automaticamente de um dicionário público, eles contêm alguns erros e inconsistências. Alguns pares de palavras que parecem relacionados podem não ser, e algumas definições podem estar ligeiramente incorretas. No entanto, o tamanho imenso da coleção significa que esses erros são raros o suficiente para que não distorçam o panorama geral. Os pesquisam estimam que a precisão dos pares de palavras é muito alta, com mais de 90 por cento das conexões nas seções de inglês e francês sendo corretas. O recurso foi desenhado para ser um ponto de partida para investigações futuras, um lugar onde outros cientistas possam testar suas próprias teorias contra uma vasta quantidade de dados do mundo real. Não é uma resposta final ao mistério da linguagem, mas é uma nova ferramenta poderosa que nos permite ver o cenário da formação de palavras com uma clareza que era impossível antes.

A criação do GLeMM representa uma mudança na forma como estudamos a linguagem, passando de exemplos pequenos e curados para uma exploração massiva impulsionada por dados. Ao tratar o dicionário como um corpus vivo de milhões de relações, os pesquisadores abriram uma janela para a arquitetura oculta da fala humana. Eles mostraram que, embora as línguas sejam diversas, elas seguem certos princípios estruturais que podem ser medidos e observados. As descobertas sugerem que a maneira como construímos palavras não é uma coleção aleatória de hábitos, mas um sistema estruturado com padrões claros, exceções e uma direção distinta. À medida que os pesquisadores planejam expandir este trabalho para incluir mais línguas e refinar seus métodos, este recurso promete aprofundar nossa compreensão da capacidade da mente humana de criar significado a partir do som. Ele nos lembra que cada nova palavra que falamos é parte de uma história vasta e interconectada e, agora, pela primeira vez, temos um mapa grande o suficiente para ver todo o território.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →