From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection
Este artigo apresenta um pipeline escalável e modular que combina filtragem baseada em regras e classificação por LLM para processar 527 milhões de publicações do Reddit, reduzindo com sucesso 124,6 milhões de tokens únicos para 1.021 candidatos a neologismos, dos quais 58,7% foram confirmados como inovações lexicais genuínas por meio de verificação manual.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem uma biblioteca contendo 527 milhões de livros (postagens do Reddit de 2005 a 2024). Em algum lugar dentro dessa montanha de texto, há algumas milhares de palavras totalmente novas que as pessoas acabaram de inventar. Seu objetivo é encontrá-las.
Se você tentasse ler cada palavra única dessa biblioteca para encontrar as novas, estaria ocupado pelo resto da sua vida. A maioria das palavras "estranhas" que você encontra não são invenções novas; são apenas erros de digitação, pessoas digitando duas palavras juntas sem espaço, ou palavras de outros idiomas.
Este artigo descreve um filtro inteligente e multifásico projetado para peneirar essa montanha de texto e entregar a você uma pilha pequena e gerenciável de "suspeitos" que são, de fato, novas palavras.
Veja como o pipeline funciona, passo a passo:
1. A Peneira Gigante (Filtragem Baseada em Regras)
Pense na primeira etapa como uma série de peneiras gigantes. Você despeja as 124 milhões de palavras únicas através delas, uma por uma.
- A Peneira "Palavra Antiga": Se uma palavra estava em um dicionário antes de 2015, ela é descartada. Só nos importamos com o que é novo.
- A Peneira "Sem Sentido": Se uma palavra parece uma pancada no teclado (por exemplo, "asdfgh"), um erro de digitação ou uma sequência de letras repetidas, ela é jogada fora.
- A Peneira "Cola": Se duas palavras ficaram grudadas sem espaço (como "datingapp"), o sistema tenta separá-las. Se foram apenas um erro, elas vão para o lixo.
- A Peneira "Estrangeira": Se o sistema acha que uma palavra está em espanhol ou tagalo, ele a separa (embora algumas palavras mistas complicadas passem pelo filtro).
O Resultado: Esta etapa é incrivelmente eficiente. Ela descarta 99,99% das palavras. Reduz os 124 milhões de candidatos para cerca de 175.000 palavras novas potenciais.
2. O Painel de Juízes (Classificação por LLM)
Agora temos 175.000 suspeitos. Ainda não podemos lê-los todos manualmente, então pedimos a um painel de quatro "juízes" de IA diferentes (Modelos de Linguagem Grandes) para examinar cada um.
- Os juízes são solicitados a classificar cada palavra em um dos quatro baldes:
- Neologismo: Uma palavra genuinamente nova (por exemplo, "doomscrolling").
- Entidade: Um nome de pessoa, marca ou lugar (por exemplo, "Elon").
- Estrangeiro: Uma palavra de outro idioma.
- Nenhum: Apenas um erro de digitação, um nome de usuário ou lixo.
- O Sistema de Votação: Para evitar que uma IA seja muito preguiçosa ou muito maluca, elas votam. Se a maioria concordar que uma palavra é um "Neologismo", ela avança para a próxima rodada. Se discordarem, a palavra é geralmente descartada para garantir segurança.
3. O Inspetor Final (Verificação)
Mesmo após a votação do painel de IA, ainda há cerca de 10.000 candidatos "Neologismo". Isso ainda é demais para um humano verificar rapidamente.
Portanto, um juiz final de IA, muito rigoroso (Claude), examina a lista novamente. Este juiz é extremamente conservador. Ele diz: "Se não tenho 100% de certeza de que esta é uma palavra nova, vou classificá-la como 'Nenhum'".
- Esta etapa reduz a lista de 10.000 para apenas 1.021 candidatos.
A Revelação Final
Os pesquisadores então pegaram essas 1.021 palavras finais e as verificaram manualmente.
- A Boa Notícia: 58,7% delas (599 palavras) eram invenções novas genuínas!
- A Má Notícia: O restante eram ou nomes de coisas (entidades), palavras estrangeiras que passaram pelo filtro, ou apenas erros.
Que Tipo de Palavras Novas Eles Encontraram?
O artigo descobriu que novas palavras são criadas de duas maneiras principais:
- Os "Seguidores de Regras": Pessoas adicionando prefixos ou sufixos a palavras existentes (como adicionar "-ismo" a "woke" para criar "wokeismo").
- Os "Quebradores de Regras": Pessoas juntando palavras ou modificando-as por diversão (como fundir "Barbie" e "Oppenheimer" para criar "Barbenheimer", ou mudar "thick" para "thiccest" para ênfase).
Por Que Isso Importa
A principal conquista do artigo não é apenas encontrar as palavras; é a compressão. Eles transformaram uma tarefa impossível para um humano (ler 124 milhões de palavras) em uma tarefa que um humano pode concluir em um dia (verificar 1.021 palavras).
O que o artigo NÃO faz:
- Não prevê o futuro da linguagem.
- Não corrige erros de digitação para usuários.
- Não funciona com frases como "touch grass" (ele encontra apenas palavras únicas).
- Não captura palavras que mudaram de significado, mas mantiveram a mesma grafia (como "Karen" tornando-se um insulto de gíria), porque o sistema acha que "Karen" é apenas um nome antigo.
Em resumo, esta é uma máquina de garimpo de ouro altamente eficiente. Ela escava através de uma montanha massiva de terra digital, filtra as pedras e a terra, e entrega a você um pequeno balde de pepitas de ouro (novas palavras) prontas para serem polidas por um especialista humano.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.