From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection
Este artículo presenta una pipeline escalable y modular que combina filtrado basado en reglas y clasificación mediante modelos de lenguaje grandes para procesar 527 millones de publicaciones de Reddit, reduciendo con éxito 124,6 millones de tokens únicos a 1.021 candidatos de neologismos, de los cuales el 58,7% fueron confirmados como innovaciones léxicas genuinas mediante verificación manual.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes una biblioteca que contiene 527 millones de libros (publicaciones de Reddit desde 2005 hasta 2024). En algún lugar dentro de esta montaña de texto, hay unos pocos miles de palabras completamente nuevas que la gente acaba de inventar. Tu objetivo es encontrarlas.
Si intentaras leer cada palabra individual de esa biblioteca para encontrar las nuevas, estarías ocupado por el resto de tu vida. La mayoría de las palabras "raras" que encuentras no son invenciones nuevas; son simplemente errores ortográficos, personas escribiendo dos palabras juntas sin espacio, o palabras de otros idiomas.
Este artículo describe un filtro inteligente y multifase diseñado para tamizar esa montaña de texto y entregarte una pila pequeña y manejable de "sospechosos" que son realmente palabras nuevas.
Así es como funciona el proceso, paso a paso:
1. El Tamiz Gigante (Filtrado Basado en Reglas)
Piensa en la primera etapa como una serie de tamices gigantes. Viertes las 124 millones de palabras únicas a través de ellos, uno por uno.
- El Tamiz de "Palabra Vieja": Si una palabra ya estaba en un diccionario antes de 2015, se descarta. Solo nos importa lo nuevo.
- El Tamiz de "Sin Sentido": Si una palabra parece una golpiza en el teclado (por ejemplo, "asdfgh"), un error ortográfico o una cadena de letras repetidas, se tira a la basura.
- El Tamiz de "Pegamento": Si dos palabras se pegaron sin espacio (como "datingapp"), el sistema intenta separarlas. Si eran simplemente un error, van a la basura.
- El Tamiz de "Extranjero": Si el sistema cree que una palabra está en español o tagalo, la aparta (aunque algunas palabras mixtas complicadas logran colarse).
El Resultado: Esta etapa es increíblemente eficiente. Descarta el 99,99% de las palabras. Reduce los 124 millones de candidatos a aproximadamente 175.000 palabras nuevas potenciales.
2. El Panel de Jueces (Clasificación por LLM)
Ahora tenemos 175.000 sospechosos. Aún no podemos leerlos todos manualmente, así que pedimos a un panel de cuatro "jueces" de IA diferentes (Modelos de Lenguaje Grandes) que examinen cada uno.
- Se pide a los jueces que clasifiquen cada palabra en una de cuatro categorías:
- Neologismo: Una palabra nueva genuina (por ejemplo, "doomscrolling").
- Entidad: Un nombre de persona, marca o lugar (por ejemplo, "Elon").
- Extranjero: Una palabra de otro idioma.
- Ninguna: Simplemente un error ortográfico, un nombre de usuario o basura.
- El Sistema de Votación: Para evitar que una IA sea demasiado perezosa o demasiado loca, votan. Si la mayoría coincide en que una palabra es un "Neologismo", pasa a la siguiente ronda. Si no están de acuerdo, la palabra generalmente se descarta por seguridad.
3. El Inspector Final (Verificación)
Incluso después de que el panel de IA vote, todavía hay unas 10.000 candidatas "Neologismo". Eso sigue siendo demasiado para que un humano las verifique rápidamente.
Así que un juez final de IA muy estricto (Claude) examina la lista nuevamente. Este juez es extremadamente conservador. Dice: "Si no estoy 100% seguro de que esta es una palabra nueva, la llamaré 'Ninguna'".
- Este paso reduce la lista de 10.000 a solo 1.021 candidatos.
El Revelado Final
Los investigadores luego tomaron estas 1.021 palabras finales y las verificaron a mano.
- La Buena Noticia: El 58,7% de ellas (599 palabras) eran invenciones nuevas genuinas.
- La Mala Noticia: El resto eran nombres de cosas (entidades), palabras extranjeras que se colaron, o simplemente errores.
¿Qué Tipo de Palabras Nuevas Encontraron?
El artículo descubrió que las palabras nuevas se crean de dos maneras principales:
- Los "Seguidores de Reglas": Personas que añaden prefijos o sufijos a palabras existentes (como añadir "-ismo" a "woke" para hacer "wokeismo").
- Los "Transgresores de Reglas": Personas que unen palabras o las modifican por diversión (como fusionar "Barbie" y "Oppenheimer" para hacer "Barbenheimer", o cambiar "thick" por "thiccest" para énfasis).
Por Qué Esto Importa
El logro principal del artículo no es solo encontrar las palabras; es la compresión. Tomaron una tarea que era imposible para un humano (leer 124 millones de palabras) y la comprimieron en una tarea que un humano puede terminar en un día (verificar 1.021 palabras).
Lo que el artículo NO hace:
- No predice el futuro del lenguaje.
- No corrige errores ortográficos para los usuarios.
- No funciona con frases como "touch grass" (solo encuentra palabras individuales).
- No detecta palabras que cambiaron de significado pero mantuvieron la misma ortografía (como "Karen" convirtiéndose en un insulto de jerga), porque el sistema piensa que "Karen" es simplemente un nombre antiguo.
En resumen, esto es una máquina de extracción de oro altamente eficiente. Excava a través de una montaña masiva de tierra digital, filtra las rocas y la tierra, y te entrega un pequeño cubo de pepitas de oro (palabras nuevas) listo para que un experto humano las pulimente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.