← Últimos artículos
💻 computer science

Code-Mixed Corpora for Indian Social Media: Baselines and Insights for Hinglish Language Identification

Este artículo presenta una línea base ligera de TF-IDF a nivel de carácter y Regresión Logística para la identificación de lenguaje Hinglish a nivel de token que logra un 95.92% de precisión en el conjunto de datos COMI-LINGUA, superando a los modelos multilingües por aproximadamente un 7% al tiempo que proporciona un análisis de errores crítico y una hoja de ruta para futuras tecnologías de lenguaje inclusivo en la India.

Autores originales: Kavita Srivastava

Publicado 2026-08-13
📖 3 min de lectura☕ Lectura para el café

Autores originales: Kavita Srivastava

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una gigantesca y bulliciosa plaza global. En esta plaza, personas de diferentes países están charlando, pero muchos de ellos hablan un dialecto híbrido y único. En la India, este dialecto se llama "Hinglish", una mezcla animada de hindi e inglés que a menudo se escribe utilizando el alfabeto romano (las mismas letras que usamos para el inglés). Es el lenguaje de los memes, los grupos de WhatsApp y los comentarios en las redes sociales. Sin embargo, enseñar a las computadoras a entender esta mezcla es como intentar enseñarle a un robot a clasificar una pila de piezas de Lego mezcladas donde algunas piezas están pintadas con palabras en hindi, otras con inglés, y muchas son simplemente borrosas o se escriben de forma diferente según la persona. Este campo de estudio se llama Procesamiento de Lenguaje Natural (NLP), y la tarea específica de determinar a qué idioma pertenece cada palabra en una frase mixta se llama Identificación de Idioma (LID). Esto es importante porque si las computadoras no pueden entender cómo habla la gente real, no pueden construir herramientas útiles como traductores o motores de búsqueda que funcionen para todos, especialmente en un lugar lingüísticamente diverso como la India.

Este artículo aborda el complicado problema de enseñar a las computadoras a distinguir entre palabras en hindi e inglés cuando están mezcladas en un texto en Hinglish. Los investigadores notaron que los modelos de IA gigantes y sofisticados que todo el mundo está usando actualmente (como mBERT y XLM-R) en realidad tienen dificultades con esta tarea específica. Estos grandes modelos, entrenados principalmente con libros limpios de un solo idioma, se confunden con la realidad desordenada de las redes sociales, donde la ortografía cambia constantemente y las palabras cambian de idioma a mitad de la frase. Para solucionar esto, el autor no construyó un monstruo más grande y complejo; en su lugar, construyó una herramienta sencilla y ligera. Utilizó un conjunto de datos llamado COMI-LINGUA, que contiene más de 100,000 ejemplos etiquetados por expertos de Hinglish, para entrenar un sistema directo. Este sistema observa pequeños fragmentos de letras (n-gramas de caracteres) y utiliza una técnica matemática básica llamada Regresión Logística para adivinar si una palabra es hindi o inglés.

Los resultados fueron sorprendentemente efectivos. El modelo simple logró una precisión del 96.06% en un conjunto de validación y del 95.92% en un conjunto de prueba, con una puntuación macro-F1 de 0.9509. Esto es aproximadamente un 7% mejor que el rendimiento de esos modelos multilingües masivos y complejos. El autor sugiere que para este trabajo específico, un enfoque de "mazo" no es necesario; un escalpelo preciso y bien diseñado funciona mejor. Sin embargo, también descubrieron que el sistema no es perfecto. A través del análisis de errores, descubrieron tres cosas principales que todavía confunden a la computadora: palabras cortas que se ven iguales en ambos idiomas (como "is" o "me"), la misma palabra en hindi escrita de muchas formas diferentes (como "acha", "achha" o "achaa"), y palabras en inglés tomadas prestadas en frases en hindi (como "party" o "school") que confunden al sistema cuando el texto circundante es hindi. El artículo concluye que, si bien los modelos simples basados en caracteres son un punto de partida sólido y reproducible, el trabajo futuro debe centrarse en comprender el contexto de la frase completa y manejar estas variaciones desordenadas de ortografía para dominar verdaderamente el Hinglish.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →