← Últimos artículos
💻 computer science

Sense-Augmented Corpus for Sanskrit-English Machine Translation: Corpus Construction, Model Fine-Tuning, and Evaluation

Este artículo aborda el desafío de la ambigüedad léxica en la traducción automática de sánscrito a inglés mediante la construcción de un corpus paralelo aumentado con sentidos utilizando LLM y un inventario de sentidos personalizado, demostrando que la incorporación explícita de información sobre el sentido de las palabras mejora significativamente la calidad de la traducción en diferentes arquitecturas de modelos.

Autores originales: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

Publicado 2026-09-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El lenguaje es más que una colección de palabras; es un sistema vivo donde el significado cambia dependiendo de la compañía que haga una palabra. En el estudio del lenguaje, una sola palabra puede usar muchos sombreros diferentes, un concepto conocido como polisemia. Para un lector humano, el contexto actúa como una guía, aclarando instantáneamente si una palabra se refiere a un objeto físico, una idea abstracta o una acción. Sin embargo, para las computadoras, esta tarea es notablemente difícil. Las máquinas suelen tener dificultades para distinguir entre estos diferentes significados, lo que conduce a traducciones que son gramaticalmente correctas pero semánticamente confundidas. Este problema es particularmente agudo para lenguas antiguas como el sánscrito, donde un solo término puede portar siglos de matices de significado, y para las cuales los recursos digitales son escasos. Cuando una máquina no logra captar el sentido pretendido de una palabra, la traducción resultante puede perder la esencia misma del texto original, convirtiendo una profunda declaración filosófica en una cadena de palabras sin sentido.

Investigadores del IIIT Hyderabad y de la Universidad Central de Sánscrito han abordado este desafío enseñando a las máquinas a prestar más atención al significado específico de las palabras antes de que intenten traducirlas. Su trabajo se centra en la creación de un nuevo tipo de datos de entrenamiento para la traducción de sánscrito a inglés. En lugar de simplemente alimentar a una computadora con pares de oraciones en sánscrito y sus equivalentes en inglés, el equipo enriqueció estos pares con etiquetas explícitas que identifican el sentido exacto de cada palabra en la oración. Utilizaron una poderosa herramienta de inteligencia artificial para actuar como un lexicógrafo digital, leyendo cada oración en sánscrito y seleccionando la definición correcta para cada palabra de un diccionario masivo, de forma muy similar a como lo haría un erudito humano. Este proceso resultó en un corpus "aumentado por sentido", un conjunto de datos donde la computadora no solo se le muestran las palabras, sino que también se le dice exactamente qué significan esas palabras en ese contexto específico.

El equipo probó este enfoque utilizando varios modelos de traducción diferentes, incluyendo motores de traducción especializados y modelos de lenguaje de gran tamaño de propósito general. Comenzaron viendo cómo se desempeñaban estos modelos sin ningún entrenamiento adicional, un estado conocido como inferencia de disparo cero (zero-shot inference). Como era de esperar, los modelos tuvieron dificultades, produciendo a menudo traducciones fragmentadas o que perdían completamente el punto del texto original. Por ejemplo, al traducir una oración sobre guerreros huyendo despavoridos, un modelo básico podría traducir una palabra para "fortaleza de montaña" simplemente como "bosque", perdiendo la imaginería crucial del épico original. Cuando los investigadores luego ajustaron estos modelos utilizando las oraciones paralelas estándar, las traducciones mejoraron significativamente, volviéndose más coherentes y fluidas. Sin embargo, el salto más dramático en la calidad ocurrió cuando los modelos fueron entrenados con los nuevos datos aumentados por sentido.

Los resultados mostraron que proporcionar información de sentido explícita mejoró consistentemente la calidad de las traducciones en todos los modelos probados. Las máquinas se volvieron mucho mejores eligiendo la palabra adecuada para la situación adecuada. En un caso específico, un modelo entrenado con los datos aumentados por sentido tradujo correctamente una frase que describía un "gran ejército" como un ejército, mientras que el mismo modelo entrenado solo con datos estándar había traducido incorrectamente como "tela", un error que alteraba completamente el significado de la escena. Otro ejemplo involucró una palabra que puede significar "partido" o "causa"; el modelo mejorado eligió correctamente "partido" para referirse a un grupo de personas, mientras que el modelo estándar eligió "causa", lo cual no encajaba con el contexto. Estas mejoras no fueron simples ajustes menores; representaron un cambio fundamental en cómo los modelos entendían el texto, permitiéndoles resolver ambigüedades que anteriormente habían causado su fallo.

El estudio también destacó que este método funciona bien incluso para modelos de inteligencia artificial de propósito general que no fueron diseñados originalmente para la traducción. Un modelo general, que típicamente tiene dificultades con pares de lenguas específicos, fue capaz de alcanzar niveles de rendimiento comparables a los de los motores de traducción dedicados una vez que fue entrenado con los datos aumentados por sentido. Esto sugiere que la clave para una mejor traducción no reside solo en tener más datos, sino en tener datos que sean semánticamente ricos. Los investigadores encontraron que los modelos aprendieron a tomar decisiones más apropiadas al contexto, reduciendo efectivamente el número de veces que repetían frases o generaban disparates, un error común en la traducción automática. Si bien el proceso de creación de este conjunto de datos enriquecido requirió una potencia computacional y un tiempo significativos, la recompensa fue una demostración clara de que enseñar a las máquinas a desambiguar palabras explícitamente conduce a traducciones que no solo son más precisas, sino también más fieles al espíritu de la lengua original.

El trabajo no pretende haber resuelto todos los problemas de la traducción automática, ni sugiere que los métodos actuales sean perfectos. Los investigadores señalaron que su inventario de sentidos era extremadamente detallado, lo que a veces hacía más difícil para los modelos elegir entre significados muy similares. También reconocieron que el proceso es computacionalmente costoso y que los errores en la asignación inicial de sentidos podrían afectar potencialmente la traducción final. Sin embargo, los hallazgos ofrecen un camino prometedor, particularmente para lenguas de bajos recursos donde los datos son escasos. Al demostrar que la información de sentido explícita puede cerrar la brecha entre la comprensión humana y el procesamiento de las máquinas, el estudio proporciona un plano para mejorar cómo las computadoras interactúan con los significados complejos y estratificados del lenguaje humano. El objetivo final no es solo traducir palabras, sino transmitir la intención precisa y el matiz del hablante, una tarea que requiere un nivel de comprensión que solo un entrenamiento cuidadoso y consciente del sentido puede proporcionar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →