Evaluating Prompt Scope and Demonstration Similarity in Local LLM Machine Translation
Este artículo evalúa cómo el alcance del prompt y las estrategias de selección de demostraciones afectan el rendimiento de la traducción automática de los LLM locales ajustados por instrucciones a través de múltiples familias lingüísticas, encontrando que, si bien los sistemas dedicados de MT siguen siendo superiores, el prompting de pocos disparos basado en incrustaciones y los prompts de alcance de familia pueden mejorar los modelos más grandes a pesar de introducir desafíos de salida estructurada para los más pequeños.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un amigo robot superinteligente que puede hablar casi cualquier idioma. Le pides que traduzca una frase del inglés al francés y lo hace de maravilla. Pero, ¿qué pasa si le pides que traduzca esa misma frase al francés, español e italiano todo a la vez? O ¿qué pasa si le das algunas frases de ejemplo para mostrarle cómo te gusta que se hagan las cosas antes de que empiece? Este artículo vive en el mundo de la Traducción Automática, que es la ciencia de enseñar a las computadoras a convertir un idioma en otro. Durante mucho tiempo, probamos a estos robots haciéndoles una pregunta simple a la vez: "Traduce esto". Pero la vida real es más desordenada. La gente suele pedir varios idiomas a la vez, o le da al robot una "hoja de trucos" de ejemplos para ayudarle a entender el estilo que desean. La gran pregunta es: ¿pedir más cosas a la vez, o darle al robot una hoja de trucos, realmente lo hace mejor, o simplemente lo confunde? Esto importa porque cada vez más personas están ejecutando estos "robots" (llamados Modelos de Lenguaje Extensos) en sus propias computadoras por privacidad y velocidad, en lugar de usar gigantescos servidores en la nube. Necesitamos saber si estos robots locales están listos para el mundo real, o si solo funcionan cuando la prueba es súper simple.
Los autores de este artículo decidieron poner a prueba a estos robots locales de una manera muy específica. No se limitaron a pedirles que tradujeran una frase a un idioma; trataron la forma en que se hace la pregunta como una variable. Probaron tres "robots locales" diferentes (modelos más pequeños que puedes ejecutar en tu propia computadora) contra algunas máquinas de traducción dedicadas y muy serias. Pidieron a los robots que tradujeran del inglés a nueve idiomas europeos diferentes, agrupados en dos familias: la familia "Romance" (como el francés, el español y el italiano) y la familia "Germánica" (como el alemán, el neerlandés y el sueco).
Los investigadores probaron tres estrategias diferentes para dar a los robots "hojas de trucos" (llamadas prompting de pocos disparos o few-shot prompting). Primero, le dieron al robot cero ejemplos. Segundo, le dieron cinco ejemplos aleatorios. Tercero, le dieron cinco ejemplos cuidadosamente seleccionados para que fueran muy similares a la frase que querían traducir, ya sea analizando las palabras utilizadas o utilizando un programa informático inteligente para encontrar significados similares. También probaron dos "alcances" diferentes: pedir la traducción de solo un idioma a la vez, o pedir la traducción de los cinco idiomas de una familia a la vez, con las respuestas organizadas ordenadamente en un formato JSON (una estructura de archivo de computadora específica).
Aquí está lo que encontraron, y es un poco agridulce. Primero, las máquinas de traducción dedicadas de la vieja escuela siguen siendo las campeonas. Son las más fiables, especialmente al traducir a lenguas germánicas. Los robots locales están mejorando y pueden mantenerse a la altura en algunos idiomas romances como el español y el portugués, pero aún no logran vencer a los profesionales.
Segundo, la estrategia de la "hoja de trucos" depende totalmente de qué robot estés usando. Para los dos robots locales más fuertes (mistral:latest y qwen2.5:14b), darles ejemplos realmente ayudó. Mejoraron su traducción cuando vieron ejemplos primero. Pero para el robot más pequeño (llama3.2:3b), darle ejemplos fue un desastre. Empeoró cuando tuvo que leer los ejemplos adicionales. Es como un estudiante que hace genial un examen cuando solo lee la pregunta, pero se confunde y comete errores cuando le muestras una respuesta de muestra primero.
Tercero, la forma en que haces la pregunta importa mucho. Cuando los investigadores pidieron a los robots que tradujeran a los cinco idiomas a la vez (el prompt de alcance de familia), los robots más grandes lo manejaron bien, produciendo una lista ordenada de traducciones para cada idioma. ¿Pero el robot más pequeño? Se desmoronó por completo. A menudo olvidaba traducir algunos de los idiomas, o no podía seguir las instrucciones para poner las respuestas en el formato correcto. Es como si el robot pequeño se sintiera abrumado por el gran pedido y simplemente soltara la mitad de los artículos.
El artículo también analizó si la forma "inteligente" de elegir ejemplos (encontrar las frases más similares) era mejor que simplemente elegir ejemplos aleatorios. Para los robots que podían usar ejemplos, los ejemplos inteligentes y similares ayudaron un poco más que los aleatorios. Pero la diferencia no fue enorme. Lo más importante era simplemente que el robot fuera lo suficientemente capaz de usar los ejemplos en absoluto. Si el robot era demasiado pequeño o estaba confundido, incluso los mejores ejemplos no podían salvarlo.
En resumen, este artículo sugiere que no podemos simplemente decir "la traducción por IA es buena" o "la traducción por IA es mala". Depende de cómo hagas la pregunta. Si quieres que un robot local traduzca para ti, necesitas elegir un modelo que sea lo suficientemente grande como para manejar instrucciones complejas y múltiples idiomas a la vez. Si eliges un modelo diminuto y le pides que haga demasiadas cosas a la vez, o que procese demasiada información adicional, podría fallar estrepitosamente. Los autores concluyen que cuando probamos estas herramientas de traducción, no debemos mirar solo la calidad de la traducción; también debemos verificar si el robot puede seguir instrucciones complejas y entregar exactamente lo que pedimos, sin dejar caer ninguna pelota.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.