← Últimos artículos
💬 NLP

When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

Este artículo investiga el problema del "Desajuste del Lenguaje de los Argumentos" en los LLM multilingües para la llamada a API y demuestra que el ajuste fino supervisado sirve como una base sólida para garantizar la consistencia del lenguaje de los argumentos, mientras que el aprendizaje por refuerzo ofrece solo mejoras incrementales principalmente en la generalización y en los equilibrios de objetivos múltiples.

Autores originales: Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

Publicado 2026-08-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot superinteligente a ser un asistente personal. Este robot, conocido como un Modelo de Lenguaje Extenso (LLM), es increíblemente bueno charlando, escribiendo historias y respondiendo preguntas en muchos idiomas diferentes. Pero hay un detalle: para ser verdaderamente útil, el robot necesita hacer más que solo hablar; necesita hablar con otros programas informáticos para lograr tareas. Piensa en estos programas como una vasta biblioteca de herramientas, como una calculadora, una aplicación del clima o un sistema de reserva de vuelos. Para usarlas, el robot tiene que hablar un lenguaje muy específico y rígido llamado "llamada a la API". Es como pedir una pizza: puedes decir "Quiero una pizza" en cualquier idioma que quieras, pero la cocina solo entiende un formato de ticket específico con ingredientes y tamaños exactos.

El gran problema que este artículo aborda es qué sucede cuando el robot acierta el pedido pero arruina el ticket. Si un hablante de español le pide al robot que reserve un vuelo, el robot podría elegir correctamente la herramienta "reservar vuelo", pero luego completar el destino con la palabra en inglés "Paris" en lugar de la palabra en español "París". Para un humano, esto parece un error pequeño e inofensivo. Pero para el programa informático que espera el pedido, es un desastre. El sistema se bloquea o rechaza la solicitud porque está esperando palabras en español. El artículo llama a este fallo "Desajuste de Lenguaje de Argumentos" (ALM, por sus siglas en inglés). Es un error frustrante donde el robot entiende qué quieres, pero falla al hablar el idioma de la herramienta que intentas usar. Los investigadores querían descubrir la mejor manera de entrenar a estos robots para que dejen de cometer este error específico, especialmente cuando están lidiando con muchos idiomas diferentes a la vez.

Los autores de este artículo decidieron jugar a ser detectives con dos métodos de entrenamiento diferentes para ver cuál de los dos corrige mejor este fallo de lenguaje. El primer método es como un profesor estricto que muestra al robot miles de ejemplos perfectos de cómo rellenar los tickets. Esto se llama Ajuste Fino Supervisado (SFT). El segundo método es más parecido a un videojuego: el robot intenta rellenar el ticket, recibe una puntuación basada en qué tan bien lo hizo y aprende de sus errores mediante el ensayo y error. Esto se llama Aprendizaje por Refuerzo (RL). Los investigadores construyeron un banco de pruebas especial utilizando un conjunto de datos de llamadas a herramientas traducidas a cinco idiomas (español, francés, italiano, neerlandés e inglés) para ver qué tan bien podían aprender los robots.

Aquí está el giro sorprendente que encontraron: el método del "profesor estricto" (SFT) fue en realidad la superestrella. Cuando simplemente le mostraron al robot ejemplos de llamadas a herramientas de español a español correctas, esto solucionó la gran mayoría de los errores de desajuste de lenguaje. De hecho, para muchas tareas, el simple método del profesor funcionó tan bien como, o a veces incluso mejor que, el complejo método del videojuego. El artículo sugiere que el robot no necesitaba "pensar" su camino hacia una solución; solo necesitaba ver suficientes ejemplos para aprender el patrón de que "si el usuario habla español, el ticket de la herramienta debe estar en español".

Sin embargo, el método del videojuego (específicamente una versión llamada GRPO) tenía algunos trucos especiales bajo la manga. Aunque no siempre superaba al método del profesor en la tarea básica, era mejor en dos cosas: manejar herramientas que el robot nunca había visto antes y mantener afiladas sus habilidades generales de razonamiento. Los investigadores descubrieron que el método del videojuego era como un estudiante más flexible que podía adaptarse a nuevas situaciones sin olvidar cómo resolver problemas matemáticos. También descubrieron que la "puntuación" que el robot recibía en el videojuego importaba mucho. Si la puntuación solo decía "Buen trabajo" o "Mal trabajo", el robot no aprendía mucho. Pero si la puntuación daba una retroalimentación detallada sobre qué palabra específica estaba mal, el robot aprendía mucho más rápido.

Al final, el artículo concluye que no siempre necesitamos los métodos de entrenamiento más complicados y costosos para solucionar estos fallos de lenguaje. Un conjunto de entrenamiento cuidadoso y bien diseñado con un profesor simple puede resolver la mayor parte del problema. El elegante entrenamiento de videojuego es útil para pulir las habilidades del robot y hacerlo más robusto en situaciones complicadas, pero no es la solución mágica que podríamos haber pensado. La idea clave es que, para hacer que los robots hablen el idioma correcto con sus herramientas, a veces la forma tradicional de mostrarles los ejemplos correctos es la herramienta más poderosa en la caja.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →