When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use
تتقصى هذه الورقة مشكلة "عدم تطابق لغة الوسيط" (Argument Language Mismatch) في النماذج اللغوية الكبيرة متعددة اللغات عند استدعاء واجهة برمجة التطبيقات (API)، وتُثبت أن الضبط الدقيق الخاضع للإشراف (supervised fine-tuning) يعمل كخط أساس قوي لضمان اتساق لغة الوسيط، بينما لا يقدم التعلم التعزيزي (reinforcement learning) سوى تحسينات تدريجية تتركز أساساً في جوانب التعميم والموازنات متعددة الأهداف.