Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation
تُظهر هذه الورقة أن ترتيب أداء أطر عمل الوكيل المطور (developer-agent frameworks) حساس للغاية للغة التقييم والنموذج الأساسي للحكم (judge backbone)، مما يكشف عن عدم هيمنة نموذج واحد عبر جميع اللغات، وأن توطين تعليمات الحكم أمر بالغ الأهمية لضمان دقة التقييم متعدد اللغات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقوم بتوظيف فريق من المهندسين المعماريين الخبراء (الوكلاء البرمجيين للذكاء الاصطناعي) لبناء منزل. تريد معرفة ما إذا كانوا قد قاموا بعمل جيد. عادةً، سترسل مفتشًا واحدًا صارمًا (حكم الذكاء الاصطناعي) يتحدث الإنجليزية فقط ليفحص عملهم.
هذه الورقة البحثية تطرح سؤالاً بسيطاً ولكنه ثوري: ماذا لو كان المفتش يتحدث لغة مختلفة عن لغة المخططات الهندسية؟
اكتشف الباحثون أن اللغة التي يتحدث بها المفتش لا تغير فقط طريقة حديثهم، بل تغير تماماً من يعتقدون أنه المهندس الأفضل.
إليك تفصيل لنتائجهم باستخدام تشبيهات من الحياة اليومية:
1. مشكلة "اللكنة"
تخيل أن لديك اثنين من الطهاة المشهورين، الشيف GPT والشيف Gemini.
- عندما يتذوق حكم يتحدث الإنجليزية طعامهما، يحصل الشيف GPT على تقييم 5 نجوم، بينما يحصل الشيف Gemini على 3 نجوم.
- ولكن، عندما يتذوق حكم يتحدث العربية أو الهندية الطعام نفسه تماماً، تنقلب النتائج! فجأة، يحصل الشيف Gemini على 5 نجوم، وينخفض الشيف GPT إلى 3 نجوم.
الدرس المستفاد: "الأفضل" في الذكاء الاصطناعي ليس حقيقة عالمية. إنه يعتمد كلياً على اللغة التي يتحدث بها الشخص الذي يقيمهم. إذا اختبرتهم بالإنجليزية فقط، فقد تروج للذكاء الاصطناعي الخطأ لبقية العالم.
2. تجربة "المترجم مقابل العقل"
أجرى الباحثون تجربة رائعة لمعرفة سبب حدوث ذلك. لقد أخذوا نفس المهمة ونفس حكم الذكاء الاصطناعي، لكنهم غيروا التعليمات:
- السيناريو (أ) (التوطين الكامل): يحصل الحكم على وصف المهمة باللغة الهندية، وتكون تعليمات كيفية التقييم أيضاً باللغة الهندية.
- السيناريو (ب) (التوطين الجزئي): يكون وصف المهمة باللغة الهندية، لكن التعليمات حول كيفية التقييم لا تزال باللغة الإنجليزية.
النتيجة: انهار أداء الحكم في السيناريو (ب). كان الأمر أشبه بطلب من طباخ بارع أن يطبخ طبقاً هندياً معقداً، لكن مع إعطائه الوصفة بالإنجليزية بينما هو يتحدث الهندية فقط. لقد أصيب بالارتباك وفشل.
- الخلاصة: لا يمكنك مجرد ترجمة الواجب المنزلي؛ يجب عليك ترجمة تعليمات المعلم أيضاً. إذا لم تفعل ذلك، فسيضيع الذكاء الاصطناعي في الترجمة.
3. "الطالب القوي مقابل الطالب الضعيف"
بحثت الدراسة في ستة نماذج مختلفة من "أحكام" الذكاء الاصطناعي (النماذج الأساسية).
- الطلاب المتفوقون (GPT-4o وGemini): هؤلاء أذكياء بما يكفي لفهم الفروق الدقيقة. ولأنهم أذكياء، فهم يتفاعلون بشكل مختلف مع اللغات المختلفة. قد يكون أحدهم بارعاً في المنطق الإنجليزي ولكنه يعاني مع الفروق الدقيقة العربية، والآخر عكس ذلك. ترتيبهم يتقلب اعتماداً على اللغة.
- الطلاب المتعثرون (DeepSeek وQwen): كانت هذه النماذج مرتبكة جداً بمهام البرمجة لدرجة أنها فشلت في كل شيء تقريباً، بغض النظر عن اللغة المستخدمة. ولأنهم كانوا يفشلون بشدة، لم تكن اللغة تهمهم كثيراً؛ فقد كانوا ببساطة "سيئين" في كل اللغات.
- الدرس المستفاد: أنت لا ترى هذه التغيرات اللغوية إلا عندما يكون الذكاء الاصطناعي ذكياً بما يكفي ليكون له رأي.
4. مشكلة "الاتفاق"
طلب الباحثون من جميع الأحكام الستة تقييم نفس المشاريع البرمجية الـ 55.
- النتيجة: لم يتفقوا مع بعضهم البعض إلا نادراً. كان الأمر أشبه بسؤال لجنة من النقاد لتقييم لوحة فنية، وكل منهم أعطى درجة مختلفة تماماً عن الآخر.
- التشبيه: إذا سألت لجنة من الحكام لتقييم فيلم، وأحدهم أحبه بينما كرهه آخر، فلا يمكنك الوثوق بـ "متوسط" الدرجات. توضح الورقة أنه في برمجة الذكاء الاصطناعي، غالباً ما يكون "الدرجة" مجرد انعكاس لنموذج الذكاء الاصطناعي المحدد الذي كان هو الحكم في ذلك اليوم.
لماذا يهم هذا؟
حالياً، معظم اختبارات معايير الذكاء الاصطناعي تشبه دوري رياضي أحادي اللغة. فهي تختبر بالإنجليزية فقط.
- الخطر: إذا كنت تبني تطبيق ذكاء اصطناعي لشركة في الهند أو الشرق الأوسط، واختبرته فقط باستخدام حكم ذكاء اصطناعي يتحدث الإنجليزية، فقد تختار الأداة الخاطئة. قد تعتقد أن "النموذج أ" هو الأفضل لأنه فاز في البطولة الإنجليزية، لكن "النموذج ب" قد يكون هو البطل الفعلي في الهندية أو العربية.
الخلاصة النهائية
هذه الورقة هي بمثابة جرس إنذار: اللغة ليست مجرد إعداد؛ إنها متغير.
إذا كنت تريد معرفة ما إذا كان الذكاء الاصطناعي جيداً في البرمجة، فلا يمكنك سؤاله بالإنجليزية فقط. يجب عليك سؤاله باللغة التي سيُستخدم فيها فعلياً، ويجب أن تتأكد من أن "المعلم" الذي يقيمه يتحدث تلك اللغة بطلاقة أيضاً. وإلا، فأنت تلعب لعبة الحظ بتكنولوجيتك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.