← أحدث الأبحاث
💬 NLP

MAPS: A Multilingual Benchmark for Agent Performance and Security

تُعد MAPS مجموعة معيارية جديدة متعددة اللغات تُقيّم أداء وأمن أنظمة الذكاء الاصطناعي الوكيلية عبر إحدى عشرة لغة من خلال ترجمة المهام من أربعة معايير رئيسية (GAIA، وSWE-Bench، وMATH، وAgent Security)، مما يكشف أن الانتقال من اللغة الإنجليزية إلى لغات أخرى غالباً ما يؤدي إلى تدهور الموثوقية وزيادة المخاطر الأمنية.

المؤلفون الأصليون: Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً شخصياً عالي المهارة—شخصاً يمكنه حجز رحلات طيرانك، وإصلاح كود حاسوبك، وحل المسائل الرياضية المعقدة، والحفاظ على أمن حياتك الرقمية. الآن، تخيل أن هذا المساعد عبقري في اللغة الإنجليزية، ولكن بمجرد أن تتحدث إليه بالإسبانية أو الهندية أو اليابانية، يصبح فجأة أخرقاً، وناسيًا، والأسوأ من ذلك كله، غير قابل للتنبؤ به بشكل خطير.

هذه هي المشكلة التي تحاول هذه الورقة البحثية، MAPS، حلها.

المشكلة: "السقف الزجاجي اللغوي"

وكلاء الذكاء الاصطناي الحاليون (الذكاء الاصطناعي الذي لا يكتفي بالحديث فحسب، بل يقوم بالأفعال أيضاً) يتم تدريبهم واختبارهم في الغالب باللغة الإنجليزية. ولأن "الأدمغة" الكامنة وراء هؤلاء الوكلاء (نماذج اللغات الكبيرة) غالباً ما تكون أفضل في الإنجليزية، فإن الوكلاء يرثون ضعفاً خفياً: فهم يعانون عندما تأتي التعليمات بلغات أخرى.

الأمر يشبه توظيف طاهٍ عالمي المستوى يمكنه اتباع وصفة بدقة باللغة الإنجليزية، ولكن إذا أعطيته نفس الوصفة باللغة الفرنسية، فقد يستبدل الملح بالسكر بالخطأ أو ينسى تشغيل الفرن. وفي العالم الرقمي، قد يعني "نسيان الفرن" حدوث خطأ في معاملة بنكية أو ترك باب أمني مفتوحاً.

الحل: MAPS (اختبار الضغط متعدد اللغات)

ابتكر الباحثون MAPS، والتي ترمز إلى "معيار متعدد اللغات" (Multilingual Benchmark). فكر في MAPS كـ امتحان كفاءة عالمي لوكلاء الذكاء الاصطناعي.

بدلاً من مجرد طرح أسئلة بسيطة على الذكاء الاصطناعي، وضعوا الوكلاء تحت اختبار أربع عمليات محاكاة وظيفية مكثفة:

  1. المساعد في العالم الحقيقي (GAIA): هل يمكن للوكيل تصفح الويب والعثجد معلومات لحل مهمة حقيقية؟
  2. مهندس البرمجيات (SWE-Bench): هل يمكن للوكيل العثور على الأخطاء في كود الحاسوب وإصلاحها؟
  3. عالم الرياضيات (MATH): هل يمكن للوكيل حل مسائل رياضية رفيعة المستوى؟
  4. حارس الأمن (ASB): هل يمكن للوكيل مقاومة التعرض لـ "الخداع" أو "الاختراق" من قبل جهات سيئة؟

لم يكتفوا بفعل ذلك باللغة الإنجليزية فقط، بل ترجموا هذه الاختبارات إلى 11 لغة مختلفة (مثل العربية والصينية والألمانية والهندية) لمعرفة مدى صمود الوكلاء عالمياً.

لحظة الاستبصار: ماذا وجدوا؟

اكتشف الباحثون شيئاً حاسماً: كلما كانت المهمة أكثر "بشرية" و"إسهاباً في الكلام"، تعثر الذكاء الاصطناعي أكثر.

  • استثناء "الرياضيات والكود": عندما كانت المهام تعتمد في الغالب على الأرقام أو كود الحاسوب (والتي تبدو متشابهة في معظم اللغات)، كان الوكلاء بخير. الأمر يشبه موسيقياً يعزف نوتة موسيقية—النوتات هي نفسها بغض النظر عن اللغة التي تتحدث بها.
  • فخ "اللغة الطبيعية": عندما تطلبت المهام فهم تعليمات بشرية دقيقة (مثل "ابحث لي عن رحلة طيران ليست صاخبة جداً")، انخفض أداء الوكلاء بشكل حاد.
  • المخاطر الأمنية: والأمر الأكثر إثارة للقلق، هو أنهم وجدوا أن الوكلاء أصبحوا أقل أماناً في اللغات الأخرى. فعملية "كسر الحماية" (Jailbreak) (وهي خدعة لجعل الذكاء الاصطناعي يفعل شيئاً سيئاً) التي قد لا تنجح في الإنجليزية، قد تنجح تماماً في لغة أخرى. إنه يشبه حارس أمن يعرف كيف يكتشف لصاً يرتدي بدلة رسمية، ولكنه يسمح للص بأن يمر بجانبه ببسابطة إذا كان يرتدي نمطاً مختلفاً من الملابس.

لماذا يهمك هذا؟

بينما نتحرك نحو عالم يدير فيه وكلاء الذكاء الاصطناعي أموالنا، وجداول مواعيدنا، وبياناتنا، لا يمكننا تحمل وجود "تحيز لغوي" لديهم.

هذه الورقة البحثية هي بمثابة جرس إنذار لمطوري الذكاء الاصطناعي. إنها تقول: "إذا أردتم أن يكون الذكاء الاصطناعي الخاص بكم مواطناً عالمياً موثوقاً، فلا يكفي أن تعلموه ليكون عبقرياً في الإنجليزية؛ بل يجب أن تتأكدوا من بقائه عبقرياً في كل لغة يتحدث بها مستخدموه."

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →