← أحدث الأبحاث
💬 NLP

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

تقدم الورقة البحثية "Inspect India Evals"، وهو إطار عمل مفتوح المصدر للتقييم مبني على منصة Inspect AI التابعة للمعهد البريطاني لسلامة الذكاء الاصطناعي (UK AISI) لمعالجة نقص التقييمات ذات الصلة ثقافياً ولغوياً للنماذج اللغوية الكبيرة في الهند، وذلك عبر اختبار ستة معايير محددة عبر ست عشرة لغة، مما يكشف أن نماذج مثل Sarvam-M وGemma 2 تتفوق على نظيراتها الأكبر حجماً في المعرفة الثقافية الهندية والامتثال لمعايير السلامة.

المؤلفون الأصليون: Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

نُشر 2026-07-29
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك اشتريت للتو روبوتًا مساعدًا فائق الذكاء يمكنه التحدث إليك، وكتابة القصص، وحل المسائل الرياضية. أنت متحمس لإطلاقه في حيك، ولكن هناك عقبة: حيك عبارة عن سوق ضخم وصاخب حيث يتحدث الناس عشرات اللغات المختلفة، ويحتفلون بمهرجانات فريدة، ولهم تقاليدهم الراسخة الخاصة. إذا علمت هذا الروبوت فقط باستخدام كتب مكتوبة باللغة الإنجليزية عن الحياة في نيويورك أو لندن، فسيكون عالِمًا بارعًا ولكنه جار سيئ للغاية. قد يهين دون قصد أحد كبار السن المحليين، أو يفهم نكتة ثقافية بشكل خاطئ، أو والأسوأ من ذلك، يقدم نصيحة خطيرة لأنه لا "يفهم" القواعد المحلية. هذا هو عالم نماذج اللغات الكبيرة (LLMs) — وهي عقول ذكاء اصطناعي مدربة على كميات هائلة من النصوص. السؤال الكبير الذي يطرحه العلماء الآن هو: هل عقول الذكاء الاصطناعي هذه جاهزة لمساعدة الناس في أماكن مثل الهند، حيث الثقافة واللغات متنوعة للغاية؟

للإجابة على هذا، يحتاج الباحثون إلى طريقة لاختبار الروبوتات. عادةً، يستخدمون اختبارات قياسية مثل "MMLU" أو "TruthfulQA"، والتي تشبه اختبارات القيادة المصممة للطرق السريعة في أوروبا. لكن القيادة في الهند مختلفة؛ فالطرق أضيق، وقواعد المرور فريدة، والمعالم مختلفة تمامًا. إذا اختبرت سيارة فقط على الطرق السريعة الأوروبية، فلن تعرف ما إذا كانت تستطيع التعامل مع سوق شارع هندي فوضوي. تقدم هذه الورقة البحثية "اختبار قيادة" جديدًا مفتوح المصدر تم بناؤه خصيصًا للهند، يسمى Inspect India Evals. إنه يتحقق مما إذا كانت نماذج الذكاء الاصطناعي يمكنها التحدث بـ 16 لغة هندية مختلفة، وفهم الديناميكيات الاجتماعية الهندية (مثل نظام الطبقات المعقد والتنوع الديني)، والبقاء آمنة عند سؤالها أسئلة صعبة حول أنظمة الهوية الرقمية وتطبيقات الدفع في الهند.

الاختبار الكبير: خريطة جديدة للذكاء الاصطناعي

أدرك مؤلفو هذه الورقة، بالتعاون مع وزارة الإلكترونيات وتكنولوجيا المعلومات في الحكومة الهندية، أن اختبارات الذكاء الاصطناعي الحالية تفتقر إلى الدقة. لقد بنوا إطار عمل يسمى Inspect India Evals، وهو يشبه مسار عقبات مكون من ستة تحديات مصمم خصيصًا للسياق الهندي. بدلاً من مجرد السؤال، "هل يمكنك حل هذه المسألة الرياضية؟" سألوا، "هل يمكنك حل هذه المسألة الرياضية باللغة التاميلية؟" أو "هل يمكنك إخباري بكيفية التسجيل للحصول على هوية حكومية دون تعليم شخص ما كيفية تزويرها عن طريق الخطأ؟"

يتضمن إطار العمل ستة تحديات محددة:

  1. MMLU متعدد اللغات: اختبار معرفي تمت ترجمته إلى 11 لغة هندية (مثل الهندية والبنغالية والتاميلية) لمعرفة ما إذا كان الذكاء الاصطناعي يفهم الحقائق حقًا أم أنه يخمن فقط.
  2. BharatBBQ: اختبار للتحيز يتحقق مما إذا كان الذكاء الاصطناعي يحمل صورًا نمطية حول الطبقات أو الأديان أو المناطق الهندية، بدلاً من مجرد قضايا العرق أو النوع الاجتماعي الأمريكية.
  3. سلامة البنية التحتية الرقمية العامة (DPI): فحص سلامة "البنية التحتية الرقمية العامة" في الهند (مثل Aadhaar للهوية و UPI للمدفوعات). يختبر ما إذا كان الذكاء الاصطناعي يرفض المساعدة في عمليات الاحتيال ولكنه لا يزال يجيب على الأسئلة المفيدة.
  4. السلامة متعددة اللغات: التحقق مما إذا كان الذكاء الاصطناعي يقول "لا" للطلبات الضارة (مثل "كيف يمكنني اختراق بنك") حتى لو طُلب منه ذلك بلغة إقليمية.
  5. مقاومة الاختراق (Jailbreak): محاولة خداع الذكاء الاصطناعي لكسر قواعده باستخدام محادثات متعددة الخطوات بلغات مختلفة.
  6. المعرفة الثقافية الهندية: اختبار للحقائق الثقافية العميقة، من الدستور إلى سياسات الزراعة.

السباق: من اجتاز الاختبار؟

وضع الباحثون خمسة نماذج مختلفة من الذكاء الاصطناعي مفتوح المصدر في هذا المسار العقبات. تراوحت أحجام هذه النماذج من 8 مليارات إلى 32 مليار "معلمة" (فكر في هذه المعلمات كعدد الروابط في دماغ الذكاء الاصطناعي). لقد اختبروا نماذج مثل Sarvam-M 24B (نموذج يركز على الهند)، و Gemma 2 27B، و Qwen 2.5 32B، و DeepSeek-R1 14B، و Llama 3.1 8B.

إليكم ما وجدوه، وهو أمر مفاجئ نوعًا ما:

  • البطل المحلي يفوز: تفوق نموذج Sarvam-M 24B، الذي تم ضبطه خصيصًا للغات والثقافة الهندية، في الاختبار الإجمالي. حقق متوسط قدره 74.4%. كان جيدًا بشكل خاص في فهم الثقافة الهندية (بنسبة 60.0%) وفي التعامل مع أسئلة السلامة الرقمية بشكل مثالي (100%). حتى أنه تفوق على نماذج أكبر وأكثر قوة في المعرفة الثقافية.
  • نجم السلامة: جاء Gemma 2 27B في المركز الثاني بفارق ضئيل بمتوسط قدره 72.1%. كان حارس سلامة مثالي، حيث حصل على 100% في اختبارات التحيز والسلامة الرقمية، رغم أنه عانى قليلاً مع الحقائق الثقافية العميقة.
  • روبوت الاستنتاج يعاني: يشتهر DeepSeek-R1 14B بأنه نموذج "استنتاجي" يفكر بعمق قبل الإجابة. لقد نجح بامتياز في اختبار الاستنتاج الواقعي بلغات متعددة، محققًا 80.6%. ومع ذلك، فشل فشلًا ذريعًا في السلامة والمعرفة الثقافية، حيث سجل 20% فقط في السلامة الرقمية و 10% في الحقائق الثقافية. لقد كان مركزًا جدًا على "التفكير" لدرجة أنه نسي أن يكون آمنًا أو مدركًا ثقافيًا.
  • النماذج الكبيرة لم تفز: ومن المثير للاهتمام أن امتلاك المزيد من المعلمات (دماغ أكبر) لم يضمن الفوز. فقد سجل نموذج Qwen 2.5 32B (نموذج بـ 32 مليار معلمة) درجات أقل من النموذج الأصغر Sarvam-M 24B في العديد من المجالات. وهذا يشير إلى أنه بالنسبة للهند، فإن التدريب المتخصص أهم من الحجم الخام.

"مؤشر العدالة الهندي"

لجعل كل هذه الأرقام ذات معنى، ابتكر المؤلفون درجة واحدة تسمى مؤشر العدالة الهندي (IFI). تجمع هذه الدرجة بين السلامة، والتحيز، والدقة الواقعية في رقم واحد.

  • حصل Gemma 2 27B على أعلى درجة IFI وهي 83.1%.
  • تبعه Sarvam-M 24B عن قرب بنسبة 76.6%.
  • انخفض DeepSeek-R1 14B إلى 65.2%، مما يظهر أن كونك ذكيًا ليس كافيًا إذا لم تكن آمنًا.
  • سجل Llama 3.1 8B أدنى درجة بنسبة 51.6%.

الحكم: السلامة في كل مكان، والثقافة صعبة

كانت واحدة من أكثر النتائج إثارة للاهتمام هي أن جميع النماذج الخمسة كانت مثالية في رفض الطلبات الضارة في لغات متعددة. لقد سجلوا جميعًا 100% في اختبار "السلامة متعددة اللغات". سواء طُلب منهم القيام بشيء سيء بالإنجليزية أو الهندية أو التاميلية، فقد قالوا جميعًا "لا". هذه أخبار رائعة!

ومع ذلك، واجهت النماذج صعوبة كبيرة في المعرفة الثقافية الهندية. سجل النموذج المتخصص (Sarvam-M) نسبة 60%، بينما تراوحت النماذج الأخرى بين 10% و 30%. يشير هذا إلى أن التدريب العالمي القياسي للذكاء الاصطناعي ليس كافيًا؛ فأنت بحاجة إلى تدريب محدد على التاريخ الهندي، والمهرجانات، والهياكل الاجتماعية للحصول على النتيجة الصحيحة.

كما لاحظ المؤلفون وجود مقايضة: أظهر DeepSeek-R1 أن النماذج المصممة للاستنتاج المعقد يمكن أحيانًا خداعها لكسر قواعد السلامة (سجل 40% فقط في مقاومة الاختراق)، بينما كانت نماذج مثل Gemma و Sarvam أكثر صلابة (80% في المقاومة).

ماذا يعني هذا؟

تخلص الورقة البحثية إلى أنه لا يمكننا مجرد أخذ ذكاء اصطناعي تم تدريبه في الغرب وإلقائه في الهند. الأمر يشبه محاولة قيادة سيارة فورمولا 1 على طريق قرية طيني؛ قد تكون سريعة، لكنها ستتعثر أو تتحطم. تشير النتائج إلى أنه لكي يكون الذكاء الاصطناعي مفيدًا وآمنًا حقًا في الهند، فإنه يحتاج إلى ضبط متخصص للغات والثقافات المحلية.

يؤكد المؤلفون بحذر أن هذه النتائج تستند إلى دراسة "تجريبية" مع عدد صغير من أسئلة الاختبار (5 عينات فقط لكل مهمة). وبينما تبدو الاتجاهات واضحة، فإنهم يقترحون الحاجة إلى مزيد من الاختبار باستخدام مجموعات أكبر من الأسئلة للتأكد تمامًا. لكن الرسالة واضحة وجلية: النماذج المتخصصة والمدركة ثقافيًا هي مستقبل الذكاء الاصطناعي في الهند، ونحن بحاجة إلى اختبارات أفضل للتأكد من سلامتها قبل إطلاقها.

الكود والبيانات الخاصة بـ "اختبار القيادة" الجديد متاحة الآن للجميع لاستخدامها، حتى يتمكن المطورون من الاستمرار في بناء ذكاء اصطناعي أفضل وأكثر أمانًا لأكثر دول العالم تنوعًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →