← أحدث الأبحاث
💬 NLP

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

تُعد IndiaFinBench أول معيار متاح للجمهور صُمم لتقييم النماذج اللغوية الكبيرة على النصوص التنظيمية المالية الهندية، حيث تضم 406 أزواج من الأسئلة والأجوبة التي تم تعليقها من قبل خبراء من وثائق هيئة الأوراق المالية والبورصات الهندية (SEBI) والبنك المركزي الهندي (RBI)، والتي كشفت عن فجوات أداء كبيرة بين النماذج، لا سيما في الاستدلال العددي، بينما تفوقت بشكل كبير على الخطوط المرجعية البشرية غير المتخصصة.

المؤلفون الأصليون: Rajveer Singh Pall

نُشر 2026-04-22
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Rajveer Singh Pall

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوت أمين مكتبة فائق الذكاء، قد قرأ كل كتاب تقريبًا في العالم. تسأله سؤالاً عن مكتبة في نيويورك، فيجيب بدقة مثالية. ولكن بعد ذلك، تسأله سؤالاً عن مكتبة محددة وقديمة ومعقدة في الهند، مليئة بقواعد فريدة ومصطلحات محلية. فجأة، يتعثر الروبوت. إنه لا يعرف العادات المحلية، ويصاب بالارتباك بسبب الطريقة المحددة التي كُتبت بها القوانين الهندية.

تقدم هذه الورقة البحثية IndiaFinBench، وهو "اختبار" جديد مصمم لمعرفة مدى قدرة روبوتات الذكاء الاصطناعي هذه على التعامل مع العالم المعقد والخاص بـ اللوائح المالية الهندية.

إليك قصة الورقة البحثية، مقسمة إلى أجزاء بسيطة:

1. المشكلة: "الانحياز الغربي"

حتى الآن، كانت جميع اختبارات الذكاء الاصطناعي في مجال التمويل تشبه اختبارات القيادة التي تُجرى فقط على الطرق السريعة الأمريكية. لقد استخدمت قوانين أمريكية، وتقارير بنكية أمريكية، وأخباراً أمريكية.

  • الواقع: تمتلك الهند "طرقها السريعة" المالية الخاصة التي يديرها شرطيان رئيسيان للمرور: SEBI (لسوق الأسهم) و RBI (للبنك المركزي).
  • المشكلة: القواعد المالية الهندية فوضوية. فهي مليئة بالأرقام المخفية داخل الفقرات، وقواعد تتغير بمرور الوقت (مثل وصفة طعام يتم تحديثها كل عام)، وكلمات خاصة لا يعرفها إلا الخبراء الهنود. الاختبارات الحالية للذكاء الاصطناعي لم تتحقق مما إذا كانت الروبوتات قادرة على التعامل مع هذا "الارتباك" المحدد.

2. الحل: "اختبار القيادة الهندي"

قام المؤلفون ببناء IndiaFinBench، وهو امتحان جديد يتكون من 406 سؤالاً.

  • من أين جاءت الأسئلة؟ لقد بحثوا بعمق في 192 وثيقة رسمية من SEBI و RBI، تتراوح بين عامي 1992 و 2026.
  • ما نوع الأسئلة؟
    • اختبار "ماذا يعني هذا؟": هل يمكن للذكاء الاصطناعي قراءة قاعدة وإخبارك بالضبط بما يُسمح للبنك بفعله؟
    • اختبار "الرياضيات": هل يمكن للذكاء الاصطناعي إجراء العمليات الحسابية المخفية في النص؟ (مثلاً: "إذا كان لدى البنك هذا القدر من الأرباح، فكم يبلغ مقدار الأرباح التي يمكنه توزيعها؟")
    • اختبار "كاشف الكذب": هل يمكن للذكاء الاصطناعي اكتشاف ما إذا كانت قاعدتان مختلفتان تتعارضان مع بعضهما البعض؟
    • اختبار "السفر عبر الزمن": هل يمكن للذكاء الاصطناعي معرفة أي قاعدة كانت سارية في عام 2015 مقابل عام 2023، نظرًا لأن القواعد غالبًا ما يتم تحديثها؟

3. المشاركون في الامتحان: 12 روبوتاً مختلفاً

أخضع الباحثون 12 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي (الروبوتات) لهذا الاختبار. بعضها كانت عمالقة ضخمة (مثل Gemini 2.5 Flash و LLaMA-3.3-70B)، وبعضها كانت نماذج أصغر وأخف (مثل Gemma 4).

  • القواعد: كان على الروبوتات الإجابة باستخدام النص المقدم في السؤال فقط. لم يكن بإمكانهم استخدام "ذاكرتهم" من الإنترنت. هذا يضمن أنهم يقرؤون ويفهمون بالفعل، وليس مجرد التخمين.

4. النتائج: من نجح؟

كانت النتائج مفاجئة وكشفت عن ثلاث مجموعات متميزة:

  • الفئة العليا (طلاب الصف الأول - A):

    • تصدر Gemini 2.5 Flash القائمة بدقة بلغت حوالي 90%. لقد كان الأفضل في قراءة القواعد وإجراء العمليات الحسابية.
    • جاء Qwen3-32B و LLaMA-3.3-70B خلفه مباشرة، في تعادل شبه تام.
    • المفاجأة: حقق Llama 4 Scout 17B (روبوت أصغر بكثير) أداءً جيداً تماماً مثل الروبوت الضخم 70B. الأمر يشبه سيارة مدمجة تحقق نفس استهلاك الوقود الذي تحققه شاحنة ضخمة. هذا يشير إلى أن كيفية تدريب الروبوت أهم من مجرد "حجمه".
  • الفئة المتوسطة (طلاب الصف الثالث - C):

    • نماذج مثل GPT-OSS و Mistral تراوحت نتائجها حول 75-79%. لقد كانوا جيدين، لكنهم ارتكبوا أخطاء في أسئلة الرياضيات الصعبة وأسئلة السفر عبر الزمن.
  • الفئة الدنيا (طلاب الصف الأخير - F):

    • سجل Gemma 4 E4B (نموذج صغير جداً) حوالي 70%. لقد واجه صعوبة أكبر، خاصة في الرياضيات وفهم الجدول الزمني للقواعد.

المعيار البشري:
حتى الإنسان الذي ليس خبيراً مالياً لم يحصل إلا على 60%. هذا يثبت أن الاختبار صعب حقاً! فقد تفوق أفضل ذكاء اصطناعي (Gemini) على متوسط البشر بفارق كبير، لكن أسوأ ذكاء اصطناعي كان بالكاد أفضل من إنسان غير خبير.

5. أين فشلت الروبوتات؟ (تحليل الأخطاء)

حتى الروبوتات الأكثر ذكاءً واجهت نقاط ضعف:

  • مشكلة "السفر عبر الزمن": الجزء الأصعب بالنسبة للجميع تقريباً كان الاستدلال الزمني (Temporal Reasoning). فالقواعد الهندية غالباً ما تقول: "هذه القاعدة من عام 2010 تم استبدالها الآن بالقاعدة لعام 2022، ما لم تكن تندرج تحت استثناء عام 2015". لقد ارتبكت الروبوتات بشأن أي قاعدة تنطبق في أي وقت.
  • مشكلة "الرياضيات": كان الاستدلال الرقمي (Numerical Reasoning) هو الفارق الأكبر. الفجوة بين أفضل وأسوأ روبوت في الرياضيات كانت ضخمة (أكثر من 35%).
  • مشكلة "المعرفة": فشلت الروبوتات الصغيرة غالباً لأنها ببساطة لم تكن تعرف ماذا تعني كلمات مثل "AIF" أو "FEMA". لقد كانت تخمن.

6. لماذا هذا مهم؟

هذه الورقة البحثية هي بمثابة جرس إنذار. فهي تظهر أن:

  1. الحجم الواحد لا يناسب الجميع: الذكاء الاصطناعي المدرب على القوانين الأمريكية ليس بالضرورة جيداً في القوانين الهندية.
  2. الأكبر ليس دائماً الأفضل: يمكن لنموذج أصغر ومدرب جيداً أن يهزم نموذجاً ضخماً في مهام محلية محددة.
  3. نحن بحاجة إلى اختبارات محلية: إذا أردنا للذكاء الاصطناعي أن يساعد البنوك والمحامين والمنظمين الهنود، فنحن بحاجة لاختبارهم على بيانات هندية، وليس فقط على البيانات الأمريكية.

الخلا_صة:
لقد أطلق المؤلفون هذا الاختبار، والأسئلة، والإجابات للجمهور. إنهم يريدون من الجميع الاستمرار في اختبار الروبوتات الجديدة على القواعد الهندية حتى نتمكن من بناء ذكاء اصطناعي يفهم حقاً العالم المالي الهندي، وليس فقط العالم الغربي. الأمر يشبه منح الروبوتات رخصة قيادة محلية بدلاً من رخصة أمريكية فقط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →